본문으로 이동

모델 서빙

Conaonda Wiki
Admina7ec671ac513 (토론 | 기여)님의 2026년 8월 20일 (목) 13:19 판 (migrate: import legacy Wiki content to Vultr)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

모델 서빙은 학습된 머신 러닝 모델을 애플리케이션에서 사용할 수 있도록 API나 배치 작업의 형태로 제공하는 과정이다. MLOps에서 모델을 운영 환경에 배포하는 핵심 단계이다.

방식

  • 실시간 서빙: 낮은 지연 시간으로 개별 요청에 예측을 반환 (REST·gRPC API)
  • 배치 서빙: 대량 데이터를 주기적으로 처리
  • 엣지·로컬 서빙: 모바일·임베디드·개인 하드웨어에서 실행

추론 성능을 위해 양자화·배칭·캐싱 같은 최적화가 사용되며, GGUF·llama.cpp 같은 로컬 추론 스택도 서빙 방식의 하나로 볼 수 있다. GPU 서버 기반 서빙에는 TensorRT, Triton Inference Server 등이 널리 쓰인다.

함께 보기

출처