본문으로 이동

모델 서빙

Conaonda Wiki

모델 서빙은 학습된 머신 러닝 모델을 애플리케이션에서 사용할 수 있도록 API나 배치 작업의 형태로 제공하는 과정이다. MLOps에서 모델을 운영 환경에 배포하는 핵심 단계이다.

방식

  • 실시간 서빙: 낮은 지연 시간으로 개별 요청에 예측을 반환 (REST·gRPC API)
  • 배치 서빙: 대량 데이터를 주기적으로 처리
  • 엣지·로컬 서빙: 모바일·임베디드·개인 하드웨어에서 실행

추론 성능을 위해 양자화·배칭·캐싱 같은 최적화가 사용되며, GGUF·llama.cpp 같은 로컬 추론 스택도 서빙 방식의 하나로 볼 수 있다. GPU 서버 기반 서빙에는 TensorRT, Triton Inference Server 등이 널리 쓰인다.

함께 보기

출처