본문으로 이동

Llama.cpp

Conaonda Wiki
Admina7ec671ac513 (토론 | 기여)님의 2026년 8월 20일 (목) 13:18 판 (migrate: import legacy Wiki content to Vultr)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

llama.cpp는 대규모 언어 모델 추론을 C/C++로 구현한 오픈소스 프로젝트이다. Georgi Gerganov가 2023년 3월 10일에 공개했으며, 메타의 LLaMA 모델을 순수 C/C++로 재구현해 클라우드 GPU 없이 개인용 하드웨어에서 실행할 수 있게 한 것이 특징이다. 로컬 AI 추론의 사실상 표준 기반으로, Ollama, LM Studio 등 많은 로컬 추론 도구가 이 프로젝트를 사용한다.

개요

llama.cpp는 Ggml 텐서 라이브러리를 기반으로 작성되었다. 모델을 GGUF 형식 파일로 읽어 CPU·GPU에서 추론하며, 양자화된 모델을 지원해 메모리가 제한된 환경에서도 대규모 모델을 실행할 수 있다. GPU 백엔드로는 CUDA, Metal, Vulkan, SYCL, OpenCL 등을 지원한다.

공개 직후 소비자용 하드웨어에서의 실행 데모로 큰 주목을 받았으며, 이후 Ggml-org 조직으로 이전되어 관리되고 있다. 현재는 ggml.ai 팀이 Hugging Face에 합류하면서 오픈소스로 계속 개발 중이다.

주요 기능

  • C/C++ 기반이라 외부 의존성이 적다.
  • CPU·GPU 백엔드를 선택해 실행할 수 있다.
  • GGUF 형식의 모델 파일을 지원한다.
  • 정수 양자화로 모델 크기와 메모리 사용량을 줄일 수 있다.
  • 추론 서버와 REST API, 다양한 모델 아키텍처를 지원한다.

생태계

llama.cpp는 로컬 추론 도구들의 기반으로 널리 사용된다. Ollama, LM Studio, GPT4All, koboldcpp 등이 llama.cpp를 사용하거나 호환된다. GitHub에서 십만 개가 넘는 스타를 받은 대표적인 오픈소스 프로젝트이다.

함께 보기

  • Ggml — 기반 텐서 라이브러리
  • GGUF — 모델 파일 형식
  • Ggml-org — 프로젝트를 관리하는 GitHub 조직
  • Ollama — llama.cpp 기반 로컬 추론 도구
  • Georgi Gerganov — 창시자

출처