본문으로 이동
주 메뉴
주 메뉴
사이드바로 이동
숨기기
둘러보기
대문
최근 바뀜
임의 문서로
미디어위키 도움말
특수 문서 목록
Conaonda Wiki
검색
검색
외관
로그인
개인 도구
로그인
Llama.cpp 문서 원본 보기
문서
토론
한국어
읽기
원본 보기
역사 보기
도구
도구
사이드바로 이동
숨기기
작업
읽기
원본 보기
역사 보기
일반
여기를 가리키는 문서
가리키는 글의 최근 바뀜
문서 정보
외관
사이드바로 이동
숨기기
←
Llama.cpp
문서 편집 작업을 수행할 권한이 없습니다. 다음 이유를 확인해주세요:
요청한 작업은 다음 권한을 가진 사용자에게 제한됩니다:
사용자
.
문서의 원본을 보거나 복사할 수 있습니다.
'''llama.cpp'''는 대규모 언어 모델 추론을 C/C++로 구현한 오픈소스 프로젝트이다. [[Georgi Gerganov]]가 2023년 3월 10일에 공개했으며, 메타의 LLaMA 모델을 순수 C/C++로 재구현해 클라우드 GPU 없이 개인용 하드웨어에서 실행할 수 있게 한 것이 특징이다. 로컬 AI 추론의 사실상 표준 기반으로, [[Ollama]], LM Studio 등 많은 로컬 추론 도구가 이 프로젝트를 사용한다. == 개요 == llama.cpp는 [[Ggml]] 텐서 라이브러리를 기반으로 작성되었다. 모델을 [[GGUF]] 형식 파일로 읽어 CPU·GPU에서 추론하며, 양자화된 모델을 지원해 메모리가 제한된 환경에서도 대규모 모델을 실행할 수 있다. GPU 백엔드로는 CUDA, Metal, Vulkan, SYCL, OpenCL 등을 지원한다. 공개 직후 소비자용 하드웨어에서의 실행 데모로 큰 주목을 받았으며, 이후 [[Ggml-org]] 조직으로 이전되어 관리되고 있다. 현재는 [[ggml]].ai 팀이 [[Hugging Face]]에 합류하면서 오픈소스로 계속 개발 중이다. == 주요 기능 == * C/C++ 기반이라 외부 의존성이 적다. * CPU·GPU 백엔드를 선택해 실행할 수 있다. * [[GGUF]] 형식의 모델 파일을 지원한다. * 정수 양자화로 모델 크기와 메모리 사용량을 줄일 수 있다. * 추론 서버와 REST API, 다양한 모델 아키텍처를 지원한다. == 생태계 == llama.cpp는 로컬 추론 도구들의 기반으로 널리 사용된다. [[Ollama]], LM Studio, GPT4All, koboldcpp 등이 llama.cpp를 사용하거나 호환된다. GitHub에서 십만 개가 넘는 스타를 받은 대표적인 오픈소스 프로젝트이다. == 함께 보기 == * [[Ggml]] — 기반 텐서 라이브러리 * [[GGUF]] — 모델 파일 형식 * [[Ggml-org]] — 프로젝트를 관리하는 GitHub 조직 * [[Ollama]] — llama.cpp 기반 로컬 추론 도구 * [[Georgi Gerganov]] — 창시자 == 출처 == * [https://github.com/ggml-org/llama.cpp llama.cpp 공식 저장소] * [https://en.wikipedia.org/wiki/Llama.cpp 위키백과: Llama.cpp] * [https://huggingface.co/ggml-org Hugging Face: ggml-org] [[분류:머신 러닝]] [[분류:C++ 소프트웨어]] [[분류:오픈 소스]]
Llama.cpp
문서로 돌아갑니다.
검색
검색
Llama.cpp 문서 원본 보기
새 주제