<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Llama.cpp</id>
	<title>Llama.cpp - 편집 역사</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Llama.cpp"/>
	<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Llama.cpp&amp;action=history"/>
	<updated>2026-08-20T13:28:26Z</updated>
	<subtitle>이 문서의 편집 역사</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.conaondaapps.com/index.php?title=Llama.cpp&amp;diff=30&amp;oldid=prev</id>
		<title>Admina7ec671ac513: migrate: import legacy Wiki content to Vultr</title>
		<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Llama.cpp&amp;diff=30&amp;oldid=prev"/>
		<updated>2026-08-20T04:18:43Z</updated>

		<summary type="html">&lt;p&gt;migrate: import legacy Wiki content to Vultr&lt;/p&gt;
&lt;p&gt;&lt;b&gt;새 문서&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;llama.cpp&amp;#039;&amp;#039;&amp;#039;는 대규모 언어 모델 추론을 C/C++로 구현한 오픈소스 프로젝트이다. [[Georgi Gerganov]]가 2023년 3월 10일에 공개했으며, 메타의 LLaMA 모델을 순수 C/C++로 재구현해 클라우드 GPU 없이 개인용 하드웨어에서 실행할 수 있게 한 것이 특징이다. 로컬 AI 추론의 사실상 표준 기반으로, [[Ollama]], LM Studio 등 많은 로컬 추론 도구가 이 프로젝트를 사용한다.&lt;br /&gt;
&lt;br /&gt;
== 개요 ==&lt;br /&gt;
llama.cpp는 [[Ggml]] 텐서 라이브러리를 기반으로 작성되었다. 모델을 [[GGUF]] 형식 파일로 읽어 CPU·GPU에서 추론하며, 양자화된 모델을 지원해 메모리가 제한된 환경에서도 대규모 모델을 실행할 수 있다. GPU 백엔드로는 CUDA, Metal, Vulkan, SYCL, OpenCL 등을 지원한다.&lt;br /&gt;
&lt;br /&gt;
공개 직후 소비자용 하드웨어에서의 실행 데모로 큰 주목을 받았으며, 이후 [[Ggml-org]] 조직으로 이전되어 관리되고 있다. 현재는 [[ggml]].ai 팀이 [[Hugging Face]]에 합류하면서 오픈소스로 계속 개발 중이다.&lt;br /&gt;
&lt;br /&gt;
== 주요 기능 ==&lt;br /&gt;
&lt;br /&gt;
* C/C++ 기반이라 외부 의존성이 적다.&lt;br /&gt;
* CPU·GPU 백엔드를 선택해 실행할 수 있다.&lt;br /&gt;
* [[GGUF]] 형식의 모델 파일을 지원한다.&lt;br /&gt;
* 정수 양자화로 모델 크기와 메모리 사용량을 줄일 수 있다.&lt;br /&gt;
* 추론 서버와 REST API, 다양한 모델 아키텍처를 지원한다.&lt;br /&gt;
&lt;br /&gt;
== 생태계 ==&lt;br /&gt;
llama.cpp는 로컬 추론 도구들의 기반으로 널리 사용된다. [[Ollama]], LM Studio, GPT4All, koboldcpp 등이 llama.cpp를 사용하거나 호환된다. GitHub에서 십만 개가 넘는 스타를 받은 대표적인 오픈소스 프로젝트이다.&lt;br /&gt;
&lt;br /&gt;
== 함께 보기 ==&lt;br /&gt;
&lt;br /&gt;
* [[Ggml]] — 기반 텐서 라이브러리&lt;br /&gt;
* [[GGUF]] — 모델 파일 형식&lt;br /&gt;
* [[Ggml-org]] — 프로젝트를 관리하는 GitHub 조직&lt;br /&gt;
* [[Ollama]] — llama.cpp 기반 로컬 추론 도구&lt;br /&gt;
* [[Georgi Gerganov]] — 창시자&lt;br /&gt;
&lt;br /&gt;
== 출처 ==&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/ggml-org/llama.cpp llama.cpp 공식 저장소]&lt;br /&gt;
* [https://en.wikipedia.org/wiki/Llama.cpp 위키백과: Llama.cpp]&lt;br /&gt;
* [https://huggingface.co/ggml-org Hugging Face: ggml-org]&lt;br /&gt;
&lt;br /&gt;
[[분류:머신 러닝]]&lt;br /&gt;
[[분류:C++ 소프트웨어]]&lt;br /&gt;
[[분류:오픈 소스]]&lt;/div&gt;</summary>
		<author><name>Admina7ec671ac513</name></author>
	</entry>
</feed>