<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=%EB%B9%84%EC%A0%84_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8</id>
	<title>비전 언어 모델 - 편집 역사</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=%EB%B9%84%EC%A0%84_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8"/>
	<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=%EB%B9%84%EC%A0%84_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8&amp;action=history"/>
	<updated>2026-08-20T16:09:50Z</updated>
	<subtitle>이 문서의 편집 역사</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.conaondaapps.com/index.php?title=%EB%B9%84%EC%A0%84_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8&amp;diff=66&amp;oldid=prev</id>
		<title>Admina7ec671ac513: migrate: import legacy Wiki content to Vultr</title>
		<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=%EB%B9%84%EC%A0%84_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8&amp;diff=66&amp;oldid=prev"/>
		<updated>2026-08-20T04:19:17Z</updated>

		<summary type="html">&lt;p&gt;migrate: import legacy Wiki content to Vultr&lt;/p&gt;
&lt;p&gt;&lt;b&gt;새 문서&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;비전 언어 모델&amp;#039;&amp;#039;&amp;#039;(Vision-Language Model, VLM)은 이미지와 텍스트를 함께 처리할 수 있도록 설계된 머신 러닝 모델이다. 이미지 이해, 텍스트-이미지 상호 연관, 시각적 질의응답(VQA) 등의 과제를 수행할 수 있다.&lt;br /&gt;
&lt;br /&gt;
== 개요 ==&lt;br /&gt;
기존의 컴퓨터 비전은 이미지 분류와 같이 텍스트를 다루지 않는 경우가 많았다. 비전 언어 모델은 이미지 인코더와 텍스트 모델을 결합하여 두 모달을 함께 이해하며, 이미지와 언어의 상호 작용이 필요한 과제에서 사용된다. 최근 거대 언어 모델의 발전을 기반으로 많은 VLM이 생성형 및 이해 기능을 함께 제공하고 있다.&lt;br /&gt;
&lt;br /&gt;
== 주요 모델 ==&lt;br /&gt;
&lt;br /&gt;
* CLIP — 이미지와 텍스트를 공통 임베딩 공간으로 매핑&lt;br /&gt;
* [[Florence-2]] — 프롬프트 기반 통합 비전 모델&lt;br /&gt;
* LLaVA — 비전 인코더와 대형 언어 모델을 결합한 VLM&lt;br /&gt;
* BLIP / BLIP-2 — 이미지 캡셔닝 및 VQA 용 모델&lt;br /&gt;
* GPT-4V — 상용 홝식 모델의 비전 기능&lt;br /&gt;
&lt;br /&gt;
== 활용 분야 ==&lt;br /&gt;
&lt;br /&gt;
=== 이미지 캡셔닝 및 주석 ===&lt;br /&gt;
이미지의 내용을 자동으로 설명하고 메타데이터를 생성하는 데 사용된다.&lt;br /&gt;
&lt;br /&gt;
=== 시각적 질의응답(VQA) ===&lt;br /&gt;
이미지에 대한 질문에 답하는 기능으로, 문서 이해, 교육, 상품 안내 등에 활용된다.&lt;br /&gt;
&lt;br /&gt;
=== 텍스트 기반 이미지 검색 ===&lt;br /&gt;
대규모 이미지 컴라이러리에서 내용 기반 검색을 제공한다.&lt;br /&gt;
&lt;br /&gt;
=== 로보틱스 및 자율주행 ===&lt;br /&gt;
시각 인식과 언어 이해가 함께 필요한 제어로직에 활용된다.&lt;br /&gt;
&lt;br /&gt;
== 함께 보기 ==&lt;br /&gt;
&lt;br /&gt;
* [[Florence-2]] — 프롬프트 기반 통합 비전 모델&lt;br /&gt;
* [[트랜스포머]] — 많은 VLM의 기반 아키텍처&lt;br /&gt;
* [[객체 탐지]] — 비전 모델이 수행하는 주요 태스크&lt;br /&gt;
&lt;br /&gt;
== 출처 ==&lt;br /&gt;
&lt;br /&gt;
* [https://openai.com/research/clip CLIP (OpenAI)]&lt;br /&gt;
* [https://llava-vl.github.io/ LLaVA 프로젝트]&lt;br /&gt;
&lt;br /&gt;
[[분류:비전 언어 모델]]&lt;br /&gt;
[[분류:머신 러닝]]&lt;/div&gt;</summary>
		<author><name>Admina7ec671ac513</name></author>
	</entry>
</feed>