비전 언어 모델
외관
비전 언어 모델(Vision-Language Model, VLM)은 이미지와 텍스트를 함께 처리할 수 있도록 설계된 머신 러닝 모델이다. 이미지 이해, 텍스트-이미지 상호 연관, 시각적 질의응답(VQA) 등의 과제를 수행할 수 있다.
개요
기존의 컴퓨터 비전은 이미지 분류와 같이 텍스트를 다루지 않는 경우가 많았다. 비전 언어 모델은 이미지 인코더와 텍스트 모델을 결합하여 두 모달을 함께 이해하며, 이미지와 언어의 상호 작용이 필요한 과제에서 사용된다. 최근 거대 언어 모델의 발전을 기반으로 많은 VLM이 생성형 및 이해 기능을 함께 제공하고 있다.
주요 모델
- CLIP — 이미지와 텍스트를 공통 임베딩 공간으로 매핑
- Florence-2 — 프롬프트 기반 통합 비전 모델
- LLaVA — 비전 인코더와 대형 언어 모델을 결합한 VLM
- BLIP / BLIP-2 — 이미지 캡셔닝 및 VQA 용 모델
- GPT-4V — 상용 홝식 모델의 비전 기능
활용 분야
이미지 캡셔닝 및 주석
이미지의 내용을 자동으로 설명하고 메타데이터를 생성하는 데 사용된다.
시각적 질의응답(VQA)
이미지에 대한 질문에 답하는 기능으로, 문서 이해, 교육, 상품 안내 등에 활용된다.
텍스트 기반 이미지 검색
대규모 이미지 컴라이러리에서 내용 기반 검색을 제공한다.
로보틱스 및 자율주행
시각 인식과 언어 이해가 함께 필요한 제어로직에 활용된다.
함께 보기
- Florence-2 — 프롬프트 기반 통합 비전 모델
- 트랜스포머 — 많은 VLM의 기반 아키텍처
- 객체 탐지 — 비전 모델이 수행하는 주요 태스크