본문으로 이동
주 메뉴
주 메뉴
사이드바로 이동
숨기기
둘러보기
대문
최근 바뀜
임의 문서로
미디어위키 도움말
특수 문서 목록
Conaonda Wiki
검색
검색
외관
로그인
개인 도구
로그인
비전 언어 모델 문서 원본 보기
문서
토론
한국어
읽기
원본 보기
역사 보기
도구
도구
사이드바로 이동
숨기기
작업
읽기
원본 보기
역사 보기
일반
여기를 가리키는 문서
가리키는 글의 최근 바뀜
문서 정보
외관
사이드바로 이동
숨기기
←
비전 언어 모델
문서 편집 작업을 수행할 권한이 없습니다. 다음 이유를 확인해주세요:
요청한 작업은 다음 권한을 가진 사용자에게 제한됩니다:
사용자
.
문서의 원본을 보거나 복사할 수 있습니다.
'''비전 언어 모델'''(Vision-Language Model, VLM)은 이미지와 텍스트를 함께 처리할 수 있도록 설계된 머신 러닝 모델이다. 이미지 이해, 텍스트-이미지 상호 연관, 시각적 질의응답(VQA) 등의 과제를 수행할 수 있다. == 개요 == 기존의 컴퓨터 비전은 이미지 분류와 같이 텍스트를 다루지 않는 경우가 많았다. 비전 언어 모델은 이미지 인코더와 텍스트 모델을 결합하여 두 모달을 함께 이해하며, 이미지와 언어의 상호 작용이 필요한 과제에서 사용된다. 최근 거대 언어 모델의 발전을 기반으로 많은 VLM이 생성형 및 이해 기능을 함께 제공하고 있다. == 주요 모델 == * CLIP — 이미지와 텍스트를 공통 임베딩 공간으로 매핑 * [[Florence-2]] — 프롬프트 기반 통합 비전 모델 * LLaVA — 비전 인코더와 대형 언어 모델을 결합한 VLM * BLIP / BLIP-2 — 이미지 캡셔닝 및 VQA 용 모델 * GPT-4V — 상용 홝식 모델의 비전 기능 == 활용 분야 == === 이미지 캡셔닝 및 주석 === 이미지의 내용을 자동으로 설명하고 메타데이터를 생성하는 데 사용된다. === 시각적 질의응답(VQA) === 이미지에 대한 질문에 답하는 기능으로, 문서 이해, 교육, 상품 안내 등에 활용된다. === 텍스트 기반 이미지 검색 === 대규모 이미지 컴라이러리에서 내용 기반 검색을 제공한다. === 로보틱스 및 자율주행 === 시각 인식과 언어 이해가 함께 필요한 제어로직에 활용된다. == 함께 보기 == * [[Florence-2]] — 프롬프트 기반 통합 비전 모델 * [[트랜스포머]] — 많은 VLM의 기반 아키텍처 * [[객체 탐지]] — 비전 모델이 수행하는 주요 태스크 == 출처 == * [https://openai.com/research/clip CLIP (OpenAI)] * [https://llava-vl.github.io/ LLaVA 프로젝트] [[분류:비전 언어 모델]] [[분류:머신 러닝]]
비전 언어 모델
문서로 돌아갑니다.
검색
검색
비전 언어 모델 문서 원본 보기
새 주제