Florence-2
Florence-2는 Microsoft가 2024년 6월에 공개한 통합 비전 기반 모델(vision foundation model)이다. 프롬프트를 입력하면 이미지 캡셔닝, 객체 탐지, 영역 분할(segmentation), 그라운딩(grounding), OCR 등 다양한 비전 태스크를 하나의 모델로 처리할 수 있다.
개요
Florence-2는 이전의 Florence 모델 시리즈의 후속으로, 태스크별로 별도의 모델을 학습하는 기존 방식과 달리 전체 비전 태스크를 통일된 프롬프트-응답 형태로 확장할 수 있는 설계를 채택했다. 결과적으로 여러 태스크에 대해 하나의 모델이 높은 성능을 내는 전문 모델을 넘어설 수 있으며, 개인이 모델을 원리적으로 사용하기 쉬운 점이 특징이다.
구조
Florence-2는 인코더-디코더 아키텍처를 사용한다. 비전 인코더로는 DaViT(Vision Transformer 계열)을, 텍스트 디코더로는 FLAN-T5를 기반으로 한다. 모델 크기는 0.23B(Florence-2-base) 및 0.77B(Florence-2-large) 파라미터 규모로, 소모자급 GPU에서도 실행이 가능하다.
학습 데이터
Florence-2는 FLD-5B라는 플랫폼을 통해 전체 비전 태스크의 코퍼레스 및 주석을 다주적으로 발생시켜 학습했다. 2023년 시점의 5억 개 이미지와 7억 개 주석을 기반으로, 지시 주석이 적은 환경에서도 다양한 태스크를 학습할 수 있도록 하였다.
주요 태스크
- 이미지 캡셔닝 — 이미지의 내용을 국문장으로 생성
- 객체 탐지 — 바운딩 박스와 클래스 예측
- 영역 분할(segmentation) — 픽셀 단위 물체 분리
- 그라운딩(grounding) — 텍스트 지시어를 이미지 영역에 매핑
- OCR — 이미지 속 문자 인식 및 텍스트 추출
- 이미지 검색 — 텍스트에 기초한 이미지 검색
생태계
Florence-2는 Hugging Face에 배포되어 있으며, Microsoft가 출시한 ONNX 구성물을 통해 ONNX Runtime에서도 실행할 수 있다. ComfyUI 커스텀 노드를 통해 이미지 생성 워크플로우에서 편집 도구로 사용되기도 한다. 기본적으로 비전 언어 모델(VLM)의 분류에 속한다.
함께 보기
- 비전 언어 모델 — Florence-2가 속하는 모델 분류
- Hugging Face — 모델 배포 플랫폼
- ONNX Runtime — ONNX 구성물을 실행하는 추론 엔진
- ComfyUI — 비전 모델을 워크플로우에서 활용하는 도구
- 객체 탐지 — Florence-2가 처리하는 주요 태스크