<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Florence-2</id>
	<title>Florence-2 - 편집 역사</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Florence-2"/>
	<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Florence-2&amp;action=history"/>
	<updated>2026-08-20T13:19:55Z</updated>
	<subtitle>이 문서의 편집 역사</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.conaondaapps.com/index.php?title=Florence-2&amp;diff=18&amp;oldid=prev</id>
		<title>Admina7ec671ac513: migrate: import legacy Wiki content to Vultr</title>
		<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Florence-2&amp;diff=18&amp;oldid=prev"/>
		<updated>2026-08-20T04:18:32Z</updated>

		<summary type="html">&lt;p&gt;migrate: import legacy Wiki content to Vultr&lt;/p&gt;
&lt;p&gt;&lt;b&gt;새 문서&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;Florence-2&amp;#039;&amp;#039;&amp;#039;는 Microsoft가 2024년 6월에 공개한 통합 비전 기반 모델(vision foundation model)이다. 프롬프트를 입력하면 이미지 캡셔닝, 객체 탐지, 영역 분할(segmentation), 그라운딩(grounding), OCR 등 다양한 비전 태스크를 하나의 모델로 처리할 수 있다.&lt;br /&gt;
&lt;br /&gt;
== 개요 ==&lt;br /&gt;
Florence-2는 이전의 Florence 모델 시리즈의 후속으로, 태스크별로 별도의 모델을 학습하는 기존 방식과 달리 전체 비전 태스크를 통일된 프롬프트-응답 형태로 확장할 수 있는 설계를 채택했다. 결과적으로 여러 태스크에 대해 하나의 모델이 높은 성능을 내는 전문 모델을 넘어설 수 있으며, 개인이 모델을 원리적으로 사용하기 쉬운 점이 특징이다.&lt;br /&gt;
&lt;br /&gt;
== 구조 ==&lt;br /&gt;
Florence-2는 인코더-디코더 아키텍처를 사용한다. 비전 인코더로는 DaViT(Vision Transformer 계열)을, 텍스트 디코더로는 FLAN-T5를 기반으로 한다. 모델 크기는 0.23B(Florence-2-base) 및 0.77B(Florence-2-large) 파라미터 규모로, 소모자급 GPU에서도 실행이 가능하다.&lt;br /&gt;
&lt;br /&gt;
== 학습 데이터 ==&lt;br /&gt;
Florence-2는 FLD-5B라는 플랫폼을 통해 전체 비전 태스크의 코퍼레스 및 주석을 다주적으로 발생시켜 학습했다. 2023년 시점의 5억 개 이미지와 7억 개 주석을 기반으로, 지시 주석이 적은 환경에서도 다양한 태스크를 학습할 수 있도록 하였다.&lt;br /&gt;
&lt;br /&gt;
== 주요 태스크 ==&lt;br /&gt;
&lt;br /&gt;
* 이미지 캡셔닝 — 이미지의 내용을 국문장으로 생성&lt;br /&gt;
* 객체 탐지 — 바운딩 박스와 클래스 예측&lt;br /&gt;
* 영역 분할(segmentation) — 픽셀 단위 물체 분리&lt;br /&gt;
* 그라운딩(grounding) — 텍스트 지시어를 이미지 영역에 매핑&lt;br /&gt;
* OCR — 이미지 속 문자 인식 및 텍스트 추출&lt;br /&gt;
* 이미지 검색 — 텍스트에 기초한 이미지 검색&lt;br /&gt;
&lt;br /&gt;
== 생태계 ==&lt;br /&gt;
Florence-2는 [[Hugging Face]]에 배포되어 있으며, Microsoft가 출시한 [[ONNX]] 구성물을 통해 [[ONNX Runtime]]에서도 실행할 수 있다. [[ComfyUI]] 커스텀 노드를 통해 이미지 생성 워크플로우에서 편집 도구로 사용되기도 한다. 기본적으로 [[비전 언어 모델]](VLM)의 분류에 속한다.&lt;br /&gt;
&lt;br /&gt;
== 함께 보기 ==&lt;br /&gt;
&lt;br /&gt;
* [[비전 언어 모델]] — Florence-2가 속하는 모델 분류&lt;br /&gt;
* [[Hugging Face]] — 모델 배포 플랫폼&lt;br /&gt;
* [[ONNX Runtime]] — [[ONNX]] 구성물을 실행하는 추론 엔진&lt;br /&gt;
* [[ComfyUI]] — 비전 모델을 워크플로우에서 활용하는 도구&lt;br /&gt;
* [[객체 탐지]] — Florence-2가 처리하는 주요 태스크&lt;br /&gt;
&lt;br /&gt;
== 출처 ==&lt;br /&gt;
&lt;br /&gt;
* [https://huggingface.co/microsoft/Florence-2-large Hugging Face: Florence-2-large]&lt;br /&gt;
* [https://arxiv.org/abs/2311.06242 Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (arXiv)]&lt;br /&gt;
* [https://github.com/microsoft/Florence-2 GitHub: microsoft/Florence-2]&lt;br /&gt;
&lt;br /&gt;
[[분류:비전 언어 모델]]&lt;br /&gt;
[[분류:딥러닝 모델]]&lt;/div&gt;</summary>
		<author><name>Admina7ec671ac513</name></author>
	</entry>
</feed>