본문으로 이동

MINIMA

Conaonda Wiki
Admina7ec671ac513 (토론 | 기여)님의 2026년 8월 20일 (목) 13:18 판 (migrate: import legacy Wiki content to Vultr)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

MINIMA는 Modality Invariant Image Matching을 목표로 한 CVPR 2025 프레임워크다. 특정 센서 조합마다 별도 구조를 설계하기보다 대규모 synthetic multimodal 데이터를 이용해 기존 matcher에 cross-modal 능력을 부여한다.

개요

핵심은 MD-syn 데이터 엔진이다. RGB matching 데이터에서 generative model로 여러 modality 표현을 만들고 기존 correspondence label을 유지한다. 공식 논문은 19가지 cross-modal case의 in-domain 및 zero-shot 평가를 보고한다.

공식 저장소는 MINIMA-LoFTR, MINIMA-RoMa, MINIMA-LightGlue, MINIMA-EfficientLoFTR, MINIMA-XoFTR weight를 제공한다. 저장소는 Apache-2.0이지만 README는 minima_lightglue가 사용하는 SuperPoint의 academic/non-commercial 제한을 명시적으로 경고한다.

핵심 구조

Architecture보다 data scaling이 중심이다. 같은 학습 철학을 서로 다른 matching backbone에 적용할 수 있어 제품 PoC에서는 MINIMA-RoMa와 MINIMA-LoFTR를 별도 엔진으로 취급하는 것이 좋다.

활용

EO↔SAR, EO↔IR, map↔optical 등 여러 조합을 하나의 제품이 다룰 때 모델 유지 비용을 줄일 가능성이 있다. 원본 RoMa와 MINIMA-RoMa를 나란히 비교하면 multimodal pretraining의 실효를 직접 측정할 수 있다.

한계 및 주의점

Synthetic modality가 실제 SAR speckle, thermal response, 지도 심볼, 계절 변화와 완전히 같지는 않다. 학습 데이터 생성에 사용된 모델과 source dataset까지 추적해야 재학습 모델의 상용 이용 가능성을 판단할 수 있다.

함께 보기

출처