본문으로 이동

Modality-Invariant Image Matching

Conaonda Wiki
Admina7ec671ac513 (토론 | 기여)님의 2026년 8월 20일 (목) 13:18 판 (migrate: import legacy Wiki content to Vultr)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

Modality-Invariant Image Matching은 서로 다른 센서의 표현 차이보다 공통된 공간 구조와 의미를 강조하는 feature를 학습하거나 설계해 correspondence를 찾는 접근이다. 최근 cross-modal matcher를 관통하는 핵심 키워드다.

개요

EO, SAR, thermal, map은 같은 대상도 서로 다른 물리·기호 체계로 표현한다. modality-specific variation을 줄이고 geometry-preserving representation을 만드는 것이 중요하다. RIFT의 phase congruency, MINIMA의 synthetic multimodal training, MatchAnything의 large-scale pretraining, MIFTr의 modality-invariant transformer가 서로 다른 구현 예다.

핵심 구조

대표 전략은 구조적 handcrafted signal, semantic foundation feature, synthetic modality generation, text·semantic prior 주입으로 나눌 수 있다. 2026년에는 optical↔SAR를 shared modality로 변환해 RoMa를 적용하거나 text semantic prior를 쓰는 TAR 연구도 등장했다.

활용

EO↔SAR, EO↔IR, EO↔Map, EO↔Drone을 모두 지원하는 제품에서 센서별 모델 수를 줄이는 방향으로 활용할 수 있다. retrieval 단계에서 공통 embedding으로 후보 영역을 좁힌 뒤 dense matcher를 적용하는 coarse-to-fine pipeline도 가능하다.

한계 및 주의점

Invariance가 너무 강하면 pixel-level localization에 필요한 고주파 세부 정보까지 잃을 수 있다. coarse semantic matching과 fine geometric refinement를 분리하고 실제 GSD 기반 meter error로 최종 검증해야 한다.

함께 보기

출처