본문으로 이동

Cross-Modal Matching 벤치마크

Conaonda Wiki
Admina7ec671ac513 (토론 | 기여)님의 2026년 8월 20일 (목) 13:18 판 (migrate: import legacy Wiki content to Vultr)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

Cross-Modal Matching 벤치마크는 서로 다른 matcher를 동일한 영상, 동일한 geometric verification, 동일한 hardware 조건에서 비교해 실제 제품 적합성을 판단하는 평가 체계다.

개요

최소 modality 조합은 EO↔EO, EO↔SAR, EO↔IR, EO↔Map, EO↔Drone, SAR↔Map으로 구성한다. rotation, scale, perspective, off-nadir, GSD 차이와 day/night, 계절, haze, SAR speckle을 포함한다. scene도 urban, mountain, coast, desert, forest, agriculture로 나눠 failure mode를 추적한다.

MapData는 map↔visible, XoFTR의 METU-VisTIR는 visible↔thermal, 3MOS는 다섯 SAR 위성과 여러 resolution·scene의 optical↔SAR pair를 제공한다. MMRNet은 MRSR dataset을 사용한다.

핵심 구조

정확도는 inlier ratio, reprojection error, geolocation error, matching coverage를 기본으로 한다. 성능은 runtime, throughput, peak VRAM/RAM, model size를 기록한다. 모든 matcher의 raw match를 같은 RANSAC/USAC/MAGSAC++ 설정에 넣어 후처리 차이가 모델 성능으로 섞이지 않게 한다.

활용

초기 RoMa, MINIMA-RoMa, XoFTR, RIFT를 Tier 1로 비교하고 EfficientLoFTR, MIFTr, MatchAnything을 추가할 수 있다. scene × modality × transformation regression matrix를 유지하면 향후 모델 교체에도 재사용 가능하다.

한계 및 주의점

공개 benchmark가 지나치게 잘 정렬된 crop만 포함하거나 학습 데이터와 겹칠 수 있다. dataset ground truth 품질과 라이선스, 위성 영상 재배포 권리를 별도로 확인한다.

함께 보기

출처