<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Detector-Free_%EB%A1%9C%EC%BB%AC_%ED%8A%B9%EC%A7%95_%EC%A0%95%ED%95%A9</id>
	<title>Detector-Free 로컬 특징 정합 - 편집 역사</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=Detector-Free_%EB%A1%9C%EC%BB%AC_%ED%8A%B9%EC%A7%95_%EC%A0%95%ED%95%A9"/>
	<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Detector-Free_%EB%A1%9C%EC%BB%AC_%ED%8A%B9%EC%A7%95_%EC%A0%95%ED%95%A9&amp;action=history"/>
	<updated>2026-08-20T20:02:02Z</updated>
	<subtitle>이 문서의 편집 역사</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.conaondaapps.com/index.php?title=Detector-Free_%EB%A1%9C%EC%BB%AC_%ED%8A%B9%EC%A7%95_%EC%A0%95%ED%95%A9&amp;diff=15&amp;oldid=prev</id>
		<title>Admina7ec671ac513: migrate: import legacy Wiki content to Vultr</title>
		<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=Detector-Free_%EB%A1%9C%EC%BB%AC_%ED%8A%B9%EC%A7%95_%EC%A0%95%ED%95%A9&amp;diff=15&amp;oldid=prev"/>
		<updated>2026-08-20T04:18:30Z</updated>

		<summary type="html">&lt;p&gt;migrate: import legacy Wiki content to Vultr&lt;/p&gt;
&lt;p&gt;&lt;b&gt;새 문서&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;Detector-Free 로컬 특징 정합&amp;#039;&amp;#039;&amp;#039;은 두 영상에서 관심점을 먼저 검출하고 기술자를 비교하는 전통적 절차를 생략하고, 조밀한 특징 격자 사이의 대응을 직접 예측하는 영상 정합 방식이다. 대표 연구인 [https://github.com/zju3dv/LoFTR zju3dv/LoFTR]는 Transformer의 자기·교차 어텐션으로 두 영상의 문맥을 함께 반영한다.&lt;br /&gt;
&lt;br /&gt;
== 개요 ==&lt;br /&gt;
&lt;br /&gt;
로컬 특징 정합은 같은 장면을 찍은 두 영상에서 동일한 물리 지점을 찾는 작업이다. SIFT, ORB 또는 학습 기반 검출자처럼 “특징점 검출 → 주변 기술자 계산 → 기술자 매칭” 순서를 사용하는 방법은 검색량을 줄일 수 있지만, 벽·바닥 같은 저텍스처 영역이나 반복 무늬, 모션 블러에서 두 영상에 반복해서 나타나는 관심점을 충분히 찾지 못할 수 있다. 검출되지 않은 위치는 뒤의 기술자와 매처가 아무리 좋아도 대응시킬 수 없다.&lt;br /&gt;
&lt;br /&gt;
LoFTR(Local Feature TRansformer)는 저해상도 특징 격자에서 픽셀 단위의 조밀한 후보를 만들고 신뢰도 높은 대응을 고른 뒤, 고해상도 특징에서 부분화소 수준으로 다듬는 coarse-to-fine 구조이다. 각 영상의 특징을 독립적으로 비교하지 않고 자기 어텐션으로 한 영상 안의 전역 문맥을, 교차 어텐션으로 다른 영상의 정보를 주고받는다. 위치 인코딩을 더해 균일한 영역에서도 주변 구조와 위치에 의존하는 표현을 만든다.&lt;br /&gt;
&lt;br /&gt;
논문은 CVPR 2021에 발표되었고 후속 T-PAMI 논문이 안내되어 있다. 2026년 8월 16일 확인한 공개 저장소는 Apache-2.0 라이선스이며 추론·훈련·재현 코드, ScanNet과 MegaDepth용 설정, 실내·실외 사전학습 모델, 이미지 쌍과 영상 데모를 제공한다. README는 LoFTR가 Kornia 0.5.11부터 통합되어 &amp;lt;code&amp;gt;kornia.feature.LoFTR&amp;lt;/code&amp;gt;로 사용할 수 있다고 설명한다.&lt;br /&gt;
&lt;br /&gt;
== 핵심 구조/작동 방식 ==&lt;br /&gt;
&lt;br /&gt;
=== 다중 해상도 특징 추출 ===&lt;br /&gt;
&lt;br /&gt;
두 입력 영상은 같은 CNN과 FPN 계열 백본을 통과한다. 원 논문 구현은 원 영상 크기의 1/8인 coarse 특징과 1/2인 fine 특징을 만든다. 다운샘플링은 Transformer가 처리할 토큰 수를 줄이고, fine 특징은 선택된 대응의 위치를 정밀화하는 데 사용한다.&lt;br /&gt;
&lt;br /&gt;
=== Local Feature Transformer ===&lt;br /&gt;
&lt;br /&gt;
coarse 특징을 1차원 토큰 열로 펼치고 2차원 위치 인코딩을 더한다. 자기 어텐션은 같은 영상의 멀리 떨어진 구조를 연결하고, 교차 어텐션은 한 영상의 토큰이 상대 영상의 관련 문맥을 참조하게 한다. 이 두 층을 교대로 반복해 특징을 문맥·위치 의존 표현으로 변환한다. 원 논문은 표준 어텐션의 입력 길이에 대한 제곱 비용을 줄이기 위해 선형 Transformer 변형을 사용한다.&lt;br /&gt;
&lt;br /&gt;
=== coarse 대응 선택 ===&lt;br /&gt;
&lt;br /&gt;
변환된 두 특징 격자의 내적으로 유사도 행렬을 만든다. LoFTR는 dual-softmax 또는 optimal transport(OT) 방식으로 신뢰도 행렬을 계산할 수 있다. 신뢰도 임계값을 넘고 양쪽에서 서로 최근접인 후보만 coarse 대응으로 선택한다. 이 단계는 명시적 코너 검출 없이 넓은 영역에서 후보를 얻는 핵심이다.&lt;br /&gt;
&lt;br /&gt;
=== fine 정밀화 ===&lt;br /&gt;
&lt;br /&gt;
각 coarse 대응 위치를 1/2 해상도 특징으로 옮기고 두 영상에서 작은 로컬 창을 자른다. 더 작은 LoFTR 모듈과 상관 계산으로 대상 창의 확률 히트맵을 만들며, 분포의 기댓값으로 부분화소 좌표를 구한다. 최종 출력은 두 영상의 대응 좌표와 신뢰도이며, 호모그래피나 기본행렬, 상대 자세를 얻으려면 보통 RANSAC 같은 기하 추정 단계를 이어서 적용한다.&lt;br /&gt;
&lt;br /&gt;
학습은 coarse 신뢰도 손실과 fine 위치 손실을 합친다. 원 연구는 카메라 자세와 깊이로 정답 대응을 만들고 실내 모델은 ScanNet, 실외 모델은 MegaDepth를 이용했다. 따라서 모델이 학습한 영상 분포와 실제 센서·장면 사이의 차이가 결과에 영향을 준다.&lt;br /&gt;
&lt;br /&gt;
== 활용 ==&lt;br /&gt;
&lt;br /&gt;
LoFTR 계열 정합은 Structure from Motion, SLAM, 시각 위치결정, 상대 카메라 자세, 호모그래피, 영상 모자이크와 3D 재구성에 활용할 수 있다. 텍스처가 약한 실내 장면이나 반복 구조에서 검출기 기반 파이프라인의 대응 수가 부족할 때 후보가 된다. [[COG 웹 가시화]]와 결합할 경우 광학 영상 또는 정사영상 쌍의 대응과 잔차를 지도 위에 표시해 품질을 검토할 수 있다.&lt;br /&gt;
&lt;br /&gt;
[[Quality-Aware 템플릿 매칭]]과 목표도 구분된다. LoFTR는 두 영상 전체의 다수 점 대응을 찾아 기하 모델을 추정하는 데 강점이 있고, QATM은 하나의 템플릿이 검색 영상 어디에 있는지와 그 대응의 구별 가능성을 평가한다. 실제 시스템에서는 대략적인 템플릿 탐색 후 로컬 기하 정합을 수행하거나, 반대로 전역 정합 뒤 특정 대상의 템플릿 점수를 확인할 수 있다.&lt;br /&gt;
&lt;br /&gt;
== 한계 및 주의점 ==&lt;br /&gt;
&lt;br /&gt;
Detector-Free가 “특징이 필요 없다”는 뜻은 아니다. CNN이 조밀한 특징을 만들며 Transformer가 많은 위치 관계를 처리하므로, 입력 해상도와 영상 쌍 수가 늘면 GPU 메모리와 시간이 커진다. 원 논문의 속도 수치는 RTX 2080 Ti, 640×480 영상 쌍과 특정 구현 조건의 결과이므로 최신 장비나 고해상도 원격탐사 영상에 그대로 적용할 수 없다. 큰 영상은 타일링, 중첩, 다단계 축소와 전역 좌표 병합이 필요하다.&lt;br /&gt;
&lt;br /&gt;
신뢰도가 높아도 기하적으로 올바른 대응이라는 보장은 없다. 반복 구조, 큰 회전·축척·시점 차이, 계절·센서 차이, 움직이는 객체, 가림은 오정합을 만들 수 있다. 카메라 모델에 맞는 RANSAC과 오차 임계값, 공간 분포 검사, 독립 기준자료로 검증해야 한다. 학습 데이터와 다른 SAR-광학 같은 다중센서 정합은 원 모델의 검증 범위를 벗어난다.&lt;br /&gt;
&lt;br /&gt;
공식 저장소의 환경과 일부 의존성은 2021년 연구 재현을 중심으로 한다. OT 구성은 라이선스 때문에 SuperGlue 코드를 저장소에 직접 포함하지 않고 별도 다운로드하도록 안내한다. 운영 제품에서는 Kornia 통합판과 원 저장소 구현의 전처리, 가중치, 출력 좌표, 라이선스 차이를 확인하고, 사용한 커밋과 모델 체크섬을 고정해야 한다.&lt;br /&gt;
&lt;br /&gt;
== 함께 보기 ==&lt;br /&gt;
&lt;br /&gt;
* [[최근 GitHub Star 연구 주제]]&lt;br /&gt;
* [[Quality-Aware 템플릿 매칭]]&lt;br /&gt;
* [[COG 웹 가시화]]&lt;br /&gt;
* [[고충실도 3D 시뮬레이션]]&lt;br /&gt;
&lt;br /&gt;
== 출처 ==&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/zju3dv/LoFTR LoFTR 공식 공개 저장소 및 README] — 코드, 모델, 데모, 학습, Kornia 통합과 라이선스. 2026년 8월 16일 확인.&lt;br /&gt;
* [https://openaccess.thecvf.com/content/CVPR2021/html/Sun_LoFTR_Detector-Free_Local_Feature_Matching_With_Transformers_CVPR_2021_paper.html CVPR 2021 공식 논문 페이지] — 방법과 실험. 2026년 8월 16일 확인.&lt;br /&gt;
* [https://arxiv.org/abs/2104.00680 저자 제출 LoFTR 논문] — coarse-to-fine 구조와 어텐션 설명. 2026년 8월 16일 확인.&lt;br /&gt;
* [https://zju3dv.github.io/loftr/ LoFTR 공식 프로젝트 페이지] — 논문, 코드, 시각 예시. 2026년 8월 16일 확인.&lt;br /&gt;
&lt;br /&gt;
[[분류:컴퓨터 비전]]&lt;br /&gt;
[[분류:머신 러닝]]&lt;br /&gt;
[[분류:오픈 소스]]&lt;br /&gt;
[[분류:GitHub Star 연구]]&lt;/div&gt;</summary>
		<author><name>Admina7ec671ac513</name></author>
	</entry>
</feed>