Coarse-to-Fine 템플릿 매칭
Coarse-to-Fine 템플릿 매칭은 낮은 해상도에서 물체의 대략적인 대응 관계와 기하 변환을 먼저 구한 뒤, 정렬된 영상에서 세밀한 대응점을 다시 추정하여 위치를 보정하는 영상 정합 방식이다. 여기서는 Gao 등이 발표한 논문과 그 공식 PyTorch 구현인 Deep-Template-Matching을 중심으로 설명한다.
개요
템플릿 매칭은 기준이 되는 작은 영상이나 윤곽을 더 큰 원본 영상에서 찾아 위치와 자세를 추정하는 문제이다. 산업 현장에서는 부품의 자세 추정, 로봇 파지, 조립 상태 확인 등에 이어지는 기초 단계가 된다. 단순한 밝기 상관이나 고정 크기 탐색은 템플릿과 원본의 표현 방식이 다르거나, 배경이 복잡하거나, 표면의 질감이 약하거나, 원근 변형이 있을 때 성능이 떨어질 수 있다.
Deep-Template-Matching은 마스크 형태의 템플릿과 회색조 원본 영상 사이의 도메인 차이, 평면 물체에도 흔히 나타나는 호모그래피 변형을 함께 다루려는 연구이다. 논문은 2024년 Computational Visual Media 10권에 게재되었다. 저장소는 연구 코드, 학습·시험 설정, 단일 및 다중 물체 데모, 조립 홀과 철강 데이터셋 안내를 제공한다. 따라서 일반 목적 제품 SDK라기보다 논문 재현과 산업 영상 정합 실험을 위한 연구 구현으로 보는 편이 적절하다.
핵심 구조/작동 방식
처리는 크게 전처리와 거친 정합, 세밀한 보정으로 나뉜다. 먼저 에지 인식 모듈이 마스크 템플릿과 회색조 영상의 표현 차이를 줄인다. 형태의 경계가 안정적으로 검출되는 시험 데이터에는 저장소의 기본 설정인 에지 사용이 권장되며, 경계 검출 자체가 불안정한 데이터에서는 해당 옵션을 끌 수 있다. 이 선택은 단순한 속도 옵션이 아니라 입력 도메인과 일반화 성능의 관계를 조절한다.
거친 단계에서는 Transformer가 제공하는 구조 인식 정보를 이용하여 템플릿과 원본 사이의 대응점을 찾는다. 이 대응으로 초기 워핑 변환을 추정하고 원본과 템플릿을 대략 정렬한다. 한 번에 최종 좌표를 회귀하는 대신 넓은 탐색 범위에서 전역적인 배치를 먼저 해결하므로 큰 위치 변화와 호모그래피에 대응할 여지가 생긴다. 이 단계의 결과는 최종 답이 아니라 다음 네트워크가 비교하기 쉬운 정렬 상태이다.
세밀한 단계에서는 기준 영상과 앞 단계에서 정렬한 영상을 함께 받아 대응점을 다시 계산한다. 목표는 픽셀보다 작은 수준의 대응 관계를 얻고 이를 이용해 최종 기하 변환을 산출하는 것이다. 전체 과정이 미분 가능하도록 구성되어 거친 대응과 보정 과정이 학습 목표에 연결된다. 공식 학습 절차도 먼저 coarse 네트워크만 수렴시키고, 그 체크포인트를 사용해 전체 네트워크를 추가 학습하는 두 단계 방식을 제시한다.
저장소 기본 데이터 로더는 영상을 높이 480, 너비 640으로 조정하고 질의점 최대 수를 128로 둔다. 해상도를 바꿀 수는 있지만 README는 영상이 지나치게 작으면 매칭 쌍이 크게 줄 수 있다고 경고한다. 학습 데이터 경로, 에지 사용, 온라인 증강, TensorBoard 시각화는 설정 파일에서 제어한다. 데모는 별도 사전학습 가중치와 시험 영상을 사용하며, 학습과 시험은 제공된 셸 스크립트를 통해 실행한다.
활용
이 방식은 윤곽 템플릿을 실제 카메라의 회색조 영상에 맞춰야 하는 부품 위치 결정, 픽앤플레이스 로봇의 초기 자세 추정, 반복 생산품의 조립 정렬 검사에 적용할 수 있다. 템플릿과 관측 영상의 질감이나 명암 표현이 다른 상황에서 에지 기반 정규화의 효과를 시험하기에도 알맞다. 다중 물체 데모는 같은 종류의 대상이 여러 개 존재하는 장면을 평가하는 출발점이 된다.
연구 관점에서는 Detector-Free 로컬 특징 정합처럼 영상 쌍 전체의 대응점을 찾는 방법, Quality-Aware 템플릿 매칭처럼 각 후보 대응의 품질을 평가하는 방법과 비교할 수 있다. 실제 시스템에서는 후보 검출, 호모그래피 추정의 안정성 검사, 로봇 좌표계 보정, 실패 판정과 함께 파이프라인으로 구성해야 한다. 논문이 보고한 성능은 사용한 데이터셋과 평가 조건 안의 결과이므로 현장 데이터로 별도 검증해야 한다.
한계 및 주의점
호모그래피는 평면 또는 평면으로 근사할 수 있는 물체의 투영 관계를 나타낸다. 깊이 변화가 큰 3차원 물체, 비강체 변형, 심한 가림, 반복 무늬에는 그대로 적용하기 어렵다. 에지가 거의 없거나 조명 때문에 가짜 경계가 강한 영상에서는 에지 모듈이 항상 유리하다고 단정할 수 없다. 카메라, 재질, 해상도가 학습 데이터와 달라지면 도메인 이동도 다시 평가해야 한다.
공식 저장소의 설치 안내는 간략하고, 사전학습 가중치와 두 산업 데이터셋은 외부 다운로드 링크에 의존한다. 재현 시에는 Python·PyTorch·CUDA 조합, 가중치 무결성, 데이터 이용 조건을 직접 확인해야 한다. 기본 리사이즈는 작은 결함이나 미세 특징을 잃을 수 있으며, 해상도와 질의점 수를 늘리면 메모리와 계산량이 증가한다. 안전이나 품질 판정을 자동화할 때는 매칭 점수만 사용하지 말고 기하 잔차, 대응점 분포, 실패 사례를 함께 감시해야 한다.