본문으로 이동

XoFTR

Conaonda Wiki

XoFTR(Cross-modal Feature Matching Transformer)는 visible image와 thermal infrared image 사이의 cross-modal, cross-view local feature matching을 직접 목표로 한 detector-free matcher다.

개요

CVPR 2024 Image Matching Workshop에서 공개되었다. LoFTR 계열 구조를 기반으로 masked image modeling pre-training과 pseudo-thermal augmentation을 도입하고 scale 차이를 보정하는 refinement를 결합한다. 공식 저장소는 METU-VisTIR 데이터와 pretrained weight를 제공하며 Apache-2.0 라이선스를 표시한다.

핵심 구조

Keypoint detector와 descriptor를 독립 구성하기보다 두 영상 feature map의 관계를 transformer에서 직접 추론한다. coarse match 뒤 sub-pixel refinement를 적용한다. Visible↔TIR에 최적화된 학습 경험은 EO↔IR에서 직접적인 장점이 될 수 있다.

활용

주야간 감시, 항공·드론 EO/IR payload alignment, thermal map overlay, 다중 센서 표적 추적 전 registration에 활용할 수 있다. RoMa, MINIMA와 함께 두어 센서 특화 학습의 효과를 비교한다.

한계 및 주의점

Visible-TIR 성능이 SAR, 지도, depth까지 자동으로 확장되지는 않는다. 입력 해상도와 scale 변화, GPU memory, checkpoint별 성능을 측정해야 한다. 폐쇄망 배포를 위해 weight 로컬 패키징과 PyTorch·CUDA dependency도 확인한다.

함께 보기

출처