한줄 요약
지상·드론 뷰에서 위성 이미지 내 객체를 정확히 찾기 위해 3D 기반 단일 단계 프레임워크와 새로운 대규모 데이터셋을 제안합니다.
풀어야 하는 문제
기존 교차 뷰 객체 지오로케이션(CVOGL) 방법들은 주로 2D 외관 매칭에 의존하며, 기하학적 메타데이터, 다양한 프롬프트, 표준 시야각 이미지가 부족한 제한적인 데이터셋에 의해 성능이 제약됩니다.
접근 방법
새로운 데이터셋 (GeoSet): 220,000쌍 이상의 지상-위성 및 드론-위성 이미지 쌍을 포함하는 대규모 고품질 빌딩 데이터셋을 구축합니다. 다양한 프롬프트(점, 박스, 마스크)와 카메라 포즈를 제공하여 유연한 타겟 참조와 명시적 공간 모델링을 가능하게 합니다.
단일 단계 프레임워크 (GAGeo): 순열 등변성 3D 기반 모델($π^3$) 위에 구축된 새로운 프레임워크를 제안합니다. 시각적 특징, 참조 프롬프트, 학습 가능한 작업 토큰을 통합하여 단일 순전파로 바운딩 박스, 분할 마스크, 카메라 포즈를 공동 예측합니다.
대조 손실 함수: 위성 뷰를 보편적 앵커로 활용하는 대조 손실을 도입하여, 지상과 �론 표현을 암묵적으로 정렬하고 삼중 학습 데이터 없이 제로샷 지상-드론 지오로케이션을 가능하게 합니다.
결과·기여
성능 향상: 광범위한 실험에서 기존 최신(SOTA) 방법들을 크게 능가하는 성능을 보입니다.
일반화 능력: 미지의 장면과 새로운 교차 뷰 설정에서 뛰어난 일반화 능력을 입증합니다.
기여: 기하학적 정보를 효과적으로 활용하는 새로운 프레임워크와 표준화된 대규모 데이터셋을 제공하여 해당 분야의 연구를 촉진합니다.