A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures
Timothy Agboada, Shikha Chandel, Yadav Raj Ghimire, Leila Hashemi-Beni
원격탐사 VQA를 위해 경량 어댑터를 주입한 PEFT 프레임워크를 제안하고, 세 가지 VLM 아키텍처(CLIP, BLIP, FLAVA)의 성능을 비교 분석했다.
원격탐사(RS) 영상은 고해상도, 다중 스케일 객체 분포, 의미적 복잡성으로 인해 일반 도메인 VQA 모델을 직접 적용하기 어렵다. 또한 전체 파라미터를 미세조정하는 것은 계산 비용이 매우 크다.
사전학습된 VLM 백본(CLIP, BLIP, FLAVA)의 어텐션 및 MLP 레이어에 경량 병목 어댑터를 주입하는 통합 아키텍처 수술 파이프라인을 도입했다. 전체 파라미터의 5% 미만만 학습 가능한 PEFT 전략(RS 어댑터)을 사용하여 RSVQA-x 데이터셋에서 실험했다.
모든 적응 모델이 수렴했으며, 하이브리드 FLAVA 아키텍처가 단일모달 기반 모델보다 멀티모달 추론과 검색 능력에서 우수한 균형을 보였다. 재난 평가 및 도시 모니터링 등 자원 효율적인 VQA의 새로운 기준을 제시했다.