Bringing Agentic Search to Earth Observation Data Discovery
Minghan Yu, Youran Sun, Chugang Yi, Yixin Wen, Haizhao Yang
NASA의 지구 관측 지식 그래프(KG)를 활용하여 자연어 질의로 관련 데이터셋과 도구를 검색하는 에이전트 기반 시스템을 제안하고, 이를 위한 벤치마크와 성능을 검증했다.
NASA와 같은 대규모 데이터 센터에는 수천 개의 지구과학 데이터셋과 도구가 존재하지만, 도메인 전문가조차 자신에게 맞는 것을 찾기 어렵다. 기존의 키워드 기반 검색은 자연어 연구 질문의 의미를 충분히 이해하지 못한다.
NASA 지구 관측 지식 그래프(NASA EO-KG)를 기반으로 47,000개의 쿼리-데이터셋 쌍으로 구성된 NASA-EO-Bench 벤치마크를 구축했다. 지도 학습된 신경망 스코어러를 훈련시켜 기존 코사인 유사도 및 BM25 기반 방법을 능가하게 했으며, BM25와의 점수 융합을 통해 성능을 더욱 향상시켰다. 마지막으로, 추가 학습 없이 LLM 추론을 활용하는 제로샷 에이전트 리랭킹 단계를 추가하여 검색 결과를 정제했다.
제안된 지도 학습 파이프라인과 BM25의 점수 융합은 Recall@10과 MRR을 5배 이상 향상시켰다. 제로샷 에이전트 리랭킹은 MRR을 추가로 28% 높여, LLM 추론이 지도 학습 기반 검색과 상호 보적적임을 보여주었다. NASA-EO-Bench 벤치마크를 공개하여 지구과학 데이터 검색 분야의 발전에 기여했다.