Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
RA-RFT는 언어 모델이 유추적 추론을 수행하도록 검색 증강과 강화 미세조정을 결합한 후훈련 프레임워크이다.
기존 RAG는 의미적 유사성에 기반한 검색을 사용하지만, 복잡한 추론 작업에서는 유사한 문제가 다른 해결 전략을 요구하거나 표면적으로 다른 문제가 동일한 추론 패턴을 공유할 수 있어 부적합하다. 따라서 추론 작업에 특화된 검색 방법이 필요하다.
RA-RFT는 두 단계로 구성된다. 첫째, 골드-관련성 증류(gold-relevance distillation)를 통해 검색기를 훈련하여 의미적 중복 대신 예상 추론 이점에 따라 맥락을 순위화한다. 둘째, 검색된 유추적 데모를 사용하여 강화 미세조정 방법으로 정책 모델을 미세조정하며, 검증 가능한 결과 보상 하에 추론 궤적을 활용하도록 학습한다.
수학적 추론 벤치마크(AIME 2025 등)에서 RA-RFT는 GRPO와 같은 표준 강화 미세조정 방법보다 일관되게 높은 성능을 달성했다. 예를 들어 Qwen3-1.7B와 Qwen3-4B에서 AIME 2025 average@32 정확도를 각각 7.1, 2.8 포인트 향상시켰다. 이는 추론 인식 검색이 보상 설계나 훈련 커리큘럼과 직교하는 개선 축임을 보여준다.