FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement
Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider
로봇이 테스트 시 실패를 학습해 자율적으로 복구하고 정책을 지속 개선하는 FAR 프레임워크를 제안한다.
실제 환경에 배포된 로봇 정책은 불가피하게 실패를 경험하며, 단순 재시도는 같은 실수를 반복하고 기존 복구 방법들은 종종 인간의 개입에 의존한다.
FAR는 실패 대비 선호도 적응(Failure-Contrastive Preference Adaptation)을 결합해 이전에 실패한 행동에서 정책을 멀어지게 하는 선호 학습 데이터를 구축하고, 재시도 시 경미한 행동 변동을 추가해 지역적 탐색을 촉진한다. 또한 성공적인 복구 궤적을 훈련 루프에 통합해 지속적인 정책 개선을 달성한다.
시뮬레이션에서 표준 디퓨전 정책 대비 평균 17.6%, 실제 환경에서 11.7%의 성공률 향상을 달성했다. 또한 지속적 정책 개선 시 리셋 및 타임스텝 예산 하에서 유용한 실패 사례를 활용해 데이터 효율성을 크게 개선했다.