Task-Error Residual Learning for Real-Robot Five-Ball Juggling
Kai Ploeger, Jan Peters
방향성 과제 오차 정보를 학습 신호로 사용하는 잔차 학습 방법을 통해 실제 로봇 팔로 3~5공 저글링을 안정적으로 수행했다.
기존 잔차 학습은 강화학습의 스칼라 보상이나 무작위 탐색에 의존하여 샘플 효율이 낮았다. 특히 5공 저글링처럼 복잡한 동작은 인간도 수년의 연습이 필요할 정도로 어려운 과제다.
방향성 과제 오차(directional task error)를 학습 피드백으로 사용하고, 과제 오차 모델을 기반으로 샘플을 선택하는 잔차 학습 프레임워크를 제안했다. 고정 야코비안 뉴턴 업데이트를 통해 분석적 사전 지식과 방향성 정보를 결합했다.
Barrett WAM 팔로 3, 4, 5공 저글링을 안정적으로 수행했으며, 첫 시도 실패 후 두 번째 시도부터 단조 감소하는 과제 오차를 보였다. 방향성 피드백과 정보성 사전 지식이 모두 필요함을 실험적으로 입증했고, 가장 단순한 방법(고정 야코비안 뉴턴)이 가장 신뢰할 만했다.