Kolmogorov Regression for Robust Diffusion Policies
Lekan Molu
확산 정책의 시간적 드리프트 문제를 해결하기 위해 콜모고로프 방정식을 도입하여 결정적 PDE로 대체하고, 카메론-마틴 공간에서의 손실 함수와 진단 도구를 제안한다.
유한차원 확산 정책은 물리적 시스템에 배포될 때 이산화로 인한 시간적 드리프트가 발생하여 장기 성능이 저하된다. 기존 방법은 이러한 드리프트를 보상하지 못한다.
확산 과정의 역방향 콜모고로프 방정식을 이용하여 정책을 카메론-마틴 공간으로 끌어올린다. 확률적 스코어 매칭 대신 결정적 경계값 PDE 문제로 대체하고, 가우시안 측도 이론을 활용하여 잡음 공분산 연산자를 유색 잡음 분포로 실현한다. 정밀도 가중 카메론-마틴 손실로 모델을 학습하고, 콜모고로프 잔차를 PDE 진단 도구로 도입한다.
PushT 조작 벤치마크에서 최대 에피소드 보상 17% 향상(0.95 vs 0.78), 단계 간 드리프트 67.6% 감소. CONWIP 제조 라인에서 LSTM 대비 RMSE 28.4% 감소, 기아 이벤트 재현율 1.0, 병목 식별 정밀도 1.0 달성. 해밀턴-자코비 도달성 이론으로 교착 이벤트 96% 감소.