The Impossibility of Eliciting Latent Knowledge
Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport, Tom Everitt, Jonathan Richens
AI 시스템의 잠재 지식을 정직하게 보고하도록 훈련하는 것이 근본적으로 불가능함을 증명한 이론 연구.
고급 AI 시스템이 환경에 대한 지식을 갖지만, 인간이 관찰할 수 없는 잠재 변수에 대해 정직하게 보고하도록 설계하는 문제. 즉, 에이전트가 자신의 믿음을 정확히 보고하도록 훈련하는 '잠재 지식 유도(ELK)' 문제를 형식화하고 그 한계를 분석.
인과 영향 다이어그램(CID)을 사용하여 에이전트의 훈련 환경과 주관적 세계 표현 간 관계를 모델링. 관찰 가능 변수와 잠재 변수의 구분, 정직성의 형식적 정의, 목표 오일반화의 정의를 CID로 표현. 완벽한 피드백 하에서도 행동 기반 훈련 전략만으로 정직한 에이전트를 보장할 수 없음을 증명하는 불가능성 정리를 제시.
피드백 기반 훈련 전략만으로는 정직한 에이전트를 보장할 수 없다는 불가능성 정리를 증명. 이는 AI 정렬 연구에 중요한 이론적 한계를 제시하며, 행동 기반 접근을 넘어서는 새로운 방법론의 필요성을 시사.