Recursive Self-Improvement Stability under Endogenous Yardstick Drift
Takahashi, K
자가 평가 기준이 내생적으로 변하는 환경에서도 자기 개선 시스템이 진정한 안정적 개선을 보장할 수 있는 인터페이스 이론을 제시한다.
AI 시스템이 스스로 코드나 정책을 개선할 때, 평가 기준(벤치마크, 파서, 라우팅 로직 등)도 함께 변경되면 단기적 이득과 진정한 개선을 구분하기 어려워진다. 기존 연구는 주로 고정된 평가 기준 하에서의 자기 개선을 다루었으나, 평가 기준 자체가 변하는 경우의 안정성 문제는 정립되지 않았다.
저자는 자기 개선 시스템을 네 계층(기본 허용성, 인증된 안정적 이득, 부채 제한 안정성, 거버넌스 안전)으로 분리하고, 재생 가능한 관찰 인터페이스를 통해 각 계층의 안정성을 수학적으로 정의한다. 구체적으로 타입-노이즈 비교기 증명서, 재생 가능 상태 리프트, 하위-오라클 안정적 이득 구간, 지연된 섀도 인증, 모순 의무, 의미 보존 마진, 증명 전달 레인, 미해결 하방 부채 준비금 등을 도입하여 안정성 조건을 도출한다.
주요 결과는 안정성과 성장 주장이 발행된 재생 가능 계측 및 보수적 포락체 객체에 조건부로 명시되어야 함을 보인 것이다. 또한 결합된 개선자-평가자-메모리-큐 루프에 대한 소규모 이득 스타일 안정성 래퍼, 인증된 창 수축 조건, 지연된 감사 하의 재생 가능 하위 증명서, 명시적 체제-정책 쌍에 대한 비교 정리를 유도했다. 특히 거버넌스 편집이 즉각적인 생산 능력 증분을 주지 않더라도, 재생, 도전, 모순 보존, 승격, 증명, 검증 인터페이스가 충분히 강력하다면 프런티어 확장 투자가 될 수 있음을 보였다.