The Value Axis: Language Models Encode Whether They're on the Right Track
Nick Jiang, Isaac Kauvar, Jack Lindsey
언어모델이 현재 추론 궤적의 성공 가능성(가치)을 내부적으로 선형 인코딩하며, 이를 조작하면 모델의 자신감과 행동(자기 수정, 탐색 등)이 변화함을 보인 연구.
언어모델이 추론 과정에서 자신의 현재 전략이 목표 달성에 얼마나 유효한지 내부적으로 평가하는지, 그리고 그 평가가 어떻게 행동에 영향을 미치는지 규명.
합성 in-context 강화학습 데이터를 사용해 Qwen3-8B의 활성화 벡터에서 '가치 축'을 추출. 이 축을 따라 활성화를 조작(steering)하여 모델의 자기 수정, 탐색, 설명 장황함 등에 미치는 영향을 분석. 또한 DPO로 보상된 행동의 내부 가치를 높일 수 있음을 보임.
가치 축은 높은/낮은 자신감, 백트래킹 유무, 올바른/오염된 코드를 구분함. 높은 가치로 유도하면 자기 수정이 억제되고 설명이 간결해지며, 낮은 가치로 유도하면 백트래킹과 탐색이 증가. 정치적으로 민감한 질문에 대해 낮은 가치를 할당하는 등 실제 응용에서도 유효함을 확인.