Evaluating large language models for accuracy incentivizes hallucinations
A. Kalai, Ofir Nachum, S. Vempala, Edwin Zhang
정확도 기반 평가가 LLM의 추측을 보상하여 환각을 유발한다는 인센티브 관점의 이론적 분석.
LLM이 자신감 있게 사실과 다른 내용을 생성하는 환각 문제는 여전히 해결되지 않았으며, 기존 접근법은 원인을 충분히 설명하지 못함.
학습 이론을 통해 차기 단어 예측 학습이 반복되지 않는 사실에 대해 불가피한 오류를 만든다는 점을 증명하고, 정확도 메트릭이 추측을 보상함을 보임. '오픈 루브릭' 평가를 통해 모델이 불확실성을 인정하도록 유도하는 방안 제시.
환각을 인센티브 문제로 재정의하여 새로운 평가 방법론을 제안함으로써, 더 신뢰할 수 있는 LLM 개발을 위한 실용적 방향을 제시.