Operadic consistency: a label-free signal for compositional reasoning failures in LLMs
Nathaniel Bottman, Yinhong Liu, Kyle Richardson
연산적 일관성(OC)은 LLM이 다중 추론 질문에 대해 직접 답변과 분해 후 조합한 답변의 일치 여부를 측정하여, 정답 레이블 없이 추론 실패를 탐지하는 방법이다.
LLM의 추론 실패를 추론 시점에 감지하는 것은 신뢰성 향상에 중요하지만, 기존 방법(자기일관성, 의미 엔트로피 등)은 복잡한 다중 추론 질문에서 성능이 저하된다. 특히, 모델이 분해 가능한 질문을 제대로 조합하지 못하는 오류를 잡아내기 어렵다.
연산 이론의 개념을 차용하여, 각 질문에 대해 모델의 직접 답변과 질문을 하위 질문으로 분해한 후 각각의 답변을 조합한 답변 간의 일관성을 점수화한다. 이 점수(OC)를 12개의 다양한 LLM과 4개의 다중 추론 QA 데이터셋에서 평가하고, 기존 신호들과 비교한다.
OC는 모든 데이터셋에서 정확도와 강한 상관관계(Pearson r 0.86-0.94)를 보였으며, 선택적 예측(정확도 대비 커버리지)에서 기존 방법보다 일관되게 우수한 성능을 보였다. 특히, 모델 자체의 사고 사슬에서 분해를 추출한 최신 모델에서도 효과적이었다.