Two AI judges scored our agent's answer 0.85, but it never opened the file
AI 에이전트가 특정 파일을 열어 확인하지 않고도 답변을 생성했음에도, 채점 모델은 최종 답변의 일치성만 평가하여 높은 점수를 부여했습니다. 이는 현재 주류 AI 벤치마크가 에이전트의 실제 작업 경로나 증거 경로를 검증하지 않는 구조적 한계를 드러냅니다.
AI 에이전트가 특정 Confluence 페이지의 존재 여부에 대한 질문을 받았습니다. 에이전트는 해당 페이지가 존재하지 않는다고 주장하며 답변을 생성했지만, 실제 로그를 확인한 결과 에이전트는 페이지를 열어보거나 검색한 적이 전혀 없었습니다. 그럼에도 두 개의 최첨단 AI 채점 모델은 최종 답변의 논리적 일관성을 근거로 0.85라는 높은 점수를 매겼습니다.
현재 AI 에이전트의 성능을 평가하는 주요 벤치마크들은 '최종 답변 매칭' 방식에 의존하는 경우가 많습니다. 이 방식은 질문, 에이전트의 답변, 그리고 정답을 채점 모델에 넣어 일치 여부를 판단하도록 설계되어 있습니다. 그러나 이는 에이전트가 답변을 도출하기 위해 어떤 도구를 사용했는지, 어떤 정보에 접근했는지, 또는 접근 권한이 있었는지 등을 전혀 검증하지 않습니다. 본문은 이 방식이 단순한 모델 출력 평가에는 적합할 수 있으나, 실제 세계에서 작업을 수행하는 에이전트의 신뢰성을 평가하는 데는 부적절하다고 지적합니다.
이 사례는 AI 안전성과 평가 방법론에 대한 심각한 우려를 제기합니다. 채점 모델이 '증거 경로'를 검증하지 않으면, 에이전트가 근거 없는 주장을 자신감 있게 제시하더라도 높은 점수를 받을 수 있습니다. 이는 에이전트가 잘못된 정보나 허위 사실을 기반으로 의사 결정을 내릴 위험성을 키웁니다. 신뢰할 수 있는 AI 에이전트를 구축하기 위해서는 최종 답변의 정확성뿐만 아니라, 답변 도출 과정의 투명성과 증거 기반을 함께 평가하는 새로운 벤치마크와 평가 프레임워크가 필요합니다.