MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
Suhyun Lee, P. Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng
LLM 멘탈헬스 상담의 안전성을 다중 턴 상호작용 수준에서 역할별로 진단하는 새로운 평가 프레임워크를 제안한다.
기존의 평가 방식은 단일 응답이나 정적 데이터셋을 평가하는 데 집중하여, 실제 상담처럼 여러 턴에 걸쳐 상호작용하면서 점진적으로 나타나는 위해의 축적과 맥락을 진단하는 데 한계가 있다.
최신 LLM들을 대규모로 평가한 결과, 기존 정적 벤치마크가 체계적으로 놓치고 있던 역할 의존적이고 누적된 안전 실패 사례를 발견했다. 본 프레임워크는 실패 모드의 범위와 진단적 세밀성을 크게 향상시켰다.