Measuring Epistemic Resilience of LLMs Under Misleading Medical Context
Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro 외
LLM이 의료 질문에 오해를 유발하는 맥락이 추가되면 정답률이 급락하는 현상을 측정하는 벤치마크 MedMisBench를 소개한다.
기존 의료 LLM 평가는 모델이 정적 질문에 얼마나 잘 답하는지만 측정할 뿐, 실제 환자 상담처럼 오정보가 섞인 상황에서도 올바른 판단을 유지하는지 평가하지 못한다.
MedMisBench는 10,932개의 의료 질문 항목과 48,889개의 오정보-선택지 쌍으로 구성된다. 오정보 유형은 권위 기반 거짓, 예외 중독, 대안 사실 등으로 나뉘며, 의료 추론, 에이전트 능력, 환자 여정 평가 등 다양한 영역을 포함한다. 11개 모델 구성에 대해 원본 질문과 오정보 포함 질문의 정확도를 비교했다.
원본 대비 오정보 포함 시 평균 정확도가 71.1%에서 38.0%로 하락했으며, 공격 성공률은 51.5%였다. 특히 권위 기반 거짓은 69.5%의 공격 성공률을 보였다. 7개국 14명의 임상 패널이 검토한 결과 38.2%의 사례에서 심각한 잠재적 피해가 확인되었다. 이 벤치마크는 LLM의 의료 안전성 평가에서 구조적 사각지대를 드러낸다.