AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows
Jiahui Niu, Huizi Yu, Wenkong Wang, Guangxin Dai, Jingxian He, Xiang Li, Zhiying Liang, Xinxin Lin 외
실제 EHR 데이터를 활용해 LLM의 임상 상담 전 과정을 다차원적으로 평가하는 새로운 프레임워크를 제안한다.
기존 의료 LLM 평가는 정적이고 단일 턴적이거나 결과에만 집중하여, 실제 임상 상담의 순차적·불확실한·상호작용적 특성을 제대로 반영하지 못한다. 이는 모델의 실제 임상 활용 가능성을 과대평가하거나 잘못된 평가를 내릴 위험이 있다.