General-purpose large language models outperform specialized clinical AI tools
일반 목적 LLM(GPT-5.2, Gemini 3.1 Pro, Claude Opus 4.6)이 전문화된 임상 AI 도구(OpenEvidence, UpToDate Expert AI)보다 MedQA, HealthBench, 실제 임상 질의 벤치마크에서 더 높은 성능을 보였다. 연구는 12명의 미국 임상의가 블라인드 평가한 1,800개 주석을 포함한 3단계 평가를 수행했다.
일반 목적 LLM(GPT-5.2, Gemini 3.1 Pro, Claude Opus 4.6)이 전문화된 임상 AI 도구(OpenEvidence, UpToDate Expert AI)보다 MedQA, HealthBench, 실제 임상 질의 벤치마크에서 더 높은 성능을 보였다는 연구 결과가 Nature Medicine에 발표되었다.
임상 AI 도구는 도메인 특화 학습이나 RAG를 통해 일반 LLM보다 우수한 성능을 약속하지만, 그 아키텍처와 훈련 파이프라인이 공개되지 않아 독립적 평가가 부족했다. 이 연구는 12명의 미국 임상의가 블라인드 평가한 1,800개 주석을 포함한 3단계 평가를 통해 이를 검증했다.
전문화된 임상 AI 도구가 실제 임상 환경에서 일반 목적 LLM보다 반드시 우수하지 않을 수 있으며, 임상 도입 전 독립적이고 실제 환경에서의 평가가 필요함을 시사한다.