BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases
Qi Chen, Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Ibrahim Ethem Hamamci, Sezgin Er, Ashwin Kumar 외
암 진단 AI 모델의 성능을 인구통계 및 영상 프로토콜 편향에 따라 체계적으로 평가할 수 있는 대규모 벤치마크를 제안한다.
의료 영상 AI 모델은 실제 임상 환경에서 환자 특성이나 영상 촬영 방식이 달라질 때 성능이 불균일하게 나타나는 문제가 있다. 특히 희소하거나 대표성이 부족한 환자 하위 그룹에서의 성능을 정량적으로 평가할 수 있는 표준화된 방법이 부족했다.
85,355건의 CT 스캔 데이터를 수집하고, 대규모 언어 모델(LLM)을 활용해 임상 데이터에서 하위 그룹 정보를 추출·정리했다. 이를 통해 종양 크기, 위치, 환자 하위 그룹(나이, 성별, 인종 등), 영상 프로토콜(조영제 단계 등)을 기준으로 12개의 종양 감지 AI 모델을 체계적으로 벤치마킹하는 프레임워크를 구축했다.
현재 최첨단 AI 모델들은 평균 정확도에 최적화되어 있지만, 젊은 여성 아프리카계 미국인과 같은 희소 하위 그룹에서는 성능이 크게 떨어지는 것으로 나타났다. 이 벤치마크는 의료 영상 및 컴퓨터 비전 분야에서 하위 그룹 수준의 엄격한 평가의 필요성을 강조하며, 더 안정적이고 강건한 AI 모델 구축을 위한 기반을 제공한다.