Evaluating and Understanding Model Editing for Medical Vision Language Models
Guli Zhu, Chenwei Wu, Liyue Shen
배포 후 의료 비전-언어 모델의 오류를 빠르게 수정하는 모델 수정 기법의 임상 적용 가능성을 체계적으로 평가하는 벤치마크 M3Bench를 제안한다.
기존 모델 수정 벤치마크는 일반 과제에 초점을 맞추어 의료 분야의 특수성(이미지·텍스트 변형, 모달리티 전환, 임상 지식 조합 등)을 충분히 고려하지 못한다. 이로 인해 수정된 모델이 실제 임상 환경에서 얼마나 안정적이고 일반화 가능한지 검증하기 어렵다.
다양한 해부학, 영상 기법, 진료 과목을 아우르는 16,276개의 질문으로 구성된 M3Bench를 개발했다. 이 벤치마크는 단일 수정과 순차 수정을 모두 지원하며, 대표적인 그래디언트 기반 및 메모리 기반 수정 방법 4가지를 6개의 의료 및 일반 비전-언어 모델에 적용하여 체계적으로 평가했다.
평가 결과, 어떤 방법도 모든 기준에서 뛰어나지 않았다. 그래디언트 기반 방법은 높은 전이 성능을 보였으나 국소성 위반 문제가 심각했고, 메모리 기반 방법은 국소성을 잘 유지했지만 조합적 일반화 능력이 부족했다. 본 연구는 모델 수정 실패 원인을 비전-언어 모델의 잠재 공간 기하학과 수정 방법에 따른 변화로 귀인하고, 보다 안전한 배포 후 모델 적응을 위한 실질적인 가이드를 제공한다.