Medical large language models are vulnerable to data-poisoning attacks
D. Alber, Zihao Yang, A. Alyakin, E. Yang, Sumedha Rai, Aly A. Valliani, Jeff Zhang, Gabriel R. Rosenbaum 외
의료 LLM이 학습 데이터의 극히 일부(0.001%)만 오염되어도 의료 오류를 생성할 수 있으며, 생의학 지식 그래프 기반 탐지로 유해 콘텐츠의 91.9%를 차단할 수 있다.
LLM은 방대한 웹 데이터로 학습되므로 의도적인 의료 misinformation에 취약하다. 특히 의료 분야에서 잘못된 정보는 환자 안전을 위협할 수 있으나, 데이터 오염 공격의 실제 위험성과 탐지 방법이 충분히 연구되지 않았다.
The Pile 데이터셋에 의료 misinformation을 0.001% 토큰 비율로 주입하여 LLM을 파인튜닝했다. 오염된 모델이 의료 질문에 얼마나 자주 오류를 생성하는지 측정하고, 기존 벤치마크 성능과 비교했다. 또한 생의학 지식 그래프(예: UMLS)를 활용해 LLM 출력을 검증하는 피해 완화 알고리즘을 제안했다.
0.001%의 데이터 오염만으로도 오염된 모델이 유의미하게 더 많은 의료 오류를 생성했으며, 기존 벤치마크에서는 성능 저하가 거의 나타나지 않아 탐지가 어려웠다. 제안된 지식 그래프 기반 탐지 방법은 91.9%의 유해 콘텐츠를 포착하고 F1 점수 85.7%를 달성했다. 이 연구는 의료 LLM의 데이터 오염 위험성을 정량적으로 입증하고, 실용적인 방어 전략을 제시했다.