Calibration Without Comprehension: Diagnosing the Limits of Fine-Tuning LLMs for Vulnerability Detection in Systems Software
Arastoo Zibaeirad, Marco Vieira
LLM의 시스템 소프트웨어 취약점 탐지 능력을 정량적으로 진단하는 CWE-Trace 프레임워크를 제안하고, 미세조가 보안 추론 능력을 근본적으로 향상시키지 못함을 보임.
LLM이 취약점 벤치마크에서 높은 성능을 보일 때, 이는 진정한 보안 추론 능력 때문인지 아니면 훈련 데이터 오염에 의한 패턴 매칭 때문인지 명확히 구분할 수 없는 문제.