Assessing and Improving Prompting Large Language Models for Software Vulnerability Analysis
Yu Nong, Guangbei Yi, M. Aldeen, Long Cheng, Hongxin Hu, Haipeng Cai
소프트웨어 취약점 분석에 LLM을 체계적으로 평가하고, 취약점 의미론을 활용한 새로운 프롬프팅 기법(VSP)을 제안하여 성능을 개선합니다.
LLM이 소프트웨어 취약점 분석(탐지, 분류, 수정)에 얼마나 효과적인지, 그리고 프롬프트 엔지니어링을 통해 어떻게 성능을 향상시킬 수 있는지 체계적인 평가가 부족했습니다.
10개의 LLM과 7가지 프롬프팅 전략을 5개의 실제 데이터셋(8,000개 이상의 C/C++ 샘플 포함)에서 3가지 취약점 분석 과제에 대해 9개의 기존 기법과 비교하는 대규모 실험을 수행했습니다. 분석을 통해 LLM의 오류 추론 문제를 발견하고, 취약점 의미론을 활용한 체인 오브 소트(CoT) 프롬프팅인 VSP를 개발했습니다.
기존 프롬프팅 전략으로는 LLM이 기존 기법에 비해 성능이 떨어지는 경우가 많았습니다. 제안된 VSP는 특정 LLM과 설정에서 세 가지 과제 전반에 걸쳐 성능을 향상시키고 추론 한계를 완화했습니다. 또한 LLM의 오답을 유발하는 7가지 공통 과제를 식별하고 완화를 위한 실용적인 권장 사항을 제공했습니다.