PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
Wei Zou, Runpeng Geng, Binghui Wang, Jinyuan Jia
RAG 시스템의 지식 데이터베이스에 소수의 악의적 텍스트를 주입하여 LLM이 특정 질문에 대해 공격자가 원하는 답변을 생성하도록 유도하는 지식 오염 공격(PoisonedRAG)을 제안한다.
RAG는 외부 지식 데이터베이스를 활용해 LLM의 환각과 최신성 부족 문제를 완화하지만, 데이터베이스의 신뢰성을 가정한다. 공격자가 데이터베이스에 악의적 텍스트를 삽입하여 LLM의 출력을 조작할 수 있는 보안 취약점이 존재한다.
공격 목표를 최적화 문제로 정식화하여, 타겟 질문에 대해 타겟 답변을 생성하도록 유도하는 악성 텍스트 집합을 찾는다. 블랙박스 설정에서는 경사 기반 근사 최적화를, 화이트박스 설정에서는 직접 경사 하강법을 사용한다. 악성 텍스트는 자연스러운 문장 형태로 생성되어 탐지를 회피한다.
수백만 개의 텍스트 중 5개만 주입해도 90%의 공격 성공률을 달성하며, 기존 방어 기법(예: perplexity 필터, 유사도 기반 탐지)으로는 효과적으로 방어되지 않음을 보인다. RAG 시스템의 보안 취약성을 최초로 체계적으로 분석하고, 새로운 방어 연구의 필요성을 제기한다.