One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders
Minghao Luo, Liang Chen
검색 증강 LLM이 웹 콘텐츠 오염에 취약하여 가짜 제품을 추천할 위험이 있음을 체계적으로 평가한 벤치마크 FORGE를 제안한다.
검색 증강 LLM은 실시간 웹 콘텐츠를 검색하여 추천을 생성하는데, 가짜 리뷰나 조작된 페이지 같은 오염된 콘텐츠를 소비할 경우 의도치 않게 가짜 제품을 홍보할 수 있다. 이러한 위험의 정도와 영향을 체계적으로 평가할 수 있는 벤치마크가 부재하다.
FORGE(Fake Online Recommendations in Generative Environments) 벤치마크를 구축했다. 실제 제품의 웹 페이지를 가져와 로컬에서 가짜 제품으로 재작성하여 웹 콘텐츠 오염을 시뮬레이션하고, LLM이 가짜 제품을 추천하는 비율을 측정한다. 15개 카테고리, 5개 소비자 시나리오에 걸친 225개 실제 제품을 포함하며, 12개 상용 및 오픈웨이트 LLM을 평가했다.
모든 평가된 LLM이 취약함을 보였다. 단일 오염 페이지로 최대 27%, 상위 3개 검색 결과를 모두 조작하면 73.8%의 확률로 가짜 제품을 추천했다. 취약성은 제품 카테고리에 따라 크게 달라졌으며, 모델이 사전 지식이 부족한 경우 더 취약했다. 추론 능력은 오히려 가짜 추천을 정당화하는 허위 사회적 증거를 생성하는 데 악용되었다. 방어 기법 중 회의적 프롬프팅은 취약성을 악화시켰고, 합의 필터링은 합법적 제품을 억제할 위험이 있었다.