SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Lijun Li, Bowen Dong, Ruohui Wang, Xuhao Hu, Wangmeng Zuo, Dahua Lin, Yu Qiao, Jing Shao
SALAD-Bench는 LLM 안전성 평가를 위한 대규모 계층적 벤치마크로, 공격 및 방어 방법 평가까지 포괄한다.
기존 LLM 안전성 벤치마크는 규모가 작거나 다양성이 부족하고, 공격 및 방어 방법 평가를 통합하지 못했다. 또한 복잡한 공격이 포함된 질문에 대한 신뢰할 수 있는 평가가 어려웠다.
SALAD-Bench는 3단계 분류 체계를 가진 대규모 질문 세트를 구축하고, 공격 및 방어 변형을 추가하여 다양한 난이도의 질문을 생성했다. 평가를 위해 LLM 기반 MD-Judge를 도입하여 공격이 포함된 QA 쌍도 안정적으로 평가할 수 있게 했다.
SALAD-Bench는 LLM 안전성 평가, 공격 방법 평가, 방어 방법 평가를 하나의 벤치마크로 통합하여 연구자들이 다양한 위협에 대한 LLM의 회복력과 방어 전략의 효과를 종합적으로 평가할 수 있게 했다.