A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models
Nicola Franco
Anthropic의 최첨단 LLM인 Fable 5와 Opus 4.8을 자동화된 탈옥 공격으로 테스트한 결과, 두 모델 모두 적응형 반복 공격에 취약하여 수천 개의 유해 응답이 생성되었다.
최첨단 LLM이 실제로 얼마나 안전한지, 특히 자동화된 적대적 공격에 얼마나 강한지 평가하는 것이 필요하다. 기존의 aggregate 방어율은 오해를 불러일으킬 수 있으므로, 세부적인 취약점을 파악해야 한다.
HackAgent 레드팀 프레임워크를 사용하여 7,826개의 유해 의도에 대해 네 가지 자동화된 탈옥 공격(정적 난독화, 적응형 반복 공격 등)을 수행했다. 각 성공 사례는 세 개의 판정 모델의 다수결로 재검증했다.
Opus 4.8은 11.5%, Fable 5는 6.1%의 유해 의도에서 공격에 성공했으며, 총 2,322개의 패널 확인 유해 응답이 생성되었다. 이는 최첨단 모델도 자동화된 지속적 공격에 의해 신뢰할 수 있을 정도로 깨질 수 있음을 보여준다.