Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity
Brett Reynolds
언어 모델의 안전 평가에서 발생하는 복잡한 언어적 모호성과 명령 충돌을 진단하기 위한 체계적인 벤치마크와 평가 프로토콜을 제안한다.
기존의 안전 평가 벤치마크들은 모델의 행동을 단순히 통과/실패(pass/fail)로만 분류하는 경향이 있다. 이는 실패가 모델의 능력 부족, 정책의 모호성, 명령 간의 충돌, 평가 프레임워크의 문제, 또는 평가자의 판단 불안정성 중 어떤 원인에 기인하는지 명확히 구분하지 못하게 만든다. 특히 명령 충돌, 내장 명령, 인용, 범위 모호성, 간접 화행 등 복잡한 언어 현상을 다루는 데 한계가 있다.
'적대적 화용론(Adversarial Pragmatics)'이라는 개념을 도입하여, 언어학적으로 제어된 분류 체계를 개발했다. 이 체계는 명령 충돌, 내장 명령, 인용, 범위 모호성, 지시어, 간접 화행, 멀티턴 에이전트 대화 등을 포괄한다. 18개의 시드 벤치마크 항목과 검증자 주도 메타데이터, 54줄의 로컬 시드 파일럿을 구축했다. 또한, 작업 성공, 정책 준수, 안전 위험, 거부 결과, 평가자 신뢰도를 구분하는 전문가 평가 프로토콜과 판별력 있는 지표들을 제시했다.
이 프레임워크는 언어학적 판단 방법론을 실제 도구로 전환하여, 안전 평가, LLM 판사 검증, 골드셋 구성, 프롬프트 인젝션 테스트, 안전 문서화 등을 위한 실용적인 기반을 제공한다. 기존 평가의 흑백적 한계를 극복하고, 실패 원인을 정밀하게 진단할 수 있는 방법론적 틀을 마련했다는 점에서 중요한 기여를 한다.