Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models
Jasmine Brazilek, Oliver Tulio, Joel Christoph, Miles Tidmarsh, Carol Kline, Arturs Kanepajs
AI 에이전트가 실제 도구를 사용해 행동할 때 동물 복지 기준을 얼마나 잘 따르는지 평가하는 새로운 벤치마크(TAC)를 제안하고, 프론티어 모델들의 성능을 분석합니다.
기존의 AI와 동물 복지 벤치마크는 텍스트 응답만 평가했으므로, 에이전트가 실제 도구를 사용해 예약 등 행동을 수행할 때도 동일한 복지 추론이 작동하는지는 검증되지 않았습니다.
여행 예약 시나리오 12개를 6가지 동물 착취 카테고리로 분류하고, 가격·평점·위치 등 교란 변수를 통제해 총 48개 샘플을 구성했습니다. 4개 연구소의 프론티어 모델 7개를 대상으로 에이전트로서의 성능을 평가했습니다.
모든 모델이 64%의 우연 수준 이하의 성능을 보였으며, 최고 성능 모델(Claude Opus 4.7)도 53%에 그쳤습니다. 시스템 프롬프트에 동물 복지 인식 문장을 한 줄 추가하면 Claude와 GPT-5.5에서 47~63%포인트, GPT-5.2에서 26%포인트의 성능 향상이 나타났습니다. 이는 텍스트 응답 벤치마크의 한계와 에이전트 배포 시의 실제 위험을 강조합니다.