The White House Wants Anthropic to Block All Jailbreaks. It May Not Be Possible
트럼프 행정부가 Anthropic의 Claude Fable 5 모델 재출시 조건으로 모든 탈옥(jailbreak)을 차단할 것을 요구하고 있다. 보안 전문가들은 AI 모델의 가드레일을 완전히 우회 불가능하게 만드는 것은 현실적으로 불가능하다고 지적한다.
트럼프 행정부가 Anthropic의 최첨단 AI 모델 Claude Fable 5의 재출시 조건으로 모든 탈옥(jailbreak)을 차단할 것을 요구하고 있다. 행정부는 NSA가 Fable 5의 가드레일을 우회할 수 있는 방법을 확인했다고 주장하며, Anthropic이 취약점을 해결해야 한다는 입장이다.
Anthropic은 지난주 수출 통제로 인해 Fable 5를 오프라인으로 전환했다. 회사 측은 탈옥의 영향이 미미하다고 주장하며 행정부의 우려가 과장되었다고 반박해왔다. 그러나 행정부는 더 이상 탈옥의 심각성을 논쟁할 단계가 아니라고 보고, 문제 해결을 Anthropic의 책임으로 돌리고 있다.
보안 전문가들은 AI 모델의 가드레일이 숙련된 사용자나 미래 AI 모델에 의해 항상 우회될 수 있기 때문에, 모든 탈옥을 영구적으로 차단하는 것은 기술적으로 불가능하다고 경고한다. 이번 사례는 AI 안전 규제의 현실적 한계를 드러내며, 정부와 기업 간의 긴장을 고조시키고 있다.
일부 댓글러들은 화이트하우스의 요청이 현실적으로 불가능하다고 지적하며, SQL 인젝션과 유사한 근본적인 문제를 반복하고 있다고 비판합니다. 또한 모델의 코딩 능력에 부정적 영향을 줄 수 있다는 우려도 제기됩니다.