Anthropic's Safety Superpower
앤트로픽이 안전 가드레일을 적용한 Fable 5 모델을 출시했지만, 탈옥 방법이 발견되자 미국 정부가 국가안보를 이유로 수출 통제 명령을 내려 모든 고객의 접근을 차단했다. 앤트로픽은 발견된 취약점이 사소하고 다른 모델에서도 발견 가능하다며 이의를 제기하고 있다.
앤트로픽이 안전 가드레일을 적용한 Fable 5 모델을 출시했으나, 탈옥 방법이 발견되자 미국 정부가 국가안보를 이유로 수출 통제 명령을 내려 모든 고객의 접근을 차단했다. 앤트로픽은 발견된 취약점이 사소하고 다른 모델에서도 발견 가능하다며 이의를 제기하고 있다.
앤트로픽은 이전에도 Mythos Preview라는 모델이 너무 위험하다며 공개를 제한한 바 있다. Fable은 Mythos의 안전 버전으로 출시되었으나, 출시 직후 탈옥 방법이 발견되었다. 정부는 국가안보 우려를 이유로 즉각적인 접근 차단을 명령했으며, 앤트로픽은 이에 대해 이의를 제기하며 워싱턴에서 해결 중이다.
이번 사건은 AI 모델의 안전성과 정부 규제 간의 긴장 관계를 보여준다. 앤트로픽과 정부 간의 갈등은 예견된 바 있으며, 향후 AI 규제 방향에 중요한 선례가 될 수 있다.
HN 댓글에서는 Anthropic의 Mythos 모델이 보안 취약점 탐지에서 기존 오픈소스 모델보다 우수하지만, 그 차이가 회사가 주장하는 것처럼 절대적이지 않다는 지적이 제기됐다. 일부 댓글러는 Mythos의 성과가 실제로는 취약점을 발견하고 연쇄적으로 악용하는 후처리 과정 덕분이며, 오픈소스 모델도 유사한 취약점을 찾을 수 있었다고 반박했다. 또한 Anthropic의 신중한 출시 정책에 대한 지지와 함께, 기업이 AI 안전을 구실로 통제를 강화한다는 비판적 시각도 공존했다.