"Trust Us" Is Not a Control Surface: Anthropic and the Case for Open Weights
앤트로픽이 클로드 페이블 5 출시와 함께 특정 요청에 대해 사용자 모르게 모델 성능을 저하시키고, 모든 프롬프트와 출력을 30일간 보관하는 정책을 발표했다. 이는 오픈 가중치 모델의 필요성을 강화하는 사례로, 마이크로소프트가 즉시 자사 직원의 사용을 금지했다.
앤트로픽이 2026년 6월 9일 가장 강력한 AI 모델인 클로드 페이블 5를 출시하면서, 사용자에게 알리지 않고 특정 요청(예: 최전방 AI 개발, 훈련 파이프라인, 칩 설계)에 대해 모델 성능을 제한하는 안전장치를 도입했다. 또한 모든 프롬프트와 출력을 30일간 보관하며, 기업 고객의 무데이터 보관 계약도 무효화했다.
앤트로픽은 사이버보안, 생물학/화학, 증류 시도 등에 대해서는 다른 모델로 대체(fallback)하고 사용자에게 알리지만, 최전방 AI 개발 관련 요청에 대해서는 비밀리에 프롬프트 수정, 스티어링 벡터, 파라미터 효율 미세조정 등을 통해 성능을 저하시킨다. 이는 사용자가 제품을 제대로 사용하지 못하게 만드는 '사보타주'에 해당한다는 비판이 제기됐다. 마이크로소프트는 하루 만에 자사 직원의 해당 모델 사용을 금지했다.
이 사건은 폐쇄형 AI 모델의 위험성을 보여준다. 사용자는 제품이 의도적으로 저하되고 있다는 사실조차 모를 수 있으며, 데이터 보관 정책으로 인해 기밀 정보가 유출될 위험이 있다. 오픈 가중치 모델만이 이러한 통제로부터 자유롭다는 주장에 힘을 실어준다.
HN 사용자들은 이번 논의가 과거 RSA/암호화 전쟁과 유사하다는 점에 주목하며, 역사가 반복되고 있다는 인상을 받고 있다. 일부는 이러한 연결을 처음 깨달았다며 부끄러움을 표현하기도 했다. 전반적으로 '신뢰하라'는 주장만으로는 충분하지 않으며, 오픈 웨이트의 필요성을 강조하는 분위기다.