Anthropic은 미국 정부가 수출통제를 부과해 일반 제공이 중단됐던 Claude Fable 5 모델을 2026년 7월 1일 전 세계 사용자들에게 다시 제공했습니다. 해당 조치는 보다 특화된 Mythos 5도 함께 대상으로 삼았으며, 약 3주 만에 해제됐습니다. 복원과 함께 회사는 AI “jailbreak”의 실제 심각도를 평가하는 업계 공통 프레임워크 제안을 내놓았습니다.

중단이 진행된 경위

Fable 5와 Mythos 5는 6월 9일 공개됐습니다. 6월 12일 미국 정부가 수출통제를 적용했고, 6월 26일에는 미국 내 조직의 Mythos 5 접근을 승인했으며, 6월 30일에는 해당 통제를 해제했습니다. 이어 7월 1일 Fable 5가 전 세계에 다시 배포됐습니다. Anthropic은 두 모델을 구분하고 있습니다. Fable 5는 일반 사용을 위한 강력한 안전장치를 갖추고 있고, Mythos 5는 안전장치가 상대적으로 적으며 방어적 사이버보안 업무에만 쓰이도록 설계됐습니다.

논란의 중심이 된 jailbreak

이번 통제는 Amazon 연구진의 보고서에서 비롯됐습니다. 연구진은 Fable 5에 특정 소프트웨어 취약점을 식별하도록 유도했을 때, 해당 취약점 하나를 악용하는 방법을 보여주는 코드를 생성했다고 밝혔습니다. Anthropic은 자체 테스트 결과 이 약점이 자사 모델에만 국한된 것은 아니었다고 말했습니다. Claude Opus 4.8, GPT-5.5 및 Kimi K2.7도 동일한 취약점을 식별할 수 있었고, 테스트한 모든 모델이 같은 악용 시연 코드를 생성할 수 있었다는 것입니다. 회사는 이후 개선된 안전 분류기를 학습시켜 해당 특정 행위를 99% 이상의 사례에서 차단하고 있다고 밝혔습니다.

jailbreak를 점수화하는 프레임워크

이 같은 사건을 과도하게 해석하지 않기 위해 Anthropic은 jailbreak를 네 가지 기준으로 평가하자고 제안했습니다. capability gain(기존 도구보다 얼마나 더 큰 역량을 제공하는지), breadth(같은 기법으로 얼마나 많은 서로 다른 공격 작업을 가능하게 하는지), ease of weaponization(실제 공격으로 전환하는 데 인간의 노력이 얼마나 필요한지), discoverability(누군가 그 기법을 얼마나 쉽게 확보할 수 있는지)입니다. 회사는 Amazon, Microsoft, Google 및 다른 파트너들과, 그리고 미국 상무부 산하 AI Standards and Innovation 센터(CAISI)와 함께 이 접근법을 개발했다고 밝혔습니다.

정부와의 더 긴밀한 협력

이번 복원과 함께 Anthropic은 정부와의 협력을 위한 새로운 약속도 내놨습니다. 프런티어 모델에 대한 출시 전 접근 및 평가, 안전장치에 관한 더 빠른 정보 공유, 공동 연구를 위한 전담 자원, 그리고 공통의 업계 보안 표준 수립을 위한 작업이 그것입니다. Fable 5는 현재 Claude Platform, Claude.ai, Claude Code, Claude Cowork에서 다시 이용할 수 있으며, AWS, Google Cloud, Microsoft Foundry를 통한 접근도 가능한 한 빨리 복원될 예정입니다.