Anthropic은 14일 Responsible Scaling Policy 버전 3.4에 따른 두 번째 Risk Report를 공개했다. 이 보고서는 이전 보고서인 2월 24일부터 2026년 7월 15일까지의 기간을 다룬다.
변경된 등급
자율성 위협 모델 1, 즉 고위험 환경에서의 정렬 불일치에 대해 Anthropic은 전체 위험을 이제 Low로 평가했으며, 이는 명시적으로 very low에서 상향된 것이다. 프런티어 랩이 자체 위험 평가를 상향 조정하는 일은 그 자체만으로도 기사감일 만큼 드물다.
보도들이 원인을 잘못 짚는 이유
대부분의 보도는 이 상승을 보고서가 공개한 공개되지 않은 내부 모델 3개 중 가장 강력한 Model 2와 연결한다. 그러나 보고서는 그렇게 말하지 않는다. 보고서는 이번 상향의 원인을 사이버보안 평가에서의 모델 행동과 관련한 최근 사고 공개에 대한 전반적 불확실성 증가로 설명하며, Model 2는 별도 섹션에서 다룬다. "Anthropic이 안전 문제로 모델을 보류했다"는 표현도 과도하다. 회사가 밝힌 이유는 사전 배포 평가가 불충분하고 현재 출시 계획이 없다는 것이지, 안전 판정이 아니다.
Model 2란 무엇인가
Anthropic은 Model 2를 프런티어 모델 Claude Mythos 5보다 다소 더 유능하며 여러 내부 작업에서 눈에 띄는 향상을 보인다고 설명한다. 다만 Claude Opus 4.6에서 Mythos Preview로의 도약과 같은 수준의 상승은 아니라고 덧붙였다. 공개되지 않은 시스템 3개는 Claude Opus 5, Model 1, Model 2다.
방법론에 묻힌 인정
Anthropic은 자동화된 AI R&D 위험을 Low로 유지했지만, 가장 구체적인 과제 기반 평가가 saturated, 즉 더 이상 역량 증가를 포착하지 못하게 되면서 이전보다 신뢰도가 낮아졌다고 밝혔다. 또한 AI의 도움으로 내부 연구가 상당히 더 빠르게 진행되고 있다고 보고했지만, 아직 두 배의 속도에는 이르지 못했다고 했다. 자체 가속도를 측정하는 데 쓰던 도구를 잃어버린 랩의 문제는 어느 하나의 모델보다 더 오래가는 문제다.
분류기 공백
별도로, 보고서는 비신규 화학·생물학 무기 위험을 our previous estimate보다 높은 low로 평가했다. 모든 human-feedback vendor traffic이 생물학 분류기를 차단하지 않은 채 운영되고 있다는 사실이 드러났기 때문이다. Anthropic은 이 공백을 수정했으며, 오남용 증거는 없고 고객 영향도 없었다고 밝혔다. 전체적으로 시점에 유의할 필요가 있다. coverage date는 7월 15일이므로, 이번 평가 전체는 공개되기 한 달 전의 상태를 설명한다.
