Anthropic은 9월 1일 Claude Fable 5.1과 Mythos 5.1을 출시했고, 함께 퍼진 수치는 “약 25% 더 저렴하다”였습니다. 그러나 발표의 가격표는 더 좁은 내용을 보여줍니다. 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러는 Fable 5와 동일합니다. 달라진 것은 캐시 읽기 비용이 100만당 0.25달러로 75% 낮아진 것입니다.
흔한 해석이 놓치는 점
캐시 읽기에서만 발생하는 할인은 실제로 캐시된 접두사를 재사용하는 작업량에서만 존재합니다. 캐시 적중이 없는 단발성 호출은 지난주와 정확히 같은 비용이 듭니다. 에이전트형 작업에 대해 인용된 “최대 약 45%” 수치는 평균이 아니라 최선의 경우이며, 장시간 실행되는 에이전트가 같은 문맥을 반복해서 다시 읽기 때문에 바로 그 최선의 경우가 성립합니다. 이는 지능의 가격 인하가 아니라 반복의 가격 인하입니다.
두 이름, 하나의 모델
보도에서 또 하나 평평해지는 지점은 Fable 5.1과 Mythos 5.1이 동일한 기반 모델에 서로 다른 안전장치 수준을 적용한 것이라는 점입니다. Mythos는 신뢰된 접근 프로그램의 미국 법인에만 제한됩니다. Terminal-Bench 4.0에서 두 모델은 각각 55.8%와 60.9%를 기록했고, 이는 Mythos 5의 42.0%, Opus 5의 52.3%, GPT-5.6 Sol의 37.3%와 비교됩니다. 정확히 읽으면 두 수치의 5.1포인트 격차는 능력 차이가 전혀 아니라, 같은 가중치가 더 적은 거부를 낼 때의 결과입니다. 이는 안전 계층의 가격을 매긴 드문 공개 수치 가운데 하나입니다.
아무도 인용하지 않는 오차범위가 있는 벤치마크
주력 성과는 Terminal-Bench-Science 0.1로, Fable 5.1은 52.6%를 기록해 Fable 5의 24.7%, Opus 5의 29.0%, GPT-5.6 Sol의 22.4%를 앞섰습니다. Anthropic은 이 수치 옆에 모델당 ±3.5~4.5포인트의 명시된 오차범위를 함께 제시합니다. 다른 지표로는 GDPval-AA v2 1853(Fable 5: 1723), OSWorld 2.0 부분 기준 77.9%와 엄격 기준 41.7%, Humanity's Last Exam 도구 없이 60.9%, AutomationBench 31.4%가 있습니다.
더 적어진 개입, 더 좁아진 사이버 규칙
Anthropic은 생물학 안전장치가 무해한 요청에서 이제 85% 덜 자주 작동하고, 사이버보안 안전장치는 세션당 약 60% 적은 개입을 발생시킨다고 밝혔습니다. 정책 문구도 그에 맞춰 바뀌었습니다. Fable 5.1은 취약점을 발견하는 데는 사용할 수 있지만, 그 취약점을 악용하는 익스플로잇을 개발하는 데는 사용할 수 없습니다.
