Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 1 сентября, и главным числом, которое разошлось, стало «примерно на 25% дешевле». Но в таблице цен в анонсе сказано более узко: $10 за миллион входных токенов и $50 за миллион выходных токенов — оба показателя не изменились по сравнению с Fable 5. Изменилось только чтение кэша, подешевевшее на 75% до $0.25 за миллион.
Что не так в распространённой трактовке
Скидка, которая полностью заключается в чтении кэша, существует только для нагрузок, реально переиспользующих закэшированный префикс. Однократный запрос без попадания в кэш стоит ровно столько же, сколько и на прошлой неделе. Цифра «до примерно 45%», приведённая для агентных сценариев, — это лучший случай, а не типичный; и он лучший именно потому, что долго работающие агенты многократно перечитывают один и тот же контекст. Это не снижение цены на интеллект; это снижение цены на повторение.
Два названия, одна модель
Второй момент, который сглаживают в освещении темы, состоит в том, что Fable 5.1 и Mythos 5.1 — это одна и та же базовая модель на разных уровнях защиты, при этом Mythos доступен только для американских организаций в программах доверенного доступа. В Terminal-Bench 4.0 эта пара набирает 55.8% и 60.9% против 42.0% у Mythos 5, 52.3% у Opus 5 и 37.3% у GPT-5.6 Sol. Если читать эти цифры правильно, разрыв в 5.1 пункта между двумя версиями — это не разница в возможностях, а то, как одни и те же веса работают с меньшим числом отказов. Это одна из немногих публичных метрик, которая оценивает стоимость слоя безопасности.
Бенчмарк с погрешностью, которую никто не цитирует
Главный результат — Terminal-Bench-Science 0.1, где Fable 5.1 достигает 52.6% против 24.7% у Fable 5, 29.0% у Opus 5 и 22.4% у GPT-5.6 Sol. Рядом Anthropic указывает заявленную погрешность ±3.5–4.5 пункта на модель. Дальше: GDPval-AA v2 — 1853 (Fable 5: 1723), OSWorld 2.0 — 77.9% partial и 41.7% strict, Humanity's Last Exam — 60.9% без инструментов, AutomationBench — 31.4%.
Меньше вмешательств и более узкое правило для киберсферы
Anthropic утверждает, что биологические ограничения теперь срабатывают на 85% реже при безвредных запросах, а кибербезопасностные ограничения дают примерно на 60% меньше вмешательств за сессию. Вместе с этим сдвинулось и правило политики: Fable 5.1 можно использовать для обнаружения уязвимостей, но не для разработки эксплойтов для них.
