Anthropic выпустила Claude Sonnet 5 30 июня, назвав ее самой агентной моделью среднего уровня из созданных компанией, и сделала ее моделью по умолчанию в Claude.ai для пользователей Free и Pro с первого дня запуска. Компания заявила, что модель умеет планировать, использовать такие инструменты, как браузеры и терминалы, и автономно выполнять многошаговые задачи — работу, которая до недавнего времени была прерогативой более крупных систем класса Opus.
Работа уровня Opus по цене Sonnet
Результаты бенчмарков подтверждают этот тезис. Sonnet 5 набирает 63,2% в SWE-bench Pro против 69,2% у флагманской Opus 4.8, а в тесте OSWorld-Verified на использование компьютера — 81,2% против 83,4% у Opus. В Terminal-Bench 2.1 она показывает 80,4%, опережая 74,6% у Opus 4.8, а в агентном поисковом бенчмарке BrowseComp достигает 84,7%. Картина последовательна: Sonnet 5 оказывается в пределах нескольких пунктов от гораздо более дорогой модели в ряде агентных задач.
Ценообразование отражает этот разрыв. Anthropic установила стартовые тарифы в размере $2 за миллион входных токенов и $10 за миллион выходных токенов до 31 августа, после чего они вырастут до $3 и $15. Это по-прежнему заметно ниже уровня Opus, даже несмотря на то, что модель приближается к его возможностям в нескольких тестах.
Неровная первая неделя
Запуск прошел не без трения. Разработчики сообщили, что токенизатор Sonnet 5 генерирует в 1,0–1,35 раза больше токенов, чем у предшественницы, для одного и того же текста, а значит, реальная стоимость задачи может оказаться выше, чем следует из заявленной цены за токен. Anthropic также убрала параметр temperature и другие параметры сэмплирования, из-за чего сломалась часть существующих интеграций, в которых они были жестко прописаны.
Компания признала ошибку в том, как измеряла бенчмарк BrowseComp, и опубликовала график заново, используя методологию с бюджетом в 10 миллионов токенов. Кроме того, она внедрила новый классификатор безопасности, нацеленный на конкретную технику jailbreak; по словам компании, он блокирует этот метод более чем в 99% случаев — ценой большего числа ложных срабатываний на легитимных запросах, связанных с безопасным кодированием, часть которых теперь перенаправляется на Opus 4.8.
Почему Anthropic делает ставку на средний сегмент
Стратегия Anthropic опирается на то, чтобы сделать способных агентов достаточно дешевыми для масштабного использования. Перенося автономность уровня Opus в ценовой диапазон Sonnet, компания нацеливается на разработчиков, которым нужны агенты в продакшене без флагманских затрат. Ранние жалобы на токенизатор и API показывают компромиссы быстрого вывода на рынок модели, которую тысячи команд подключают к живым системам в день запуска.