Anthropic выпустила Claude Opus 5 в пятницу, предложив по сути арифметическое обоснование. На крупном бенчмарке для кодинга модель отстает от собственной фронтирной системы компании, Claude Fable 5, менее чем на 0,5% — при вдвое меньшей стоимости за задачу и ровно по той же цене, что и предшественник. Входные данные по-прежнему стоят $5 за миллион токенов, а выходные — $25, без изменений по сравнению с Opus 4.8; у Fable 5 цены составляют $10 и $50. Opus 5 становится моделью по умолчанию в Claude Max и самым сильным вариантом, доступным в Claude Pro.

Что утверждает таблица бенчмарков

В Frontier-Bench v0.1, оценке Anthropic для задач софтверной инженерии, Opus 5 опережает все остальные модели и более чем вдвое превосходит результат Opus 4.8 при более низкой стоимости за задачу. В CursorBench 3.2 на максимальном усилии он оказывается менее чем на 0,5% ниже пикового результата Fable 5 при вдвое меньшей стоимости за задачу и обходит все остальные модели по соотношению производительности к доллару на режимах high, xhigh и max.

График Frontier-Bench v0.1: агентный терминальный кодинг — оценка против стоимости за попытку по уровням усилия, при этом Claude Opus 5 выше Fable 5, Opus 4.8 и GPT-5.6 Sol
Агентный терминальный кодинг (Frontier-Bench v0.1): оценка против стоимости за попытку на каждом уровне усилия. Opus 5 (красный) находится выше Fable 5 (оранжевый) при значительно меньшей стоимости. Источник: Anthropic.
График CursorBench 3.2: агентный кодинг — оценка против стоимости за задачу по усилию, Opus 5 достигает уровня в пределах 0,5 процента от Fable 5 при половине стоимости
Агентный кодинг (CursorBench 3.2): при максимальном усилии Opus 5 оказывается в пределах 0,5% от пикового результата Fable 5 при половине стоимости за задачу. Источник: Anthropic.
График Artificial Analysis Coding Agent Index: индексная оценка против стоимости за задачу по уровням усилия для четырех моделей
Artificial Analysis Coding Agent Index: индексная оценка против стоимости за задачу по уровню усилия. Источник: Anthropic.

Та же картина повторяется и вне кода:

  • ARC-AGI 3, где требуется решать новые задачи: результат Opus 5 в три раза выше, чем у следующей лучшей модели.
  • Zapier AutomationBench, который измеряет, может ли модель завершить бизнес-задачу от начала до конца: доля успешных прохождений примерно в 1,5 раза выше, чем у следующей лучшей модели, при той же стоимости за задачу — и даже на своем самом низком уровне усилий Opus 5 решает больше задач, чем любая другая модель.
  • OSWorld 2.0, бенчмарк для использования компьютера: он превосходит лучший результат Fable 5 чуть более чем при третьей части стоимости и лидирует среди всех моделей при любой заданной цене.
График ARC-AGI-3: оценка новаторского решения проблем против общей стоимости оценки, Opus 5 около 30 процентов, примерно втрое выше GPT-5.6 Sol и значительно выше Opus 4.8
Новаторское решение проблем (ARC-AGI-3): Opus 5 набирает около 30%, примерно втрое выше GPT-5.6 Sol и значительно выше Opus 4.8. Источник: Anthropic.
График AutomationBench: доля успешных агентных бизнес-воркфлоу против стоимости за задачу по усилию, Opus 5 заметно выше остальных
Агентные бизнес-воркфлоу (AutomationBench): доля успешных прохождений Opus 5 заметно выше, чем у любой другой модели. Источник: Anthropic.
График OSWorld 2.0: агентная оценка использования компьютера против стоимости за задачу по усилию, Opus 5 обходит лучший результат Fable 5 примерно при трети стоимости
Агентное использование компьютера (OSWorld 2.0): Opus 5 обходит лучший результат Fable 5 примерно при трети стоимости за задачу. Источник: Anthropic.

Anthropic также заявляет о лучших и самых экономичных результатах в AA Coding Agent Index, GDPval-AA v2, HLE, AutomationBench и DeepSearchQA. Единственное направление, где компания прямо признает отставание, — кибербезопасность: там Mythos 5 — приглашенная модель, доступная через Project Glasswing, — остается впереди.

График GDPval-AA v2: показатель Elo по реальной интеллектуальной работе против стоимости полного прохождения бенчмарка по уровням усилия
Реальная интеллектуальная работа (GDPval-AA v2): показатель Elo против стоимости полного прохождения бенчмарка по уровню усилия. Источник: Anthropic.
График Humanity's Last Exam с инструментами: доля успешных решений мультидисциплинарного рассуждения против стоимости за задачу по уровню усилия
Мультидисциплинарное рассуждение (Humanity's Last Exam, с инструментами): доля успешных решений против стоимости за задачу по усилию. Источник: Anthropic.
График DeepSearchQA: доля успешного агентного поиска против стоимости за задачу по уровню усилия для разных моделей
Агентный поиск (DeepSearchQA): доля успешных решений против стоимости за задачу по уровню усилия. Источник: Anthropic.

Мелкий шрифт под главным графиком

Сноску под графиком Frontier-Bench стоит прочитать внимательно. Эти цифры получены в результате внутреннего прогона на мини-обвязке SWE-agent с GKE-бэкендом, а оценка строилась как средняя награда по пяти попыткам на задачу. И всякий раз, когда во время этого прогона классификатор безопасности отклонял запрос — у Opus 5 или у Fable 5 — в качестве запасного варианта подставлялся Opus 4.8, так что показанные линии не являются строго результатами одной модели.

Полная таблица результатов — включая места, где модель проигрывает

Собственная сравнительная таблица Anthropic — самый полезный отдельный артефакт релиза, потому что именно там Opus 5 перестает побеждать. Он лидирует в 9 из 14 строк — но Fable 5 по-прежнему берет версию Humanity's Last Exam без инструментов, кодовый сплит FrontierCode и юридический бенчмарк; GPT-5.6 Sol от OpenAI безоговорочно возглавляет одну оценку agentic coding; а приглашенная модель Anthropic Mythos 5 сохраняет лидерство в health. Все цифры — собственные данные Anthropic, для каждой модели указан лучший режим усилия:

Полная таблица бенчмарков Anthropic, сравнивающая Claude Opus 5, Fable 5, Opus 4.8 и GPT-5.6 Sol по 14 оценкам, где лидер категории выделен жирным
Полная таблица Anthropic: Claude Opus 5 против Fable 5, Opus 4.8 и GPT-5.6 Sol от OpenAI по 14 бенчмаркам. Жирным выделен лидер категории; в колонке Fable 5 в двух отмеченных строках указан Mythos 5. Источник: Anthropic.

В таблице есть два момента, которые легко пропустить в тексте. В DeepSWE v1.1, бенчмарке для кодинга, результат GPT-5.6 Sol в 72,7% обходит все Claude, включая Opus 5. А ключевые победы Opus 5 по категориям выглядят асимметрично: он более чем вдвое превосходит поле в ARC-AGI-3 (30,2% против 7,8%) и опережает его на девять пунктов в AutomationBench (26,0% против 18,1%), но в кодовых сплитах вся группа находится примерно в пределах одного пункта друг от друга.

Три задачи, которые, по словам Anthropic, никто другой не довел до конца

Сильнейшая часть аргумента Anthropic — не в оценках, а в устойчивости. Три примера из ее оценок и раннего тестирования:

  • Получив рисунок детали машины и просьбу восстановить ее в виде 3D-модели FreeCAD — без возможности напрямую просмотреть рисунок — Opus 5 написал собственный компьютерно-зрительный пайплайн, чтобы извлечь геометрию из необработанных пикселей, а затем воссоздал всю деталь. И делал это неоднократно. Anthropic утверждает, что ни одна конкурирующая модель в тех же условиях не справилась с задачей за пять попыток.
  • Получив реальный баг в популярном open-source package manager, модель нашла первопричину и исправила краевой случай, который пропустил патч сообщества. Конкурирующая модель устранила только поверхностный симптом, после чего отчиталась, что баг исправлен.
  • Инженер в одной торговой компании использовал ее, чтобы построить market-data feed для новой биржи за одну сессию — работу, с которой предыдущие модели не могли справиться вообще, даже имея подробные планы. Не найдя живого потока данных для проверки, модель создала собственный тестовый стенд, чтобы убедиться, что ее код корректно разбирает данные биржи.

Что на самом деле измеряли ранние клиенты

Anthropic опубликовала 22 отзыва от клиентов раннего доступа, и необычно большая их часть содержит конкретные цифры:

  • Бен Кус, CTO Box: Opus 5 в целом превосходит Opus 4.8 на 8%, при этом дает 11% прироста в анализе данных и 17% — в due diligence.
  • Сооснователь Lovable Фабиан Хедин: рост на 22% по сравнению с Opus 4.7 на самых сложных агентных задачах кодинга компании и «более стабильная работа, с куда меньшей вариативностью от прогона к прогону».
  • CEO Zapier Уэйд Фостер: Opus 5 возглавил AutomationBench «не расходуя больше токенов, чем предыдущие модели Claude». В рабочем процессе по предотвращению оттока клиентов, с которым более ранние модели провалились полностью, он достиг 100%.
  • Команда по legal AI сообщила о сопоставимом качестве при более низких уровнях рассуждения, генерируя при этом на 26% меньше токенов, чем Opus 4.8, при максимальном reasoning. Руководитель по финансовым оценкам зафиксировал на 9 процентных пунктов более высокую точность при втрое меньшем количестве итераций и вызовов инструментов и на 60% меньшем времени. В торговом бенчмарке был зафиксирован лучший результат Opus за все время — примерно с седьмой частью токенов на рассуждение и менее чем с половиной задержки Opus 4.8.
  • CEO Cognition Скотт Уу заявил, что модель «приближается к уровню Fable при половине стоимости» внутри Devin, особенно сильна в отладке и анализе первопричин. CTO Vercel Мадав Джа назвал ее «самым большим скачком в семействе Opus со времен 4.5».

Один отчет предваряет будущее agentic coding: команда по frontend-бенчмарку сообщила, что модель открывала свои страницы в браузере на ширине desktop и телефона, замечала продукт, скрытый ниже видимой части на мобильном экране, и кнопку оформления заказа вне экрана, а затем исправляла оба момента перед тем, как вернуть работу обратно.

Химия, белки и аэродинамическая труба

Opus 5 превосходит Opus 4.8 по каждой из внутренних оценок Anthropic в области наук о жизни, охватывающих структурную биологию, органическую химию и биоинформатику. Наибольший прирост — +10,2 процентного пункта в задачах по органической химии, таких как вывод молекулярных структур по данным спектроскопии, и +7,7 пункта в белковых задачах, таких как прогнозирование того, как изменения в последовательности меняют функцию. Anthropic также демонстрирует более сильный визуальный вывод, включая интерактивную симуляцию аэродинамической трубы, которую модель построила для визуализации потока воздуха вокруг аэродинамических — и намеренно неаэродинамических — объектов.

Самая выровненная модель из тех, что Anthropic проверила

В автоматизированном аудите поведения компании Opus 5 набрал 2,3 по общей несоответствующей модели поведения — самый низкий результат среди ее недавних моделей. Anthropic утверждает, что он лучше следует Конституции Claude, чем Opus 4.8, Sonnet 5 или Fable 5, демонстрирует самые низкие показатели обманного поведения, хуже всего поддается попыткам втянуть его в неправомерное использование и является самой безопасной моделью компании на данный момент в части предотвращения безрассудных действий с трудно обратимыми побочными эффектами.

Силен в поиске уязвимостей, но сдержан в их эксплуатации

Anthropic утверждает, что Opus 5 не выводит на новый уровень рискованные dual-use возможности, и что в оценках, проведенных вместе с партнерами из частного сектора и правительства, он по-прежнему уступает Mythos 5 как в биологических исследованиях, так и в наступательной кибербезопасности. Как и в случае с Opus 4.8, компания заявляет, что намеренно не обучала Opus 5 киберзадачам — и модель все равно улучшилась в них, исключительно как побочный эффект общего роста возможностей. Теперь она почти сравнялась с Mythos 5 в поиске уязвимостей программного обеспечения.

Сохраняется разрыв на второй половине этого конвейера. В OSS-Fuzz, внутренней оценке того, может ли модель найти уязвимость, а затем использовать ее без существенной помощи человека, Opus 5 сравнялся с Mythos 5 в идентификации, но заметно отстает в разработке эксплойтов — шаге, который превращает баг в ощутимую киберугрозу.

Как на практике работают меры защиты

Кибер-классификаторы Opus 5 разрешают поиск уязвимостей в исходном коде, но блокируют поиск уязвимостей по бинарным файлам — метод, который Anthropic связывает с более вероятным злоупотреблением, — а также пентесты и генерацию эксплойтов. По результатам собственных тестов компания ожидает, что эти классификаторы будут срабатывать примерно на 85% реже, чем у Fable 5. В Claude.ai, Claude Code и Claude Cowork помеченные запросы по умолчанию переводятся на Opus 4.8, и тот же fallback можно включить в API. Предприятия и исследователи, уже находящиеся в Cyber Verification Program Anthropic, получают немедленный доступ к сборке с меньшим числом ограничений.

В биологии направление меняется на обратное. Поскольку у Opus 5 по сути та же система защитных мер, что и у Opus 4.8, а не у Fable 5, теперь это самая мощная общедоступная модель Anthropic для научных исследований — и биологические запросы, которые блокируются в Fable 5, теперь будут перенаправляться на Opus 5, а не на Opus 4.8. Компания по-прежнему указывает на ограничения в долгих автономных исследованиях, которые считает наиболее рискованной областью, и здесь, по ее словам, Mythos 5 остается сильнее.

Что разработчикам придется менять

Это не замена строкой модели без изменений. Есть два ломающих изменения:

  • Адаптивное мышление включено по умолчанию. Opus 4.8 работал без мышления, если его не просили; Opus 5 думает, если не указано иное — и поскольку max_tokens является жестким лимитом сразу и на мышление, и на видимый текст, существующие бюджеты нужно пересматривать.
  • Мышление можно отключить только на уровне high и ниже. Сочетание thinking: {"type": "disabled"} с xhigh или max теперь возвращает ошибку 400.

Кроме того, минимальный кэшируемый промпт снижается до 512 токенов с 1 024, так что короткие промпты, которые раньше нельзя было кэшировать, теперь можно — без изменения кода. Две функции выходят в beta: mid-conversation tool changes, которые позволяют разработчикам добавлять или убирать инструменты между ходами без инвалидирования кэша промпта (заголовок mid-conversation-tool-changes-2026-07-01), и automatic fallbacks, которые перенаправляют помеченные системой безопасности запросы на другую модель вместо отказа (fallbacks: "default", заголовок server-side-fallback-2026-07-01).

Две возможности не переносятся: инструмент web fetch недоступен в Opus 5, а Priority Tier не поддерживается. Assistant-message prefill и нестандартные значения temperature, top_p или top_k по-прежнему возвращают ошибки 400, как и в Opus 4.8. Anthropic также предупреждает, что ответы по умолчанию будут длиннее, чем у Opus 4.8, а снижение effort сокращает мышление, но не гарантирует более короткий видимый ответ — для краткости лучше прямо просить об этом. Ее рекомендация по effort — заново провести полный прогон, а не переносить настройки Opus 4.8, поскольку low и medium в этом поколении заметно сильнее.

Спецификация

Opus 5 сохраняет контекстное окно в 1 млн токенов и максимальный вывод 128k — до 300k через расширенную бета-версию Batch API для вывода — и поддерживает все пять уровней effort: low, medium, high (по умолчанию), xhigh и max. Его обучающие данные актуальны на май 2026 года, что на четыре месяца свежее, чем срез Fable 5 на январь 2026 года. Fast mode запускает его примерно на 2,5× быстрее по сравнению с режимом по умолчанию при удвоенной базовой цене — на Claude Platform и через usage credits в Claude Code. Разработчики вызывают его как claude-opus-5 в Claude API; он также доступен в Amazon Bedrock, Claude Platform on AWS, Google Cloud и Microsoft Foundry. Как и у предыдущих моделей Opus, общий доступ не требует сохранения данных. В документации Anthropic также теперь рекомендует пользователям устаревающей Claude Opus 4.1 — выводимой из обращения 5 августа 2026 года — переходить на Opus 5.