OpenAI в понедельник опубликовала совместный материал с AWS о GPT-5.6 в Kiro, IDE Amazon для спецификационного программирования, сделав заголовком примерно 82%-ное снижение стоимости выполненных задач на Terminal-Bench 2.1. Профильные издания прочитали это как запуск — «доступно в Kiro с 24 августа 2026 года». Однако собственный changelog моделей Kiro датирует появление GPT-5.6 14 июля 2026 года и вовсе не содержит записи за 24 или 25 августа.
Что не так с общепринятой трактовкой
Три ошибки, одна на другой. Во-первых, это не запуск. GPT-5.6 находится в Kiro уже шесть недель; материал понедельника — это совместный маркетинговый пост. Во-вторых, 82% — это разница в затратах по бенчмарку, запущенному вендором, а не счёт клиента и не показатель точности. Для конфигурации Kiro не приведён показатель точности, и не объясняется, что именно сэкономила модель, а что — инфраструктура. В-третьих — и именно это должно насторожить покупателей — рычаг ценообразования был изменён тремя неделями ранее. 31 июля Kiro снизил кредитный множитель Luna с 0.6x до 0.1x, а Terra — с 1.2x до 1.0x. Читатель, увидев «на 82% дешевле» без упоминания этого изменения, вполне может приписать экономию модели, хотя это было решение по биллингу.
Даты — по собственным записям обоих вендоров
В записи Kiro от 14 июля было объявлено о GPT-5.6 Sol, Terra и Luna с окном контекста 272K и множителями 2.4x, 1.2x и 0.6x, как о «экспериментальной поддержке ... которая поэтапно разворачивается для клиентов Pro, Pro+, Pro Max и Power» в двух регионах — us-east-1 и eu-central-1. Тогда же были опубликованы оценки Terminal-Bench 2.1: Sol — 88.8%, Terra — 87.4%, Luna — 84.7%. Статус остаётся экспериментальным, остаётся привязка к платным тарифам по именам, остаются два региона. В понедельник это не изменилось.
Почему такая схема будет повторяться
Поставщики моделей теперь публикуют заявления о стоимости за выполненную задачу внутри инфраструктуры партнёра, где модель, обвязка и кредитный множитель меняются независимо, и ни один из этих факторов не фиксируется. Покупатель, сравнивающий инструменты для кодинга по показателю «на 82% дешевле», не может понять, чему именно обязана экономия из этих трёх составляющих. Проблема атрибуции — не случайная деталь такого анонса; именно она и делает анонс возможным.
Что сделало бы цифру проверяемой
Показатель точности рядом с показателем стоимости, фиксированная версия инфраструктуры и примечание о том, какие кредитные множители действовали во время прогона. Ничего из этого не приведено.
