#бенчмарки ИИ

Anthropic

«25% дешевле» у Fable 5.1 — это сокращение стоимости чтения кэша, а не токенов

Прайс Anthropic не изменился: вход по-прежнему стоит $10 за миллион токенов, выход — $50. Вся экономия приходится на чтение кэша, подешевевшее на 75% до $0.25, и проявляется только в нагрузках, которые переиспользуют префикс.

1 дн назад

Анонс Anthropic о запуске, где Claude Fable 5.1 и Mythos 5.1 набраны антиквой на фоне бледного неба с облаками и полумесяцем.
Инструменты ИИ

Модель Alibaba на 2.4-триллиона параметров выходит как закрытый API

Qwen3.8-Max вышла в понедельник утром с таблицей бенчмарков, где показала победы над GPT-5.6 Sol и Claude Fable 5. Та же таблица при полном прочтении показывает поражения по всем сложным агентным и инженерным тестам.

3 авг. 2026 г.

Иллюстрация рассвета над горами и водой с подписью «Qwen3.8-Max — модель MoE с 2,4 трлн параметров».
Регулирование ИИ в США

NIST создал тестовую среду, где разработчики моделей никогда не видят тестовые данные

AI Technology Evaluation оценивает модели на слепых наборах данных, которые никогда не были публичными, и только так можно понять, не был ли результат бенчмарка заучен. Никакой нормативной силы это не имеет.

28 июл. 2026 г.

Абстрактное бирюзово-зелёное цифровое изображение светящихся частиц и схем, используемое как баннер на сайте AI challenges NIST
ИИ в здравоохранении

Новый бенчмарк показал: ИИ, читающий рентген, может опасно переоценивать себя, когда ошибается

RadLE 2.0 протестировал 16 передовых моделей на 200 рентгеновских случаях, используя систему оценки, которая штрафует уверенные ошибки; врачи-рентгенологи набрали 988,7 из 2 000 против 758 у лучшего ИИ.

19 июл. 2026 г.

Рентген грудной клетки на экране
Модели ИИ

«Гонка бенчмарков — не главное»: руководители WAIC призывают переосмыслить оценку ИИ

Поскольку стандартные лидерборды переполнены и загрязнены, лидеры китайского ИИ заявили, что реальная эффективность в задачах — и такие метрики, как «ежедневно активные агенты», — должны заменить статичные бенчмарки.

19 июл. 2026 г.

Таблица лидерборда бенчмарков ИИ на экране