#оценка моделей

Anthropic

Anthropic повысила собственную оценку риска несоответствия — и не из‑за Model 2

Во втором Risk Report риск несоответствия в критически важных сценариях повышен с «very low» до «low», раскрыты три не выпущенные внутренние модели и признано, что самые точные тесты возможностей перестали работать.

16 авг. 2026 г.

Разбросанные белые клавиши клавиатуры на оранжевом фоне.
Модели ИИ

«Гонка бенчмарков — не главное»: руководители WAIC призывают переосмыслить оценку ИИ

Поскольку стандартные лидерборды переполнены и загрязнены, лидеры китайского ИИ заявили, что реальная эффективность в задачах — и такие метрики, как «ежедневно активные агенты», — должны заменить статичные бенчмарки.

19 июл. 2026 г.

Таблица лидерборда бенчмарков ИИ на экране