Исследования ИИ
Новый бенчмарк по коду: 5.4% прошли, а не заявленные 47/100
Ключевой тезис статьи: поведенческие тесты позволяют агентам проходить оценку, просто копируя исходную реализацию. Авторы называют этот сбой и измеряют его частоту.
4 дн назад
