Команда Frontier Red Team в Anthropic совместно с Andon Labs дала 15 ИИ-моделям управление настоящим квадрокоптером и попросила их пролететь через офис, найти конкретного человека и следовать за ним. Результаты и набор задач были опубликованы в пятницу под названием Drone-Bench.
Как оценивали
Задачу разложили на пять подзадач, включая Reconstruct — преобразование офисного видео в 3D-модель, — и Localize, сопоставление обзора дрона с 2D-картой препятствий. Точкой сравнения был не человек без помощи: базовый уровень задали человеко-ИИ-команды с использованием coding agents. Формулировка в духе «модели сравнялись с людьми» неверно описывает то, что измерялось.
Где предел
Обнаружение и сопровождение достигли почти 100% от базового уровня. Reconstruction к середине 2026 года достигла лишь примерно 47%, и именно она сдерживает всю задачу. Самая сильная модель обошла базовый уровень по каждой подзадаче, кроме реконструкции, — но в среднем превзошла его только по трем из пяти.
Заявленные ограничения
Anthropic опубликовала ограничения, а не спрятала их: низкая скорость дрона, один план офисного этажа, ограниченное число людей, отсутствие тестов на улице и отсутствие толпы. Протестированные модели охватывали 15 релизов от трех разработчиков примерно за два года прогресса.
Какие модели
15 релизов охватывают примерно два года прогресса frontier-моделей у трех разработчиков — от GPT-4o и o1 через Gemini 2.5 Pro и последовательные релизы Claude Opus до нынешнего поколения. Читать их как временной ряд — в этом и состоит смысл: обнаружение и сопровождение почти насыщены, а реконструкция почти не сдвинулась.
Граница управления
Команда прямо обозначила риск: когда пороги надежности будут пройдены, возникнет реальное давление, чтобы рассматривать человеческий надзор как издержку, а не как защитную меру.
