Команда, в которую вошли Princeton, UK AI Security Institute, Cornflower Labs, Georgetown и другие, 29 июля опубликовала работу Can AI agents conduct open-ended AI research?. Интересен прежде всего метод. Они взяли две неопубликованные заявки на NeurIPS 2026, дали агенту центральный исследовательский вопрос каждой статьи, а затем попросили реальных авторов этих работ оценить результаты как рецензенты конференции.
Постановка задачи
Claude Opus 4.8 с максимально высоким уровнем reasoning на каркасе OpenClaw, шесть дней в реальном времени, $3,000 в API-кредитах, GPU-кредиты, Linux VM и открытая сеть.
Инженерная часть сработала
Агенты провели масштабные обзоры литературы, отлаживали GPU-окружения, выполнили сотни экспериментов и проверки на устойчивость, а также собрали полноценные LaTeX-документы в финальном, готовом к подаче виде, без ручного вмешательства, кроме предоставления учетных данных и настройки репозитория. Они преодолели все проблемы среды, кроме одной. Заранее опрошенные девять из одиннадцати соавторов ожидали, что запуски завершатся неразрешимой ошибкой по кругу — они оказались слишком пессимистичны.
Исследование — нет
Отзывы авторов по шкале NeurIPS: первая статья получила 2/6 в целом, вторая — 1/6, при уверенности рецензентов 4 и 5 из 5. Обе были однозначно отклонены. Указанные причины провала: плохое понимание планки для публикабельного исследования, неоригинальные ответы на недостатки дизайна, неэффективные откаты от тупиковых решений, слабое понимание расхода ресурсов и смещение следования инструкциям.
Самая показательная деталь
Обе попытки завершились с расходом менее половины API-бюджета, несмотря на прямое поощрение использовать его, и обе отказались от своих самых амбициозных целей в первые десять часов и больше не меняли курс. В одном черновике было ноль визуализаций в основном тексте против 15 в оригинале. Повторный запуск на GPT-5.6 Sol воспроизвел сбои — и за два дня израсходовал весь бюджет в $3,000.
