Une équipe réunissant Princeton, le UK AI Security Institute, Cornflower Labs, Georgetown et d’autres a publié Can AI agents conduct open-ended AI research? le 29 juillet. La méthode est la partie la plus intéressante. Ils ont pris deux soumissions NeurIPS 2026 inédites, donné à un agent la question de recherche centrale de chaque article, puis demandé aux auteurs réels d’évaluer les résultats comme des relecteurs de conférence.
Le dispositif
Claude Opus 4.8 avec un raisonnement extra-élevé sur l’architecture OpenClaw, six jours de temps d’exécution, 3 000 $ en crédits API, des crédits GPU, une VM Linux et le Web ouvert.
L’ingénierie a fonctionné
Les agents ont mené de vastes revues de littérature, débogué des environnements GPU, réalisé des centaines d’expériences et de vérifications de robustesse, et compilé des documents LaTeX complets, prêts pour la version finale, sans aucune intervention manuelle au-delà des identifiants et de la configuration du dépôt. Ils ont résolu tous les obstacles environnementaux sauf un. Interrogés à l’avance, neuf des onze co-auteurs s’attendaient à ce que les essais se terminent dans une boucle d’erreur insoluble — ils étaient trop pessimistes.
La recherche, non
Les auteurs ont noté les articles selon les échelles de NeurIPS : le premier a obtenu 2/6 au total, le second 1/6, avec un niveau de confiance des relecteurs de 4 et 5 sur 5. Les deux ont été des rejets sans équivoque. Les modes d’échec mentionnés : mauvais jugement sur le niveau requis pour une recherche publiable, réponses peu créatives aux lacunes de conception, incapacité à revenir efficacement sur des impasses, faible sens de l’optimisation des ressources et dérive des consignes.
Le détail le plus révélateur
Les deux essais se sont achevés avec moins de la moitié du budget API dépensé malgré un encouragement explicite à l’utiliser, et ils ont tous deux abandonné leurs objectifs les plus ambitieux dans les dix premières heures sans jamais changer de cap. L’une des versions préliminaires ne comportait aucune visualisation dans le corps principal, contre 15 dans l’original. Une nouvelle exécution sur GPT-5.6 Sol a reproduit les échecs — et a consommé la totalité des 3 000 $ en deux jours.
