Un team che riunisce Princeton, l'UK AI Security Institute, Cornflower Labs, Georgetown e altri ha pubblicato Can AI agents conduct open-ended AI research? il 29 luglio. Il metodo è la parte più interessante. Hanno preso due submission inedite per NeurIPS 2026, hanno affidato a un agente la domanda di ricerca centrale di ciascun paper e hanno chiesto ai veri autori dei paper di valutare i risultati come revisori di conferenza.

Il setup

Claude Opus 4.8 con reasoning extra-high sullo scaffold OpenClaw, sei giorni di tempo effettivo, 3.000 dollari in crediti API, crediti GPU, una VM Linux e il web aperto.

L'ingegneria ha funzionato

Gli agenti hanno completato ampie rassegne della letteratura, corretto ambienti GPU, condotto centinaia di esperimenti e test di robustezza, e compilato documenti LaTeX completi in formato camera-ready senza alcun intervento manuale oltre alle credenziali e alla configurazione del repository. Hanno risolto ogni ostacolo ambientale tranne uno. Interrogati in anticipo, nove dei undici coautori si aspettavano che le esecuzioni si arrestassero in un ciclo di errore irrisolvibile — erano troppo pessimisti.

La ricerca no

Le revisioni degli autori seguono le scale di NeurIPS: il primo paper ha ottenuto un punteggio complessivo di 2/6, il secondo 1/6, con una fiducia del revisore pari a 4 e 5 su 5. Entrambi sono stati rifiuti inequivocabili. Le modalità di fallimento indicate: scarso giudizio sulla soglia di una ricerca pubblicabile, risposte poco creative alle carenze di progettazione, backtracking inefficace dai vicoli ciechi, scarsa consapevolezza delle risorse e deriva delle istruzioni.

Il dettaglio più rivelatore

Entrambe le esecuzioni si sono concluse con meno della metà del budget API speso, nonostante un incoraggiamento esplicito a utilizzarlo, e in entrambi i casi hanno abbandonato i loro obiettivi più ambiziosi entro le prime dieci ore senza mai cambiare rotta. Una bozza conteneva zero visualizzazioni nel corpo principale contro le 15 dell'originale. Un nuovo run su GPT-5.6 Sol ha riprodotto i fallimenti — e ha consumato l'intero budget di 3.000 dollari in due giorni.