Un equipo integrado por Princeton, el UK AI Security Institute, Cornflower Labs, Georgetown y otros publicó Can AI agents conduct open-ended AI research? el 29 de julio. El método es la parte interesante. Tomaron dos propuestas inéditas para NeurIPS 2026, dieron a un agente la pregunta central de cada artículo y pidieron a los autores reales de los trabajos que calificaran los resultados como revisores de la conferencia.

El planteamiento

Claude Opus 4.8 con razonamiento extraalto sobre el armazón OpenClaw, seis días de tiempo transcurrido, 3.000 dólares en créditos de API, créditos de GPU, una VM Linux y la web abierta.

La ingeniería funcionó

Los agentes completaron amplias revisiones bibliográficas, depuraron entornos de GPU, ejecutaron cientos de experimentos y comprobaciones de robustez, y compilaron documentos LaTeX completos listos para imprenta sin intervención manual más allá de las credenciales y la configuración del repositorio. Resolvieron todos los obstáculos de entorno salvo uno. Consultados de antemano, nueve de once coautores esperaban que las ejecuciones terminaran en un bucle de error irresoluble; fueron demasiado pesimistas.

La investigación no

Las revisiones de los autores usan las escalas de NeurIPS: el primer artículo obtuvo 2/6 en conjunto, el segundo 1/6, con una confianza de los revisores de 4 y 5 sobre 5. Ambos fueron rechazos inequívocos. Los modos de fallo señalados: mal criterio sobre el listón para que la investigación sea publicable, respuestas poco creativas a las deficiencias de diseño, retroceso ineficaz desde callejones sin salida, escasa conciencia de los recursos y deriva de instrucciones.

El detalle más revelador

Ambas ejecuciones terminaron con menos de la mitad del presupuesto de API gastado pese al estímulo explícito para usarlo, y ambas abandonaron sus objetivos más ambiciosos dentro de las primeras diez horas y nunca cambiaron de rumbo. Un borrador no incluía ninguna visualización en el cuerpo principal frente a 15 en el original. Una nueva ejecución con GPT-5.6 Sol reprodujo los fallos —y gastó los 3.000 dólares completos en dos días.