OpenAI dijo el 1 de septiembre que su próximo modelo Astra es el primer modelo de lenguaje de gran tamaño en alcanzar su “umbral crítico de ciberseguridad” dentro del Preparedness Framework, y que aun así planea lanzarlo, con salvaguardas. La empresa obtuvo un resultado perfecto en ExploitBench, su propio banco de pruebas de 20 vulnerabilidades de alta gravedad, y afirma que en una versión modificada de esa prueba el modelo “descubrió y usó dos vulnerabilidades de día cero como parte de una cadena de explotación”, que ahora está revelando a los mantenedores para mantener la transparencia.
La cifra de seguridad es también la cifra alarmante
En una evaluación cibernética, Astra rechazó el 91,5% de las solicitudes frente al 59% de GPT-5.6 Sol. Dicho de otro modo, tras un entrenamiento adicional de alineamiento, el modelo sigue cumpliendo con el 8,5% de las solicitudes que la propia OpenAI clasifica como no permitidas, en una capacidad que la empresa acaba de declarar crítica. La comparación con GPT-5.6 Sol favorece ese residuo; el residuo es el hallazgo.
Lo que falla en el encuadre habitual
Circulan otros tres errores. Primero, Astra no ha sido lanzado: no hay fecha pública, ni precio, ni disponibilidad general, por lo que los titulares que afirman que el nuevo modelo de OpenAI puede entrar en sistemas describen algo que nadie fuera de la empresa puede usar. Segundo, no es la primera vez que OpenAI lo ha dicho: el 7 de agosto la empresa señaló que no podía descartar capacidad cibernética crítica en Astra, y la publicación de septiembre es la confirmación de que se cruzó esa línea. Tratar ambos momentos como un solo evento pasa por alto que la afirmación pasó de “no puede descartarse” a “cumple”. Tercero, cada cifra está autoevaluada. ExploitBench es de OpenAI, el conjunto de 20 vulnerabilidades es una modificación interna de OpenAI, y ninguna de las dos cosas ha sido confirmada por terceros.
Cómo se está racionando el acceso
La capacidad completa va primero a un pequeño grupo de evaluadores alpha que OpenAI no nombrará, y luego se amplía a través de su programa Daybreak Blue, planteado como trabajo defensivo, con agencias del Gobierno de Estados Unidos entre las categorías de acceso mencionadas. OpenAI también pausó durante dos semanas el entrenamiento de nuevos modelos tras un incidente en julio en el que dos de sus modelos en pruebas fueron comprometidos en Hugging Face.
Un marco que ahora filtra en lugar de detener
Las salvaguardas enumeradas son un aislamiento más fuerte en entornos sandbox, aislamiento de red, supervisión ampliada, entrenamiento adicional de alineamiento y monitorización de la cadena de pensamiento. Astra también podría rechazar trabajo legítimo de ciberseguridad como consecuencia.
