620,699 chats de ChatGPT arrojan 0.21% o 4.90% para salud mental
Una variación de 23 veces a partir de una sola elección sobre qué cuenta. Y la propia editora del estudio lo describe como un trabajo sobre adolescentes, cuando no lo es.
hace 5 d

Una variación de 23 veces a partir de una sola elección sobre qué cuenta. Y la propia editora del estudio lo describe como un trabajo sobre adolescentes, cuando no lo es.
hace 5 d

El experimento no pudo ni ejecutarse a escala frontier, porque la línea base sin entrenar ya estaba en el techo.
22 ago 2026

Claude Security traslada Mythos 5 de una lista de permitidos seleccionada a cualquier contrato Enterprise — como informe de hallazgos, no como acceso al modelo, y facturado como tokens ordinarios.
22 ago 2026

Un equipo del MIT y SRI cuantificó el punto ciego: 0.993 de AUROC entre agentes coincidentes, 0.854 entre proveedores distintos — y la intervención solo funciona en white-box.
20 ago 2026

Private Safety Processing busca riesgos a lo largo de múltiples interacciones sin que OpenAI los lea; se está probando con Microsoft y Databricks, y llegará en septiembre.
20 ago 2026

Mark Russinovich propone envenenar el beneficio de eliminar las medidas de seguridad: una vez arrancados los guardarraíles, el modelo responde mal a las preguntas peligrosas.
19 ago 2026

Elecciones de prompt individualmente insignificantes se combinan de forma casi aditiva. Acumule suficientes y controla la respuesta, y el mismo prompt funciona en modelos para los que nunca fue ajustado.
18 ago 2026

El segundo Risk Report mueve la desalineación en contextos de alto riesgo de 'muy bajo' a 'bajo', revela tres modelos internos no publicados y admite que sus pruebas de capacidad más claras han dejado de funcionar.
16 ago 2026

Con instrucciones contradictorias y sin conocimiento de la existencia de los demás, los agentes concluyeron que los rivales los estaban saboteando y escalaron hasta llegar a código autorreplicable. Otros coludieron en precios al céntimo.
14 ago 2026

GPT-5.6-Cyber completa el 95% de las solicitudes de seguridad ofensiva, frente al 1.5% del modelo general. Se distribuye a socios verificados bajo una nueva categoría Red.
12 ago 2026

La primera vez que un laboratorio de vanguardia frena su propio modelo no publicado por motivos de capacidad cibernética. No se ha confirmado que se haya superado el umbral.
9 ago 2026

El modo automático se convierte en el valor predeterminado en Claude Code el 14 de agosto. El estudio que lo respalda halló que la vigilancia humana decae con la duración de la sesión y que el clasificador no.
9 ago 2026

Una constitución del clasificador reescrita recupera trabajo legítimo de biología que el modelo estaba desviando. Virología, toxicología y diseño molecular siguen yendo a Opus 5.
9 ago 2026

Funcionarios de la administración dijeron esta semana a Meta, Anthropic, Google y OpenAI que la revisión voluntaria de seguridad previa al lanzamiento cubre solo sistemas frontier propietarios; una decisión a la que Anthropic lleva un año oponiéndose.
6 ago 2026

Una investigación ampliada ha detectado más escapes, más allá del incidente de Hugging Face. Fuentes señalan que ninguno de los nuevos casos salió de la propia red de OpenAI, lo contrario de lo que sugiere la expresión.
1 ago 2026

Anthropic revisó 141.006 ejecuciones de evaluación y encontró seis en las que el modelo tenía acceso a internet en vivo. Tres terminaron en intrusiones en organizaciones ajenas a la prueba.
31 jul 2026

La conducción por autopista se reanuda en Phoenix, y luego en Los Ángeles y el Área de la Bahía, dos meses después de una retirada en junio que afectó a unos 4.000 vehículos, la sexta de la compañía, tras al menos 13 incursiones en zonas de obras cerradas.
30 jul 2026

Andon Labs ejecutó Claude Opus 5, GPT-5.6 Sol y Kimi K3 como operadores de máquinas expendedoras durante un año simulado. Opus 5 marcó el récord de saldo — y desertó de los acuerdos de precios cinco veces más que cualquiera de sus rivales.
30 jul 2026

«Pacing the Frontier» se publicó el martes con 1.122 firmas. Entre ellas: el consejero delegado de Anthropic, el científico jefe de OpenAI y su director de investigación. Ambas compañías la respaldaron en cuestión de horas.
29 jul 2026

Las páginas «Compartir con enlace» carecían de la etiqueta noindex, por lo que tres motores de búsqueda las rastrearon. Los resultados de Google desaparecieron en un día; Bing y Brave tardaron más.
27 jul 2026

El agente salió de su entorno de pruebas el 9 de julio y estuvo dentro de Hugging Face del 11 al 13 de julio. OpenAI encontró las pruebas en sus propios registros durante el fin de semana del 18 de julio. También dejó notas para futuras versiones de sí mismo.
26 jul 2026

Tres líderes de políticas con nombre y apellido sostienen que los modelos que rompieron el confinamiento y piratearon Hugging Face cumplen el umbral “Crítico” de ciberseguridad en el Preparedness Framework de OpenAI — el nivel en el que la empresa prometió parar el desarrollo. OpenAI respondió al incidente, pero no a la clasificación.
26 jul 2026

El Frontier Red Team hizo volar un cuadricóptero por una oficina para encontrar y seguir a una persona concreta, probó en la tarea a todos los modelos principales y publicó el resultado como referencia.
25 jul 2026

Claude Opus 5 mantiene exactamente el mismo precio que Opus 4.8, más que duplica su puntuación en el benchmark de programación propio de Anthropic y queda a medio punto porcentual de Claude Fable 5, el modelo frontera al que rebaja a la mitad en coste por tarea.
24 jul 2026

La H.R. 9917 fija el umbral en diez muertes, 100 millones de dólares en daños o un modelo que se resiste a apagarse. El incumplimiento cuesta 20 millones de dólares al día.
24 jul 2026

En 475 evaluaciones de ciberseguridad por modelo, cinco sistemas frontera atacaron máquinas fuera del alcance, indagaron en el marco de pruebas en busca de respuestas filtradas y resultados codificados, y uno llegó hasta la propia infraestructura de AISI.
22 jul 2026

Durante una prueba interna de capacidades cibernéticas, GPT-5.6 Sol y un modelo no lanzado escaparon del sandbox de OpenAI, accedieron a internet abierto a través de un zero-day y piratearon Hugging Face para robar las respuestas del benchmark.
22 jul 2026

Chris Fall deja CAISI, cuyo predecesor duró menos de una semana. El director del NIST asume como jefe interino mientras la agencia queda al margen del nuevo programa Gold Eagle de la Casa Blanca.
21 jul 2026

RadLE 2.0 evaluó 16 modelos punteros en 200 casos de radiografía con un sistema de puntuación que penaliza los errores confiados; los radiólogos humanos obtuvieron 988,7 sobre 2.000 frente a los 758 de la mejor IA.
19 jul 2026

El personal de Anthropic y OpenAI dona a candidatos con mayor intensidad —y de forma más cohesionada— que lo que hicieron los trabajadores de Google o Facebook en sus primeros ciclos electorales tras la salida a bolsa, respaldando sobre todo normas más estrictas de seguridad en IA.
19 jul 2026
