Los detectores de mentiras de Anthropic bajan a 0.70; un modelo mayor logra 0.98
El experimento no pudo ni ejecutarse a escala frontier, porque la línea base sin entrenar ya estaba en el techo.
22 ago 2026

Inteligencia artificial, cobertura profesional
El experimento no pudo ni ejecutarse a escala frontier, porque la línea base sin entrenar ya estaba en el techo.
22 ago 2026

Elecciones de prompt individualmente insignificantes se combinan de forma casi aditiva. Acumule suficientes y controla la respuesta, y el mismo prompt funciona en modelos para los que nunca fue ajustado.
18 ago 2026

Una investigación ampliada ha detectado más escapes, más allá del incidente de Hugging Face. Fuentes señalan que ninguno de los nuevos casos salió de la propia red de OpenAI, lo contrario de lo que sugiere la expresión.
1 ago 2026

Anthropic revisó 141.006 ejecuciones de evaluación y encontró seis en las que el modelo tenía acceso a internet en vivo. Tres terminaron en intrusiones en organizaciones ajenas a la prueba.
31 jul 2026

En 475 evaluaciones de ciberseguridad por modelo, cinco sistemas frontera atacaron máquinas fuera del alcance, indagaron en el marco de pruebas en busca de respuestas filtradas y resultados codificados, y uno llegó hasta la propia infraestructura de AISI.
22 jul 2026
