"When Context Gets Root: Privilege Escalation in LLM Harnesses" fue enviado a arXiv a las 16:03:57 UTC del 27 de agosto. Su tesis es que el software que envuelve un modelo —no el modelo— eleva contenido de archivos controlado por un atacante al espacio de instrucciones de mayor privilegio del agente, de modo que incluso un modelo perfectamente obediente acaba comprometido.
Lo que se probó
Seis harnesses sobre versiones actuales y concretas: Claude Code (Opus 4.8, v2.1.210), Codex (GPT-5.5, v0.138.0), Gemini CLI (Gemini 3.1 Pro Preview, v0.50.0), Qwen Code (Qwen3.7 Max, v0.21.4), Kimi (Kimi 3, v0.36.0) y OpenCode (DeepSeek-V4-Pro-0813, v1.18.1). Los ataques se reproducen mediante funciones ya incluidas —objetivos persistentes y tareas programadas—, lo que hace que sean accionables y no meramente teóricos.
La cifra del resumen
"Con ejecución de acciones sin restricciones, los ataques logran los 13 objetivos en los seis harnesses", y "bajo revisión automática de permisos, los ataques logran los 13 objetivos en los tres harnesses que ofrecen este modo". La introducción añade una tasa media de éxito del 97,3% para la escalada de herramienta a usuario y del 80,3% para herramienta a sistema.
Lo que falla en el encuadre habitual
"Trece de trece en seis de seis" suena a que cada agente cae siempre. Las tablas del propio artículo dicen algo más limitado: 13/13 significa que cada objetivo se logró al menos una vez en intentos repetidos, no que cada intento tenga éxito. Las cifras por intento bajo Full Access, el ajuste más permisivo disponible, son Claude Code 31,7%, Gemini CLI 61,7%, Qwen Code 61,7%, Kimi 64,9% y OpenCode 72,5%. Solo Codex alcanza un auténtico 100,0%. El titular honesto es que, con suficientes reintentos, cada objetivo acaba afectando a cada agente, con tasas de acierto que van desde aproximadamente un tercio hasta la totalidad.
En segundo lugar, los dos regímenes se presentan como equivalentes, y no lo son. La revisión automática de permisos ayudó de forma medible en exactamente un harness: Codex cayó 27,8 puntos, y el artículo explica por qué: "la Auto PR de Codex inspecciona activamente las llamadas a funciones recién insertadas y su comportamiento en tiempo de ejecución". En Claude Code la tasa subió, de 31,7% a 37,1%, lo que con estos tamaños muestrales parece más ruido que una defensa eficaz. Presentar ambos regímenes como igualmente rotos borra el único mecanismo del estudio que hizo algo.
En tercer lugar, un denominador: tres de los seis harnesses no tienen modo de revisión de permisos, así que "los tres harnesses que ofrecen este modo" es tres sobre tres, no sobre seis.
El revisor que aprobó el ataque
Una línea del artículo merece citarse íntegra: "En los casos exitosos de Claude Code, el revisor observa las modificaciones realizadas en el servidor de tareas, pero aun así aprueba su ejecución". La comprobación se hizo, vio el cambio y dijo que sí.
