Un artículo enviado a arXiv a las 17:20 UTC del 17 de agosto de 2026 por Enric Boix-Adsera y Benedict Tessler describe un fenómeno que los autores llaman hipnosis del modelo: señales en un prompt débiles individualmente y aparentemente irrelevantes —una errata, una paráfrasis, una acotación sin relación— pueden combinarse sistemáticamente para controlar con fuerza lo que dice un modelo.

La afirmación central

En palabras de los autores, el efecto "ocurre en distintas familias y escalas de modelos, incluidos los modelos frontera de razonamiento, y los prompts hipnóticos pueden transferirse entre modelos". La transferencia es la parte más importante: un prompt ajustado para guiar a un modelo conserva su efecto direccional en otro modelo distinto, construido por otra organización, contra el que los autores nunca optimizaron. El control no procede de una sola instrucción potente, sino de la acumulación de muchas elecciones textuales discretas, cada una de las cuales parecería ruido por sí sola.

Qué falla en el encuadre habitual

Esto se presentará como un nuevo jailbreak. No lo es, y la distinción importa. Un jailbreak vence una negativa: hace que un modelo produzca contenido que fue entrenado para retener. La hipnosis del modelo es direccionamiento: desplaza qué respuesta da un modelo en preguntas abiertas y de autoinforme. Aquí no se describe ninguna elusión de un límite de seguridad. El segundo error probable es tratar el efecto como uniformemente abrumador. Un gran movimiento en la preferencia interna de un modelo solo cambia la respuesta visible cuando el modelo partía de una posición poco decidida; en preguntas en las que mantiene una postura firme, las mismas señales desplazan el margen sin cambiar la salida.

Por qué los investigadores de interpretabilidad deberían preocuparse más

Los autores señalan la interpretabilidad como el campo con el mayor problema aquí, y el razonamiento resulta incómodo. Gran parte del trabajo publicado pregunta a los modelos sobre sí mismos —si tienen un objetivo, si son conscientes, por qué respondieron de esa manera— y trata la respuesta como una medición del modelo. Si elecciones al nivel de una errata en cómo se formula la pregunta pueden acumularse para controlar la respuesta, entonces una evaluación de una sola plantilla está midiendo la plantilla tanto como el modelo. Cualquier resultado basado en una sola formulación de una sola pregunta no es falsable hasta que se haya probado frente a una distribución de paráfrasis.

La consecuencia práctica

La metodología de benchmarks ha asumido en general que la redacción incidental del prompt es ruido que se promedia. Este artículo sostiene que es una señal que se acumula. Eso no invalida las evaluaciones existentes, pero sí significa que las diferencias informadas entre modelos pueden ser menores que la variación que un redactor de prompts decidido puede fabricar dentro de un mismo modelo.