Un paper inviato su arXiv alle 17:20 UTC del 17 agosto 2026 da Enric Boix-Adsera e Benedict Tessler descrive un fenomeno che gli autori chiamano model hypnosis: segnali deboli e apparentemente irrilevanti in un prompt — un refuso, una parafrasi, una nota fuori tema — possono essere combinati sistematicamente per controllare in modo forte ciò che un modello dice.

L’affermazione centrale

Nelle parole degli autori, l’effetto "si osserva in famiglie e scale diverse di modelli, inclusi i modelli di reasoning frontier, e i prompt ipnotici possono trasferirsi tra modelli." Il trasferimento è l’aspetto che conta di più: un prompt tarato per orientare un modello conserva il proprio effetto direzionale su un modello diverso, costruito da un’altra organizzazione, contro cui gli autori non lo hanno mai ottimizzato. Il controllo non deriva da un singolo comando potente, ma dall’accumulo di molte scelte testuali poco appariscenti, ciascuna delle quali presa da sola sembrerebbe rumore.

Che cosa sbaglia la cornice comune

Questo verrà presentato come un nuovo jailbreak. Non lo è, e la distinzione conta. Un jailbreak supera un rifiuto — induce un modello a produrre contenuti che era stato addestrato a trattenere. La model hypnosis è steering: sposta quale risposta un modello fornisce a domande aperte e di autovalutazione. Qui non si descrive alcun aggiramento di una barriera di sicurezza. Il secondo errore probabile è considerare l’effetto uniformemente travolgente. Un forte spostamento della preferenza interna di un modello ribalta la risposta visibile solo quando il modello era inizialmente quasi indeciso; sulle domande in cui ha una posizione netta, gli stessi segnali spostano il margine senza cambiare l’output.

Perché i ricercatori di interpretabilità dovrebbero preoccuparsene di più

Gli autori indicano l’interpretabilità come il campo con il problema più grande, e il ragionamento è scomodo. Gran parte della letteratura pubblicata chiede ai modelli informazioni su se stessi — hai un obiettivo, sei consapevole, perché hai risposto così — e tratta la risposta come una misurazione del modello. Se scelte a livello di refuso nel modo in cui la domanda viene formulata possono essere sommate per controllare la risposta, allora una valutazione basata su un singolo template sta misurando il template tanto quanto il modello. Qualsiasi risultato costruito su una sola formulazione di una sola domanda è non falsificabile finché non viene testato contro una distribuzione di parafrasi.

La conseguenza pratica

La metodologia dei benchmark ha in generale dato per scontato che il wording incidentale del prompt sia rumore che si media via. Questo paper sostiene che sia segnale che si accumula. Non invalida le valutazioni esistenti, ma significa che le differenze riportate tra modelli possono essere più piccole della variazione che un prompt-writer determinato può creare all’interno di un singolo modello.