Um artigo submetido ao arXiv às 17:20 UTC de 17 de agosto de 2026 por Enric Boix-Adsera e Benedict Tessler descreve um fenômeno que os autores chamam de hipnose do modelo: pistas individualmente fracas e aparentemente irrelevantes em um prompt — um erro de digitação, uma paráfrase, uma observação lateral sem relação — podem ser combinadas de forma sistemática para controlar fortemente o que um modelo diz.
A tese central
Nas palavras dos autores, o efeito "ocorre em famílias e escalas de modelos, inclusive em modelos de raciocínio de fronteira, e prompts hipnóticos podem ser transferidos entre modelos." A transferência é a parte mais importante: um prompt ajustado para conduzir um modelo mantém seu efeito direcional em um modelo diferente, construído por uma organização diferente, contra o qual os autores nunca o otimizaram. O controle não vem de uma única instrução poderosa, mas do acúmulo de muitas escolhas textuais discretas, cada uma das quais pareceria ruído isoladamente.
O que a leitura comum erra
Isso será descrito como uma nova forma de jailbreak. Não é, e a distinção importa. Um jailbreak derrota uma recusa — faz um modelo produzir conteúdo que foi treinado para reter. A hipnose do modelo é direcionamento: ela move qual resposta um modelo dá em perguntas abertas e de autorrelato. Nada aqui é descrito como burla de um limite de segurança. O segundo erro provável é tratar o efeito como uniformemente avassalador. Um grande deslocamento na preferência interna de um modelo só muda a resposta visível quando o modelo já estava perto da indecisão; em perguntas nas quais ele tem uma posição firme, as mesmas pistas alteram a margem sem mudar a saída.
Por que pesquisadores de interpretabilidade deveriam se importar mais
Os autores apontam a interpretabilidade como a área com o maior problema aqui, e o raciocínio é desconfortável. Grande parte do trabalho publicado pergunta aos modelos sobre si mesmos — você tem um objetivo, você está ciente, por que respondeu assim — e trata a resposta como uma medição do modelo. Se escolhas no nível de um erro de digitação na formulação da pergunta podem ser combinadas para controlar a resposta, então uma avaliação com um único template mede o template tanto quanto o modelo. Qualquer resultado baseado em uma única formulação de uma única pergunta é infalsificável até ter sido testado contra uma distribuição de paráfrases.
A consequência prática
A metodologia de benchmark, em geral, pressupôs que a redação incidental do prompt é ruído que se anula na média. Este artigo argumenta que ela é sinal que se acumula. Isso não invalida as avaliações existentes, mas significa que diferenças relatadas entre modelos podem ser menores do que a variação que um autor de prompts determinado consegue fabricar dentro de um único modelo.
