Статья, поданная в arXiv 17 августа 2026 года в 17:20 UTC Энриком Бойкс-Адсерой и Бенедиктом Тесслером, описывает явление, которое авторы называют model hypnosis: по отдельности слабые и, казалось бы, несущественные подсказки в промпте — опечатка, перефразирование, не относящееся к делу замечание — можно систематически объединять, чтобы сильно контролировать то, что говорит модель.
Ключевой тезис
По словам авторов, эффект "возникает во всех семействах и масштабах моделей, включая frontier reasoning models, а hypnotic prompts могут переноситься между моделями." Именно перенос имеет наибольшее значение: промпт, настроенный на управление одной моделью, сохраняет направляющее действие и на другой модели, созданной другой организацией и никогда не оптимизировавшейся под него. Контроль обеспечивается не одной мощной инструкцией, а накоплением множества незаметных текстовых решений, каждое из которых само по себе выглядело бы как шум.
Что неверно в распространённой трактовке
Это будут подавать как новый jailbreak. Но это не он, и различие принципиально. Jailbreak ломает отказ — заставляет модель выдавать контент, который она была обучена скрывать. Model hypnosis — это steering: она смещает ответ, который модель даёт в открытых и самоотчётных вопросах. Здесь не описывается обход какого-либо защитного барьера. Вторая вероятная ошибка — считать эффект одинаково подавляющим. Сильное смещение внутреннего предпочтения модели меняет видимый ответ только тогда, когда изначально модель и так была почти в сомнении; в вопросах, где у неё твёрдая позиция, те же подсказки сдвигают запас прочности, не меняя вывода.
Почему это особенно важно для исследователей интерпретируемости
Авторы называют интерпретируемость областью, для которой здесь возникает самая серьёзная проблема, и логика неприятна. Значительная часть опубликованных работ спрашивает у моделей о них самих — есть ли у вас цель, осознаёте ли вы себя, почему вы ответили именно так — и рассматривает ответ как измерение модели. Если выбор формулировки на уровне опечатки способен в сумме управлять ответом, то оценка по одному шаблону измеряет не только модель, но и сам шаблон. Любой результат, построенный на одной формулировке одного вопроса, остаётся нефальсифицируемым, пока его не проверят на распределении перефразировок.
Практическое следствие
Методология бенчмарков обычно исходила из того, что случайные особенности формулировки промпта — это шум, который в среднем взаимно компенсируется. Эта статья утверждает, что это сигнал, который накапливается. Это не отменяет существующие оценки, но означает, что заявленные различия между моделями могут быть меньше, чем вариативность, которую целенаправленный автор промптов способен создать внутри одной модели.
