2026년 8월 17일 17:20 UTC에 Enric Boix-Adsera와 Benedict Tessler가 arXiv에 제출한 논문은 저자들이 model hypnosis라고 부르는 현상을 설명한다. 프롬프트 속의 개별적으로는 약하고 겉보기에도 관련 없어 보이는 단서들 — 오타, 패러프레이즈, 무관한 덧붙임 — 이 체계적으로 결합해 모델이 말하는 내용을 강하게 통제할 수 있다는 것이다.

핵심 주장

저자들에 따르면, 이러한 효과는 "model families and scales 전반, including frontier reasoning models에서도 나타나며, hypnotic prompts는 models 간에 전이될 수 있다." 전이가 가장 중요한 부분이다. 한 모델을 유도하도록 조정한 프롬프트가, 다른 조직이 만들었고 저자들이 최적화 대상으로 삼지 않은 다른 모델에서도 방향성을 유지한다는 뜻이다. 이러한 통제는 단 하나의 강력한 지시문에서 비롯되는 것이 아니라, 각각은 단독으로 보면 잡음처럼 보일 수 있는 수많은 눈에 띄지 않는 텍스트 선택이 누적된 결과다.

통상적 해석이 놓치는 점

이는 새로운 jailbreak로 해석될 가능성이 크다. 그러나 그렇지 않으며, 그 차이는 중요하다. jailbreak는 거부를 무력화해 모델이 본래 억제하도록 훈련된 내용을 내놓게 만든다. model hypnosis는 steering이다. 즉, 개방형 질문이나 자기보고 질문에서 모델이 어떤 답을 내놓는지를 바꾼다. 여기서 어떤 안전 경계를 우회했다는 설명은 없다. 두 번째로 흔한 오해는 이 효과가 일률적으로 압도적이라고 보는 것이다. 모델 내부 선호를 크게 움직여도, 그 결과가 눈에 보이는 답변의 변화로 이어지는 것은 애초에 모델이 거의 갈팡질팡하던 경우뿐이다. 확고한 입장을 가진 질문에서는 같은 단서들이 출력 자체를 바꾸지 않고 여백만 흔든다.

해석 가능성 연구자들이 가장 주목해야 하는 이유

저자들은 이 문제의 가장 큰 부담을 지는 분야로 interpretability를 지목한다. 그 이유는 불편할 정도로 분명하다. 이미 상당수의 공개 연구가 모델에게 스스로에 대해 묻는다 — 목표가 있는가, 자각하고 있는가, 왜 그렇게 답했는가 — 그리고 그 응답을 모델의 측정치로 취급한다. 그런데 질문이 표현되는 방식의 오타 수준 선택만으로도 답을 통제할 수 있다면, 단일 템플릿 평가가 측정하는 것은 모델만이 아니라 템플릿이기도 하다. 하나의 질문을 하나의 표현으로만 평가한 결과는, 다양한 패러프레이즈 분포에 대해 검증되기 전까지는 반증 가능하다고 보기 어렵다.

실무적 결과

벤치마크 방법론은 대체로 우연한 프롬프트 표현은 평균화되어 사라지는 잡음이라고 가정해 왔다. 이 논문은 그것이 누적되는 신호라고 주장한다. 이는 기존 평가를 무효화하지는 않지만, 단일 모델 내부에서는 집요한 프롬프트 작성자가 만들어낼 수 있는 변동폭이 모델 간 보고된 차이보다 더 클 수 있음을 의미한다.