The Fragility of Jailbreak Robustness Across Operational States라는 제목의 논문은 EMNLP 2026 Findings에 채택됐으며, 좁지만 불편한 주장을 내놓습니다. 즉, 모델의 강건성 점수는 모델 자체의 속성이 아니라 측정이 이뤄진 설정의 속성이라는 것입니다. 공격은 그대로 유지한 채 안전성과는 무관한 평범한 시스템 프롬프트만 바꾸자, 한 사례에서 공격 성공률이 2%에서 58%로, 56포인트나 변했습니다. 이 결과는 정렬된 7개 모델과 대표적인 3개 공격 전반에서 나타났습니다.

제안된 메커니즘

저자들은 이 효과를 자신들이 refusal axis라고 부르는 축을 따라 숨겨진 표현이 놓이는 위치와 연결합니다. 이 축에 대한 투영은 주어진 탈옥이 성공할지 여부를 예측하는데, 이는 운영용 시스템 프롬프트가 작성자의 악의적 의도 없이도 모델을 안전성 관련 방향으로 조용히 이동시키는 요소임을 시사합니다.

논문이 말하지 않는 것

이 논문은 모델이 더 이상 안전하지 않다고 주장하지 않으며, "모델은 탈옥하기 쉽다"는 식의 헤드라인은 이 논문의 논지를 뒤집는 것입니다. 이 발견은 측정에 관한 것입니다. 기본 구성에서 강건성을 단일 ASR 수치로 보고하면, 그 수치는 운영용 프롬프트와 맞닥뜨리는 순간 유지되지 않기 때문에 잘못된 확신을 낳습니다. 이는 벤더의 안전성 카드와 공개 벤치마크 전반에서 사용되는 방법론에 대한 비판이지, 새로운 공격이 아닙니다.

헷갈리지 말아야 할 두 가지

채택은 EMNLP 본 트랙이 아니라 Findings에 대한 것입니다. 언론 요약에서는 흔히 이 구분이 빠집니다. 또한 arXiv 날짜는 특정 버전의 제출일을 가리킵니다. 이는 v1이며 8월 31일에 제출됐고 이후 개정판은 없었으므로, 오래된 연구가 새 목록 날짜로 다시 등장한 것이 아닙니다.

실무자가 주목해야 하는 이유

배포 환경에서 시스템 프롬프트는 연구소가 아니라 통합자가 작성합니다. 실험실의 기본 프롬프트로 측정한 강건성이 실제 제품으로 전이되지 않는다면, 구매자에게 제시되는 모든 안전성 수치는 그들의 제품에는 존재하지 않을 설정을 설명하는 셈입니다. 실무적으로는 레드팀 테스트를 실제 운영 프롬프트를 상대로 수행해야 하며, 그 프롬프트가 바뀔 때마다 다시 반복해야 합니다. 오늘날 이는 흔한 문안 수정 정도로 취급됩니다.