Microsoft Azure 최고기술책임자 Mark Russinovich가 단독 저자로 쓴 사전 인쇄본이 8월 19일 00:00 UTC에 arXiv에 공개되면서, 오픈 웨이트 모델의 안전 학습이 제거되는 문제에 대한 다른 해법을 제시했습니다. 핵심은 제거를 더 어렵게 만드는 것이 아니라, 제거가 보상이 없도록 만드는 것입니다.

작동 방식

abliteration 공격은 오픈 웨이트에서 거부 행동을 제거한 뒤, 모델이 무엇이든 답하게 만듭니다. "decoy hardening"은 위험한 요청에 대해 자신 있고 그럴듯하지만 거짓된 답변을 심어 두며, 이는 공격의 미분 가능한 시뮬레이션 내부에서 학습돼 모델이 손상된 상태가 되었을 때만 작동하고 정상 동작은 그대로 유지합니다.

수치

CBRNE와 연관된 벤치마크 구간에서, 방어된 122B 모델은 일치 품질의 답변 가운데 0.82~0.86에서 치명적으로 틀리며, 방어하지 않은 경우는 최대 0.10에 그쳤습니다. 7개 모델 중 6개는 사전 등록된 효능 기준을 통과했고, 나머지 더 작은 1개는 경계 사례로 실패했습니다.

일반적인 해석이 놓치는 점

이것은 동료 심사를 거치지 않은 사전 인쇄본이며, 독립적인 재현도 없습니다. 그러나 더 중요한 오독은 이것이 오픈 웨이트 모델을 안전하게 만든다는 주장입니다. 그렇지 않습니다. 이 연구는 하나의 공격에 대한 기대값을 바꿉니다. 가드레일을 제거한 공격자는 이제 결과를 신뢰할 수 없게 되므로, 모델은 차단된 도구가 아니라 믿을 수 없는 도구가 됩니다. 외부 검증이 가능한 충분히 유능한 공격자는 영향을 받지 않습니다. 이 방어는 답을 확인할 전문성이 없는 공격자를 상대로 작동하며, 이는 현실적인 집단이지만 가장 위험한 꼬리집단은 아닙니다.

또 하나 분명히 해야 할 점은, 이 논문이 받아들이는 trade-off를 숨기지 않는다는 것입니다. 방어된 모델은 위험한 영역에서 의도적으로 부정확하게 만들어집니다. 이는 합법적인 화학·생물학 사용자에게 비용이 따르는 설계 결정이며, 사전 등록된 기준은 정상적인 역량이 유지되는지 측정하기 위해 존재합니다.

이 프레이밍이 이례적인 이유

대부분의 오픈 웨이트 안전 연구는 제거를 막는 방법을 묻습니다. 이 연구는 제거가 성공한 뒤 가중치가 무엇을 해야 하는지를 묻습니다. 공격은 피할 수 없는 것으로 보고, 그 보상을 무가치하게 만드는 접근입니다. 이는 가드레일보다는 honeypot에 가깝고, 첫 싸움에서 질 것을 전제로 하는 드문 공개 방어책입니다.