AI 안전스트리핑된 모델을 자신 있게 틀리게 만드는 방어책Mark Russinovich는 안전 제거의 보상을 무너뜨리는 방안을 제안합니다. 가드레일이 제거되면 모델이 위험한 질문에 잘못 답하도록 만드는 방식입니다.2시간 전