Um preprint de autoria única do chief technology officer da Microsoft Azure, Mark Russinovich, anunciado no arXiv às 00:00 UTC de 19 de agosto, propõe uma resposta diferente ao problema de modelos de pesos abertos terem seu treinamento de segurança removido. Em vez de tentar dificultar a remoção, ele a torna sem recompensa.

O mecanismo

Ataques de abliteration removem o comportamento de recusa dos pesos abertos, após o que o modelo responde a qualquer coisa que lhe seja perguntada. "Decoy hardening" insere respostas confiantes, plausíveis e falsas a solicitações perigosas, treinadas dentro de uma simulação diferenciável do ataque, de modo que só sejam ativadas quando o modelo estiver em estado comprometido, preservando o comportamento normal intacto.

Os números

Em trechos de benchmarks adjacentes a CBRNE, o modelo defendido de 122B fica fatalmente errado em 0,82–0,86 das respostas de qualidade correspondente, contra no máximo 0,10 sem defesa. Seis de sete modelos passaram em um gate de eficácia pré-registrado; o sétimo, menor, falhou como um caso-limite.

O que a leitura comum erra

Este é um preprint, não um resultado revisado por pares, e não há replicação independente. Mas a interpretação equivocada mais importante é achar que isso torna modelos de pesos abertos seguros. Não torna. O que muda é o valor esperado de atacá-los: um atacante que arranca as proteções já não pode confiar no que sai, de modo que o modelo se torna um instrumento pouco confiável, em vez de simplesmente bloqueado. Um atacante suficientemente capaz, que consiga verificar as respostas externamente, não é afetado — a defesa funciona contra atacantes que não têm expertise para checar, o que é uma população real, mas não a cauda perigosa.

Também vale ser preciso sobre a troca aceita, em vez de ocultada, no artigo: o modelo defendido é deliberadamente tornado impreciso em domínios perigosos. Essa é uma decisão de projeto com custo para usuários legítimos de química e biologia, e o gate pré-registrado existe para medir se a capacidade normal sobrevive.

Por que o enquadramento é incomum

Quase todo o trabalho de segurança em pesos abertos pergunta como impedir a remoção. Este pergunta o que os pesos devem fazer depois que a remoção tem sucesso — tratando o ataque como inevitável e tornando o prêmio sem valor. É mais próximo de um honeypot do que de uma barreira de segurança, e é uma defesa publicada rara que assume que perderá a primeira luta.