Un preprint de autor único del director de tecnología de Microsoft Azure, Mark Russinovich, anunciado en arXiv a las 00:00 UTC del 19 de agosto, propone una respuesta distinta al problema de que a los modelos de peso abierto se les elimine su entrenamiento de seguridad. En lugar de intentar que la retirada sea más difícil, la vuelve poco rentable.

El mecanismo

Los ataques de abliteration eliminan el comportamiento de rechazo de los pesos abiertos, tras lo cual un modelo responde a cualquier cosa que se le pregunte. La "endurecimiento de señuelos" introduce respuestas seguras, plausibles y falsas a solicitudes peligrosas, entrenadas dentro de una simulación diferenciable del ataque para que solo se activen una vez que el modelo esté en estado comprometido, dejando intacto el comportamiento normal.

Los números

En fragmentos de referencia adyacentes a CBRNE, el modelo defendido de 122B es fatalmente erróneo en 0.82–0.86 de las respuestas de calidad comparable, frente a como mucho 0.10 sin defensa. Seis de siete modelos superaron un umbral de eficacia preregistrado; el séptimo, más pequeño, no lo hizo como caso límite.

Qué falla en la interpretación habitual

Esto es un preprint, no un resultado revisado por pares, y no existe una replicación independiente. Pero la interpretación errónea más importante es pensar que esto vuelve seguros a los modelos de peso abierto. No lo hace. Cambia el valor esperado de atacarlos: un atacante que arranca los guardarraíles ya no puede confiar en lo que sale, de modo que el modelo pasa a ser un instrumento poco fiable en lugar de uno bloqueado. Un atacante suficientemente capaz que pueda verificar las respuestas por medios externos no se ve afectado: la defensa funciona contra atacantes que carecen de la pericia para comprobarlas, que es una población real, pero no la cola peligrosa.

También conviene ser precisos sobre la compensación que el artículo asume en lugar de ocultar: el modelo defendido queda deliberadamente inexacto en dominios peligrosos. Es una decisión de diseño con un coste para los usuarios legítimos de química y biología, y el umbral preregistrado existe para medir si la capacidad normal sobrevive.

Por qué el enfoque es inusual

Casi todo el trabajo de seguridad en modelos de peso abierto plantea cómo evitar la retirada. Este se pregunta qué deberían hacer los pesos después de que la retirada tenga éxito: trata el ataque como inevitable y vuelve inútil el premio. Se parece más a un honeypot que a un guardarraíl, y es una defensa publicada poco habitual que asume que perderá la primera batalla.