Un preprint a firma unica del chief technology officer di Microsoft Azure Mark Russinovich, annunciato su arXiv alle 00:00 UTC del 19 agosto, propone una risposta diversa al problema dei modelli open-weight a cui viene rimossa la formazione di sicurezza. Invece di rendere più difficile la rimozione, la rende non conveniente.
Il meccanismo
Gli attacchi di abliteration eliminano il comportamento di rifiuto dagli open weight, dopo di che un modello risponde a qualunque cosa gli venga chiesto. Il "decoy hardening" inserisce risposte a richieste pericolose sicure di sé, plausibili e false, addestrate all'interno di una simulazione differenziabile dell'attacco in modo che si attivino solo quando il modello si trova nello stato compromesso, lasciando intatto il comportamento normale.
I numeri
Su sezioni di benchmark adiacenti al CBRNE, il modello difeso da 122B è fatalmente sbagliato nello 0,82–0,86 delle risposte di qualità corrispondente, contro al massimo lo 0,10 senza difese. Sei modelli su sette hanno superato una soglia di efficacia preregistrata; il settimo, più piccolo, ha fallito come caso di confine.
Cosa sbaglia la lettura comune
Questo è un preprint, non un risultato sottoposto a peer review, e non esiste una replica indipendente. Ma l'errore più importante è pensare che questo renda sicuri i modelli open-weight. Non è così. Cambia il valore atteso di attaccarne uno: un attaccante che rimuove i guardrail non può più fidarsi di ciò che ne esce, quindi il modello diventa uno strumento inaffidabile anziché bloccato. Un attaccante sufficientemente capace, in grado di verificare le risposte all'esterno, non ne risente — la difesa funziona contro gli attaccanti che non hanno l'esperienza per controllare, una popolazione reale ma non la coda pericolosa.
Vale anche la pena essere precisi sul compromesso che il paper accetta anziché nascondere: il modello difeso viene deliberatamente reso impreciso nei domini a rischio. È una scelta progettuale che ha un costo per gli utenti legittimi di chimica e biologia, e la soglia preregistrata serve a misurare se la capacità normale sopravvive.
Perché l'impostazione è insolita
Quasi tutto il lavoro sulla sicurezza degli open-weight cerca di impedire la rimozione. Questo si chiede cosa dovrebbero fare i pesi dopo che la rimozione riesce — trattando l'attacco come inevitabile e rendendo inutile il premio. È più simile a un honeypot che a un guardrail, ed è una difesa pubblicata rara che assume di perdere il primo scontro.
