Microsoft Security ha annunciato MAI-Cyber-1-Flash, il suo primo modello specializzato per la sicurezza, insieme a Project Perception il 27 luglio, in un post firmato dalla executive vice-president Hayete Gallot. Project Perception è un sistema coordinato di agenti red, blue e green e entra in anteprima pubblica il 3 agosto. Microsoft ha inoltre annunciato FORGE Labs, guidato dal vice-president Taesoo Kim, e un'alleanza esterna di red team che finanzia 18 laboratori universitari in sei continenti.

Il risultato dichiarato

Microsoft colloca il proprio stack al 95,95% su CyberGym — riportato come 96% — e afferma che è 12 punti sopra Mythos. Il set di confronto pubblicato comprende: GPT-5.5 Cyber all'85,6%, Mythos 5 all'83,8%, GPT-5.6 Sol all'83,6% e Gemini 3.5 Flash Cyber all'83,2%. L'azienda sostiene inoltre "quasi il 50% di risparmio sui costi rispetto all'attuale configurazione MDASH oggi sul mercato." Mustafa Suleyman lo ha definito "un risultato davvero notevole."

Tre problemi con il numero

Primo, il benchmark è interamente auto-riferito: nessuna verifica indipendente, nessun numero di run, nessuna barra d'errore. Secondo, e più sostanziale, il 96% deriva da un sistema orchestrato a due modelli — Flash gestisce circa il 90% dei compiti e inoltra il resto a GPT-5.4 — messo a confronto con i singoli modelli dei concorrenti. Terzo, la stima dei costi è misurata rispetto alla precedente configurazione di Microsoft, non rispetto ai rivali; almeno una testata l'ha resa come "la metà del costo degli altri modelli leader", un'affermazione materialmente diversa e non supportata.

Cosa misura CyberGym

La riproduzione di vulnerabilità, non lo sfruttamento nel mondo reale. Un modello che riproduce il 96% delle vulnerabilità note di un benchmark non ha risolto il 96% della sicurezza, e Microsoft non sostiene di averlo fatto — ma è questa la semplificazione che circola nella copertura.

La mossa strategica sottostante

Microsoft ha trascorso due anni a vendere prodotti di sicurezza basati su modelli di partner. Ora sta distribuendo i propri pesi e prezzandoli rispetto a quei partner — all'interno del suo più grande movimento di vendita verso il enterprise. E nello stesso giorno ha donato MDASH alla nuova alleanza di modelli open di Nvidia. Costruire un modello interno, abbassare i prezzi dei fornitori che rivende e al tempo stesso sostenere il campo degli open weights non sono tre mosse. È una sola.