Una società italiana di offensive security ha sottoposto i modelli frontier di Anthropic e OpenAI al codice sorgente di GlobaLeaks, una piattaforma open source per whistleblowing che ha assorbito circa un decennio di audit umani indipendenti, e ha pubblicato ciò che ne è emerso: 29 vulnerabilità confermate, 12 problemi di denial-of-service e 42 osservazioni di hardening.
Il bersaglio non era dei più facili
Questo conta più del numero. GlobaLeaks è usato da redazioni e organismi anticorruzione ed è stato esaminato ripetutamente da persone pagate per romperlo. Trovare qualcosa lì è una tesi più forte che trovare bug in una base di codice non esaminata.
Il rapporto che il titolo nasconde
I modelli hanno prodotto 110 segnalazioni candidate. Il triage umano ne ha confermate 29. Si tratta di una precisione di circa il 26 per cento: circa tre quarti di ciò che i modelli avevano sollevato non ha superato la revisione. Il titolo ripreso dalle agenzie, che l’AI possa identificare vere vulnerabilità software, è vero ma omette il costo.
Ciò che i 77 dollari non dicono
Lo studio riporta circa 77 dollari per ogni segnalazione confermata, su una spesa totale di circa 3.140 dollari nell’arco di 12.000 richieste e 1,24 miliardi di token. Nel testo si specifica che la cifra è prima della convalida umana. Il triage esperto che ha trasformato 110 ipotesi in 29 risultati è il passaggio che ha prodotto le conferme, e non è incluso nel numero. La conclusione dichiarata dallo studio ammette che gli esperti conservano il ruolo decisivo.
Leggere la ripartizione dei costi, non il totale
Una cifra pesa più delle altre: il modello di ragionamento avanzato ha consumato il 62 per cento del budget processando il 7 per cento dei token. Questa è la vera economia dei modelli di ragionamento nel lavoro di revisione: la spesa si concentra in una piccola parte dell’attività. Due precisazioni sulla provenienza. Si tratta di un resoconto del vendor, da parte di una società che vende esattamente questo servizio. E la cifra 29 non include una ripartizione pubblicata della severità, quindi non va letta come 29 criticità; gli altri 54 elementi sono suggerimenti di denial-of-service e hardening, non falle sfruttabili.
