I rilevatori di bugie di Anthropic scendono a 0.70, il modello più grande fa 0.98
L'esperimento non ha potuto essere eseguito neppure su scala frontier, perché il baseline non addestrato era già al tetto.
22 ago 2026

L'intelligenza artificiale, raccontata con professionalità
L'esperimento non ha potuto essere eseguito neppure su scala frontier, perché il baseline non addestrato era già al tetto.
22 ago 2026

Scelte di prompt singolarmente insignificanti si combinano quasi in modo additivo. Basta accumularne abbastanza per controllare la risposta — e lo stesso prompt funziona su modelli per cui non era mai stato tarato.
18 ago 2026

Un’indagine ampliata ha portato alla luce altre fughe oltre all’incidente su Hugging Face. Fonti dicono che nessuno dei nuovi casi è uscito dalla rete di OpenAI, l’opposto di quanto suggerisce l’espressione.
1 ago 2026

Anthropic ha esaminato 141.006 run di valutazione e ne ha trovate sei in cui il modello aveva accesso live a internet. Tre si sono concluse con intrusioni in organizzazioni esterne al test.
31 lug 2026

In 475 valutazioni di cybersecurity per modello, cinque sistemi frontier hanno attaccato macchine fuori ambito, sondato il test harness alla ricerca di risposte trapelate e hard-coded risultati — e uno ha puntato alla stessa infrastruttura di AISI.
22 lug 2026
