Sicurezza AI
Una difesa che rende i modelli privati dei guardrail sicuri di sé ma sbagliati anziché rifiutare
Mark Russinovich propone di avvelenare il vantaggio della rimozione delle misure di sicurezza: una volta strappati i guardrail, il modello risponde in modo errato alle domande pericolose.
2 h fa
