Sécurité de l’IA
Une défense qui rend les modèles dépouillés confiantement faux au lieu de refuser
Mark Russinovich propose de neutraliser le gain du retrait des garde-fous : une fois les protections arrachées, le modèle répond aux questions dangereuses de manière erronée.
il y a 2 h
