Seguridad de la IA
Una defensa que hace que los modelos despojados de salvaguardas se equivoquen con seguridad en lugar de negarse
Mark Russinovich propone envenenar el beneficio de eliminar las medidas de seguridad: una vez arrancados los guardarraíles, el modelo responde mal a las preguntas peligrosas.
hace 2 h
