Sécurité de l’IA
Les fautes de frappe et les paraphrases s’additionnent : deux chercheurs ont orienté des modèles de pointe avec des indices invisibles
Des choix de prompt pris isolément et sans signification s’additionnent presque de manière additive. En accumuler suffisamment permet de contrôler la réponse — et le même prompt fonctionne sur des modèles pour lesquels il n’a jamais été ajusté.
il y a 2 h
