Anthropic
Anthropic a entraîné des détecteurs de mensonge à 0,95, puis a vu leur score tomber à 0,70. Une question à un modèle plus grand a obtenu 0,98.
L’expérience n’a même pas pu être menée à l’échelle de pointe, car la référence non entraînée atteignait déjà le plafond.
il y a 1 h
