Anthropic
Anthropic entrenó detectores de mentiras hasta 0,95, y luego vio cómo caían a 0,70. Hacerle una pregunta a un modelo más grande obtuvo 0,98.
El experimento no pudo ni ejecutarse a escala frontier, porque la línea base sin entrenar ya estaba en el techo.
hace 1 h
