Investigación en IA
Nuevo benchmark de código: 5.4% pasó, no el 47/100 citado
La tesis central del artículo es que las pruebas conductuales permiten a los agentes aprobar copiando la implementación original. Nombra ese modo de fallo y luego mide con qué frecuencia ocurre.
hace 5 d
