Recherche en IA
Nouveau benchmark de code : 5.4% ont réussi, pas les 47/100 annoncés
L'argument central de l'article est que les tests comportementaux permettent aux agents de réussir en copiant l'implémentation d'origine. Il nomme ce mode d'échec, puis mesure sa fréquence.
il y a 5 j
