Un article publié le 3 septembre rapporte deux études préenregistrées sur des juges LLM en boîte noire qui n’ont jamais atteint leurs questions de recherche. Les contrôles de fiabilité fixés à l’avance par les auteurs ont échoué, et l’article rend compte de cet échec sur 52 988 tentatives de requêtes auditées.
Les deux seuils qui ont échoué
Les classements répétés relevés dans la même fenêtre concordaient à Spearman 0,400 contre un seuil requis de 0,90. Les relectures à l’identique binaire exécutées le lendemain concordaient à 0,78 contre un seuil requis de 0,99. Il ne s’agit pas de seuils fixés a posteriori pour étayer une démonstration : ils avaient été préenregistrés avant la collecte des données, ce qui donne toute sa portée au résultat négatif.
Ce n’est pas un problème d’un seul fournisseur
Lors d’un changement de fournisseur, "quatre fournisseurs partagent le plancher, médianes 0,74 à 0,88." Attendre plus longtemps n’a pas aidé — 0,805 contre 0,800, reproduit sur cinq jours supplémentaires. L’hébergement en propre sur des noyaux invariants par lots, la mitigation connue contre le non-déterminisme de l’inférence, "n’a aidé que lorsque le serveur était calme", ce qui pointe le mécanisme : le comportement de batching sous charge dans la pile de service.
Le contrôle bon marché recommandé par les auteurs
L’article note qu’un pilote à environ 2 % du volume d’appels de l’étude aurait révélé à l’avance les deux seuils inatteignables. Il fournit un niveau de capture d’identité en trois paliers, huit règles de conception et une checklist de reporting comme résultat pratique.
Ce que le cadrage reçu interprète mal
"Les juges LLM sont peu fiables" est une lecture trop large. Le constat concerne un comportement mesuré de l’extérieur sur une infrastructure de service partagée : un nom de modèle derrière un point de terminaison partagé n’est pas un instrument figé, et c’est une propriété de la pile de service plutôt que du jugement du modèle. Deux autres réserves jouent en faveur de l’article et contre la version sensationnaliste. Les seuils de 0,90 et 0,99 sont exceptionnellement stricts, et une étude qui en aurait choisi de plus souples aurait réussi — l’intérêt est qu’ils aient été fixés à l’avance, non que 0,400 soit une constante. Et une partie de l’échec tient au fait que les écarts candidats comparés étaient sept ordres de grandeur en dessous du propre plancher de bruit de l’instrument, autrement dit que les différences étaient trop faibles pour être mesurées du tout.
