Um artigo publicado em 3 de setembro relata dois estudos pré-registrados de juízes LLM em caixa-preta que nunca chegaram a responder às suas perguntas de pesquisa. As verificações de confiabilidade fixadas pelos autores com antecedência falharam, e o artigo é o relato dessa falha em 52.988 tentativas de solicitação auditadas.
Os dois critérios que falharam
Classificações repetidas tomadas dentro da mesma janela concordaram em Spearman 0,400 contra o exigido 0,90. Reproduções byte a byte executadas no dia seguinte concordaram em 0,78 contra o exigido 0,99. Esses não são limiares definidos depois dos fatos para sustentar um ponto — eles foram pré-registrados antes da coleta de dados, o que dá força ao resultado negativo.
Não é um problema de um único provedor
Na troca de provedor, "quatro provedores compartilham o piso, medianas 0,74 a 0,88." Simplesmente esperar não ajudou — 0,805 versus 0,800, replicado ao longo de mais cinco dias. A hospedagem própria em kernels invariantes a lotes, a mitigação conhecida para não determinismo de inferência, "ajudou apenas enquanto o servidor estava ocioso", o que aponta para o mecanismo: o comportamento de batching sob carga na stack de serving.
A verificação barata que os autores recomendam
O artigo observa que um piloto com cerca de 2% do volume de chamadas do estudo teria exposto os dois critérios inatingíveis com antecedência. Ele traz uma escada de identidade de snapshot em três níveis, oito regras de design e uma lista de verificação de relato como resultado prático.
O que a interpretação corrente erra
"Juízes LLM são pouco confiáveis" é uma leitura ampla demais. A descoberta diz respeito ao comportamento medido externamente em infraestrutura de serving compartilhada: um nome de modelo por trás de um endpoint compartilhado não é um instrumento congelado, e isso é uma propriedade da stack de serving, não do julgamento do modelo. Duas ressalvas adicionais favorecem o artigo e contrariam a versão sensacionalista. Os critérios 0,90 e 0,99 são incomumente rigorosos, e um estudo que escolhesse critérios mais brandos teria passado — o valor está no fato de terem sido fixados de antemão, não em 0,400 ser uma constante. E parte da falha é que as lacunas candidatas que estavam sendo comparadas ficaram sete ordens de grandeza abaixo do piso de ruído do próprio instrumento, ou seja, as diferenças eram pequenas demais para serem medidas.
