Статья, опубликованная 3 сентября, сообщает о двух пререгистрированных исследованиях black-box LLM-судей, которые так и не дошли до своих исследовательских вопросов. Проверки надежности, заранее заданные авторами, не прошли, и статья представляет собой отчет об этом провале на основе 52 988 аудированных попыток запросов.

Два порога, которые не были пройдены

Повторные ранжирования, полученные в одном и том же окне, согласовывались на уровне Spearman 0,400 при требуемом значении 0,90. Повторные прогоны с байт-в-байт идентичными входами, выполненные на следующий день, согласовывались на уровне 0,78 при требуемом значении 0,99. Это не постфактум выбранные пороги, призванные подчеркнуть тезис: они были пререгистрированы до сбора данных, и именно это придает негативному результату вес.

Проблема не только одного провайдера

При переключении провайдера «четыре провайдера делят нижнюю границу, медианы 0,74–0,88». Простое ожидание не помогло — 0,805 против 0,800, воспроизведено еще в течение пяти дней. При самостоятельном размещении на batch-invariant kernels, известной мере смягчения недетерминизма инференса, «это помогало только пока сервер был незагружен», что указывает на механизм: поведение batching под нагрузкой в serving stack.

Дешевую проверку, которую рекомендуют авторы

В статье отмечается, что пилот примерно на 2% от объема вызовов исследования заранее выявил бы оба недостижимых порога. В качестве практического результата предлагаются лестница snapshot-identity из трех уровней, восемь правил проектирования и контрольный список для отчетности.

Что неверно в распространенной интерпретации

«LLM-судьи ненадежны» — слишком широкое прочтение. Вывод касается внешне измеряемого поведения на общей инфраструктуре обслуживания: имя модели за общим endpoint не является фиксированным инструментом, и это свойство serving stack, а не суждения самой модели. В статье есть еще два важных оговорки, работающие в ее пользу и против сенсационной версии. Пороги 0,90 и 0,99 необычно строги, и исследование, выбери оно более мягкие значения, прошло бы — ценность в том, что они были зафиксированы заранее, а не в том, что 0,400 является константой. Кроме того, часть сбоя связана с тем, что сравниваемые различия в кандидатах были на семь порядков ниже собственного порога шума инструмента, то есть различия были слишком малы, чтобы их вообще измерить.