一篇于 9 月 3 日发布的论文报告了两项针对黑箱 LLM 评审的预注册研究,但它们甚至没能推进到研究问题本身。作者预先设定的可靠性检验未能通过,这篇论文记录的正是这一失败,涵盖了52,988 次经审计的请求尝试。
失守的两个关卡
在同一时间窗口内进行的重复排序一致性为Spearman 0.400,而预设要求为 0.90。次日运行的字节级完全相同回放一致性为0.78,而预设要求为 0.99。这并不是事后为证明某个观点而选定的门槛——它们是在收集数据之前就已预注册,这也正是这一负面结果具有说服力的原因。
这不是某一家提供方的问题
在切换提供方时,“四家提供方都处于同一低位,中位数在0.74 到 0.88之间。”单纯等待并没有帮助——0.805 对 0.800,这一结果又在随后五天里得到重复验证。论文指出,在批次不变内核上自托管这一已知可缓解推理非确定性的做法,“只有在服务器空闲时才有帮助”,这指向了机制本身:服务栈在负载下的批处理行为。
作者建议的低成本检查
论文指出,若在约研究调用量的 2%上做一个试点,就能提前暴露这两个根本无法达到的门槛。论文还给出了一个三级快照同一性阶梯、八条设计规则以及一份报告清单,作为可操作的输出。
常见解读哪里错了
“LLM 评审不可靠”这一说法过于笼统。该发现针对的是共享服务基础设施上的外部测量行为:共享端点背后的模型名称并不是一个冻结不变的仪器,这更多是服务栈的属性,而不是模型判断本身的属性。论文中还有两点说明有利于作者、也反驳了耸动式说法。0.90 和 0.99 这两个门槛异常严格,若研究采用更宽松的门槛就会通过——关键在于它们是事先固定下来的,而不是 0.400 本身是一个常数。另一个失败原因是,被比较的候选差异比仪器自身噪声底低了七个数量级,也就是说,这些差异小到根本无法测量。
