一篇于8月20日提交到 arXiv 的论文,通过做这类说法通常省略的一件事——设置对照——来审计自我改进的主张。作者将对Qwen3-8B进行的三轮rank-32 LoRA 自训练与一个经过相同流程处理的冻结模型进行比较,并识别出七项测量失误;在缺少对照时,其中每一项都会颠覆一项已报告的发现。作者指出,其中几项是标准做法。
核心数字
如今,人们越来越不是通过平均准确率来判断自我改进,而是看模型在哪些单个问题上得失发生了变化——这种表述需要对两个噪声估计值做差。基于单次贪心解码构建的账本,会在一个从未训练过的模型上制造能力变化,而这主要是推理批处理造成的假象。用于区分真正获取与单纯锐化的扩展统计量,则给这个未训练模型打出了0.280的速率。也就是说,这一指标在一个按构造本不可能发生自我改进的系统中,却报告了显著的自我改进。
常见表述哪里出了错
这类文献中的结果通常以同一模型的前后对比呈现,仿佛这就是它自己的对照组。但事实并非如此。两次测量之间夹着采样噪声、解码非确定性以及批处理效应,它们都会在没有训练参与的情况下制造出逐题转变。显而易见的修补办法——把阈值设得足够高,以排除噪声——并不能经受复制:在冻结对比中进行估计后,而这个设计本身就已包含了这些对比,零假设仍然不为零。作者改而采用在假发现率控制下、针对每道题与合并基线进行的精确检验。
坦率说明范围
这只是一个模型家族、一个尺度和一种适配方法。它并不能证明自我改进是幻觉。它说明的是,通常用来检测自我改进的工具,会在一个不可能产生该信号的系统上登记出强信号——这意味着,已发表的效应量不能被信任为大于测量下限,因为那个下限从未被测量过。
