Zachary Speck 和 Asa Shepard 于 8 月 19 日 UTC 17:46:08 将题为《Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training》的论文发布到 arXiv。它提出了一个通常只能凭直觉争论的问题:一份文档,只看一次,是否会留下痕迹?
实验
32 个 GPT-2 规模模型,参数量均为 1.24 亿,在 OpenWebText 上训练——共 24 次实验,8 个随机种子下的 4 种条件。在总计 9,536 步训练中的 第 200 步,研究人员将一段 194 个 token 的文本注入到恰好一行 batch 中,设置了三种条件(包含真实主语的流畅散文;包含虚构主语的流畅散文;随机字符)以及一个未注入的对照组。
结果
注入后 50 步,模型在该段文本上表现出可测量的优势:交叉熵低了 0.039 至 0.044 个 nat,在 8 个中的 8 个种子上都达到显著水平,p < 10-4。到训练最后一步,这一优势已经消失——p = 0.25、0.71 和 0.54,其中插值损失障碍的 p 值为 0.509,留出集交叉熵的 p 值为 0.310。作者自己的总结是:"这段文本在一次暴露后被学会,随后又衰减了。"
更深一层的发现
这次注入使权重位移达到独立随机种子模型之间欧氏距离的 44.1%,而产生的损失障碍仅相当于种子间障碍的 3.0%,并在中点时完成了 92% 的沉降。几何上的影响很大,功能上的后果却几乎没有。对于任何通过衡量权重差异来审计模型的人,这都是直接的警示:权重空间距离并不能很好地代表模型学到了什么。
常见说法哪里不对
两种相反的解读都不对。这不是“单篇文档会被记忆下来”——因为效应消失了。它也不是“训练数据并不重要”或“记忆只是神话”——这种说法往往会把一个零结果在汇总时过度简化。论文展示的是一个更窄、也更有用的结论。不可回避的是,1.24 亿参数的 GPT-2 比前沿规模小四个数量级,而且这还是一篇未经同行评审的预印本。这里没有任何内容足以支持关于前沿模型是否会保留单篇文档的断言。
