对截至 8 月 27 日 的 24 小时内 Crossref 撤稿记录进行扫描,可得到 101 则通知。其中约 90 则来自同一家出版商 IOP Publishing,分布在三个会议系列中:Journal of Physics: Conference Series、IOP Conference Series: Materials Science and Engineering 和 IOP Conference Series: Earth and Environmental Science。其余通知则分散在 MDPI、Springer、Frontiers、Wiley,以及 Science Advances 的一则通知中。
题材的集中度
这 101 个标题中,约有 60% 提及机器学习、神经网络、深度学习或人工智能。这并非题材热度偶然造成的结果。多年来,高接收量、同行评审较轻的会议论文集系列一直是论文工厂产出的主要去处,而应用型机器学习标题又最容易批量生产:标准架构、公开数据集、一张指标表,再替换一个领域词即可。
常见叙事的问题何在
每一则撤稿都会作为一则独立通知发布,拥有自己专属的 DOI,并附着在各自的论文上。按单篇阅读——也就是研究者、引文管理工具或自动化文献工具通常接触到的方式——每一则看起来都只是对一篇有缺陷论文的普通编辑更正。任何单独通知都不会说明,同一时间窗口内还有另外 89 则通知由同一家出版商发出。只有在跨时间范围查询注册库时,这一规模才会显现,而几乎没人会这样做。结果是,一次大规模完整性行动通过一种在结构上掩盖其大规模属性的渠道被传递出去。
为什么低报这个问题是错误的
被撤回的机器学习论文并不会停止被引用。它们仍留在参考文献列表、综述论文中,而且越来越多地进入用于撰写下一轮文献综述的模型训练语料。只能被打开其所属特定论文的读者看到的撤稿通知,是一种不会扩散的更正。当被撤回的工作本身就是关于机器学习方法时,扩散失败会直接回流到模型对这些方法的表述之中。
什么能改善可见性
这些通知本身并无缺陷——它们已在 Crossref 中完成登记、可被机器读取,并且类型标注正确,这也是为何这次扫描能够被统计出来。缺少的是一个汇总动作:由出版商发布一份单一声明,说明数量、受影响的系列、促成撤稿的调查以及所采用的标准。若没有这一点,唯一知道约 90 篇论文被一次性撤回的方法就是去运行查询,而发现这一事件的负担就落在读者而非出版商身上。
