由 Adam Karvonen、Euan Ong、Subhash Kantamneni 和 Samuel Marks 于 2026 年 8 月 17 日 UTC 15:57 提交的一篇论文介绍了 CHIVE——Counterfactual Hypothesis Investigation Via Edits——这是一条代理式流程,可在真实场景中识别意外的语言模型行为,并通过编辑提示并观察变化来加以研究。其标题结论是否定的,而且指向了该领域自身的工具箱。

测试与结果

作者提出了一个具体、可证伪的问题:常见的可解释性技术能否帮助一个代理预测模型在相关反事实输入上的行为?他们评估了稀疏自编码器、自然语言自编码器和激活预言机。摘要中的结论原话是:“令人惊讶的是,我们在所研究的任何可解释性技术上都没有发现提升。” 对比对象是一个仅仅读取对话记录的代理。

常见表述哪里出了错

显而易见的标题会是:稀疏自编码器已经没用了。但这说得过头了,论文也没有这么说。论文的主张更窄也更精确:在这项任务中,基于激活的工具除了对话记录本身已经提供的内容之外并没有增加任何信息。这说的是相对于一个强文本基线的边际信息,而不是 SAE 特征是否对应模型内部某种真实存在的东西。一个工具可以描述真实的内部结构,却仍然无法告诉你可见文本没有提供的信息。

另一半才是有用的部分

第二项应用更具建设性,也较少受到关注。作者使用 CHIVE 生成训练数据,并报告称,训练来预测 CHIVE 生成的反事实实验结果的模型能够泛化到分布外场景。因此,产生否定结果的这条流程也产出了一个有效的方法——对一种行为的解释,最终可以从反事实证据中学到,即便读取激活并未带来帮助。

作者身份为何重要

可解释性是前沿实验室在被问及未来系统将如何接受监督时所强调的首要技术支柱。四位作者中有两位来自 Anthropic 的对齐团队。一家实验室带着具体基准,发布一项针对自身战略押注的审慎否定结果,这比又一次能力演示传递出更健康的信号——也为该领域给出了一个真正可以接受检验的成功定义:胜过对话记录。