Thomson Reuters 周一发布了其首个内部自研的专有大语言模型 “Thomson”,该模型建立在“强大的开源基础”之上,据称在人才和算力上的投入为 4000 万美元。与之相伴的说法是,“我们的早期评估显示,Thomson 在多种任务上与最新的前沿模型不相上下。”

传统叙事哪里错了

“Thomson Reuters 以 4000 万美元打造了一个前沿模型”这句话包含三个错误。首先,它并没有打造前沿模型。它只是对一个未具名的开放权重基础模型进行了后训练,因此这 4000 万美元买到的是增量——基础模型本身的训练成本,几乎肯定高达九位数,而且属于别人——在比较中完全没有被算进去。其次,所谓前沿水平的说法来自公司自身的早期内部评估,以第一人称表述,没有公布任何基准名称、数字,也没有在发布材料中引用第三方评测。第三,它现在并未正式上线。首个落地场景只是 CoCounsel Legal 中的一个功能——Tabular Analysis——而且出现在某个未指明的“即将发布版本”中。如今可下载的只是 Hugging Face 上一个“较小”版本,且仅限学术和非商业用途。主模型并非开放权重。

值得反复看一遍的数字

Thomson “迄今只在 不到 10% 的 Thomson Reuters 内容上进行了训练。” 这份发布材料把这一点视为潜力空间,而它确实如此。但这同样也是一种承认:其数据护城河——整个战略前提——大部分尚未被开发,而且拿来与前沿模型比较的这款模型,还没有在本应让它与众不同的语料库上接受检验。

为什么经济逻辑比这句宣称更重要

这是迄今为止关于开放权重“绕行方案”最清晰的一则数据点。如果一家行业老牌公司能够拿一个开放基础模型,花 4000 万美元用于人才和算力投入,并在其垂直领域内把性能做到足以与前沿模型争辩相当,那么为专业场景支付前沿 API 价格的理由就会迅速削弱——从实验室的角度看,推动模型开放权重化的理由也会随之减弱。这个论点现在正处于现实争论中:这次发布发生在 Meta 开放权重发布 Muse Glimmer 数周之后,也发生在 Mistral 发布开放权重立场文件一个月之后。

要想真正定论,缺什么

一个有名称的基础模型、一个有名称的基准测试,以及一个数字。在 Thomson Reuters 公开这三者中的任何一个之前,“与前沿模型不相上下”都只是关于一款公司外部无人测量过的模型的说法。