Nvidia 于 8 月 31 日 UTC 03:24:43 发布了 TensorRT-LLM v1.3.0rc25。此次变动影响范围最广的是,KV cache manager V2 被设为大约 21 个模型家族的默认选项。该版本被标记为预发布版,这是这里的一个缓冲因素——但说明文档内部依然自相矛盾。

一个没有任何数据支撑的说法

将 V2 设为默认的理由是所谓更好的可扩展性和稳定性。文档没有给出基线、没有基准测试、没有吞吐量数据、没有内存占用对比,也没有点名具体工作负载。对于一个决定注意力缓存如何在服务集群中分配的组件来说,若只说“更稳定”却不给出测量结果,这并不是运营人员可以据以行动的工程论断。

同一页面又在自相矛盾

发布说明包含“已知问题”部分,而 KV cache manager V2 在其中反复出现——其中一条还写道,V2 调度器在 B200可能间歇性崩溃或耗尽内存,而 B200 是 Nvidia 目前的旗舰产品。因此,这个出于稳定性理由被提升为默认的组件,在同一页面上又被记录为可能在最可能运行它的最新硬件上崩溃。两种说法也许都成立——V2 可能整体更好,但仍存在一个未修复的调度器漏洞——可说明文档从未把这两点调和起来,匆匆看摘要的读者只会看到前者。

常见解读哪里错了

发布说明摘要往往把“默认”当作成熟度信号:既然厂商已经打开它,就说明它准备好了。但在预发布渠道中,这种推断并不成立。设为默认,正是项目获取测试覆盖的一种方式;而带 rc 标记的构建本就应当承担这一角色。错误在于把发布候选版的默认设置读成了面向生产的推荐——而对这次变更的诚实解读是,Nvidia 之所以扩大 V2 的暴露面,恰恰因为它仍有未解决问题。

运营人员应该怎么做

在看摘要之前先读“已知问题”;如果你在 B200 上提供服务,在调度器相关说明清除前,先固定到之前的 KV cache manager 版本。这个回退选项是存在的;只是发布说明没有把你可能需要它这一点放在最前面。