AMD 于 8 月 27 日 15:09 UTC 发布 ROCm 10,并将 ROCm.AI——Hyperloom、AMD Skills 和 ROCm CLI——正式全面开放。其核心宣称是:“配置了 ROCm.AI 的系统,相比同一硬件上的 ROCm 7,平均推理性能提升 3.3 倍,训练性能提升 2.4 倍。”

脚注说明了什么

同页脚注 MI350-81 写道:“截至 2026 年 7 月 7 日,AMD Performance Labs 测试……在一套 AMD Instinct MI355x 8x GPU 平台和 AMD ROCm 7.0 软件上,与一套同样配置、使用 AMD ROCm.ai 预览版(ROCm 7.2.2,并采用 Optimized Kernels、Parallelism 和 Scheduling 等优化)的系统进行比较,运行 GLM-5、Kimi-K2.5 和 DeepSeekk-R1-0528 模型。所述性能提升以三款测试模型的综合平均 TPS 表示。” 训练脚注 MI350-82 也采用同样的 7 月日期,比较对象是 Megatron-LM,测试模型为 DeepSeek-V2-Lite、DeepSeek-V3-16B 和 Qwen3-30B-A3B。

实际发布了什么

Hyperloom 被描述为一种“用于优化端到端推理工作负载的自主代理系统”,支持 vLLM 和 SGLang,并面向 HIP、Triton 和 FlyDSL。AMD Skills 已上线 Claude Code、Cursor 和 Codex 的市场,以及一个开放的 GitHub 目录。这才是真正的新意:AMD 正在借助代理调优 kernel,而不是等待编译器工作推进。

常见解读哪里不对

每个标题都会写成“ROCm 10 快了 3.3 倍”。但 AMD 自己的脚注从三个方面否定了这种说法。3.3 倍并不是在 ROCm 10 上测得的——它是 ROCm 7.0 对比 ROCm 7.2.2 的预览版,而且测试时间比这次发布早了七周。这也不是相对于 Nvidia 的 3.3 倍:基线是 AMD 自家一年多前的软件、同一台 MI355X 硬件,因此这个数字衡量的是 AMD 过去留下了多少性能空间,而不是竞争地位。并且,它只是恰好三款模型的综合平均值,不是普遍性的提速。还有一个值得说明的限制:ROCm CLI 作为“全面开放”的 ROCm.AI 三大支柱之一,被标注为 Technology Preview,而且按 AMD 的说法,目前尚未正式支持 ROCm 10——“从 ROCm 7.13 软件开始,ROCm 10 的正式支持即将到来。”