xAI 于 8 月 12 日发布了 Grok 4.6,将其描述为对 Grok 4.5 的后训练改进,而不是新的基础模型。两者都建立在同一个 1.5 万亿参数的“V9”基础之上。

真正变化了什么

这项工作包括监督式微调,以及在具备智能体能力的环境中的强化学习——是长时间的工具使用,而非单纯扩大规模。xAI 报告称,Grok 4.6 在 Artificial Analysis Intelligence Index 上得分为 61,高于 Grok 4.5 的 56,后者在该指数上与 GPT-5.6 Sol 持平。上下文保持在 500K tokens,输入支持文本和图像,知识截止日期为 2026 年 2 月 1 日。面向调用方还提供了一个新的 xhigh 推理强度档位。

它在哪些方面并不领先

在编码方面,情况就没那么亮眼了。Grok 4.6 在 CursorBench v3.2 上得分 69.9%,在 DeepSWE v1.1 上得分 65.9%,在 FrontierCode v1.1 上得分 61.3%,在 Terminal-Bench v3.0 上得分 26%。DeepSWE 的成绩明显低于 GPT-5.6 约 73% 的水平——单一综合指数打平,并不意味着在软件工程上领先。

定价与可用性

在不超过 200K token 的提示下,该模型每百万输入 token 收费 2 美元,缓存输入 0.50 美元,输出 6 美元;超过这一长度后,则为 4 美元 / 1 美元 / 12 美元。其“fast”版本价格翻倍。该模型已成为 Grok Build 的默认模型,可供所有 Cursor 套餐使用,并在首周附赠双倍使用额度。它没有开放权重。

一个该删除的数字

外界流传着 Grok 4.6 的 “1753 ELO” 数据。但这其实是该模型的 GDPVal-AA v2 分数,不是 Arena ELO,这两者并不可比。另有说法称其从 8 月 7 日开始部署,但 xAI 自己的材料并不支持这一说法。

这反映的趋势

在没有新的预训练运行的情况下,综合指数提升 5 分,正是当前前沿竞争的样子:昂贵的部分已经做完,回报正来自后续环节。这也说明,版本号并不是判断两个模型之间算力差距的好指标。