阿里巴巴于 8 月 3 日上午(北京时间)发布了 Qwen3.8-Max,将其定位于编码以及公司所称的“Cowork”专业办公工作。中文主流报道将这一公告时间记为 北京时间 11:00,即 UTC 03:00。

规格

该模型是一个总参数量达 2.4 万亿 的专家混合模型。中文报道称其每次请求激活参数约为 950 亿,约占四个百分点;英文稿件则表示阿里巴巴未予披露。上下文长度可达 100 万 tokens,分为 99.1 万输入和 13.1 万输出。定价为每百万输入 tokens 2.00 美元、输出 6.00 美元、缓存 0.25 美元

所有人都引用的表格

阿里巴巴公布了在 Terminal-Bench 2.1(86.6)、PaperBench(93.0)、GPQA Diamond(92.6)和 OSWorld-Verified(86.1)上的胜绩,并展示了一系列自治演示:一次 16 天的无人监督构建生成了 265 次提交、127 个拉取请求和 151 个问题;一次 125 小时的论文复现,在 AIME24 上比公开方法高出 2.71 分;一次芯片设计运行将门电路数从 8,298 降至 678;以及一项现场竞赛报名,在 24 小时内跑赢 526 支人类队伍中的 458 支。这些结果全部由厂商运行,且没有任何一项可由独立方复现。

未被引用的行

在 agentic 软件工程方面,同一张表则是一份败绩清单。SWE-bench Pro:67.7,低于 Claude Fable 5 的 80.0。DeepSWE 1.1:56.6,对 70.0。FrontierSWE:73.5,对 88.8。Humanity's Last Exam:43.6,对 53.3。即便是旗舰 Terminal-Bench 分数,也仍低于 GPT-5.6 Sol 的 88.8。部分对比基于 NL2Repo-Bench,这是阿里巴巴自家的基准,外界无人能够复现。

“开放”只是日历上的一项安排

围绕这款模型提出的主权和成本论点,建立在目前并未公开存在的权重之上。8 月 3 日,Hugging Face 上甚至还没有 Qwen3.8 的仓库;最新条目是 12 天前更新的 ASR 模型。