Google 于 9 月 2 日将 Gemini 3.8 Flash 推向全面可用,这是其在六周内发布的第三个 Flash 层级版本,此外还有一个名为 3.8 Flash Cyber、经过安全调优的兄弟版本。发布博文称,该版本在“软件工程、agentic 任务以及专业领域中的关键多步推理”方面,相比 3.7 Flash “有显著改进”。与之并列发布的安全文件则几乎给出了相反的说法。
model card 实际写了什么
DeepMind 的 model card 记录称,Google 的评估“发现它未达到任何 Tracked 或 Critical Capability Levels”,并逐字写道,与 Gemini 3.7 Flash 相比,Gemini 3.8 Flash “在 Frontier Safety Framework 设定的相关领域没有明显的新能力,也没有实质性的性能提升”。这句话并不是被审阅者埋没的批评,而是支撑整份文件的核心结论:正因为该模型在这些维度上没有进展,它才得以通过框架并上线。
价格是促销,不是最终价格
3.8 Flash 的定价为每百万输入 tokens 0.75 美元、每百万输出 tokens 3.75 美元——与 3.7 Flash 相同。发布博文将这一价格标注为促销价,并在脚注中注明到期时间:该费率于 2026 年 12 月 31 日结束,自 2027 年 1 月 1 日起,该模型价格变为 1.50 美元和 7.50 美元。任何根据今天页面测算单位经济性的人,算到的都只是四个月;之后,同样的 tokens 价格将翻倍。
常见解读哪里错了
外界报道常把这两份文件当作在描述不同对象——一边是营销材料,另一边是合规套话。实际上,它们描述的是同一个模型;只要看清各自衡量的内容,就不矛盾。发布博文谈的是编码和 agentic 工作中的基准表现。model card 谈的是危险能力阈值。一个模型完全可能在编写软件方面显著变强,却在安全框架旨在捕捉的那些事情上并没有变好,而 Google 说这里发生的正是这种情况。错误在于把“通过 Frontier Safety Framework”理解为对能力的认可;事实恰恰相反。
为什么六周内会有第三个 Flash
节奏比增量更重要。Flash 是承载生产流量的层级,而 Google 现在更新它的速度,已经快过大多数买家完成一次评估周期的速度。7 月对 3.7 Flash 进行基准测试的团队,如今被要求重新评估一个模型;而其自身安全文档明确表示,其能力轮廓并未发生实质变化——与此同时,支撑迁移理由的促销价也有明确的截止日期。
