Google DeepMind8 月 13 日发布了 Gemini 3.7 Flash,距 Gemini 3.6 Flash 仅三周。发布节奏本身与模型一样值得关注。

哪些指标提升了

最大幅度的提升集中在代理式任务和文档工作上。衡量企业工作流自动化的 AutomationBench17.0% 升至 30.4%。覆盖长周期软件工程的 DeepSWE v1.149.0% 升至 65.3%。GDP.pdf 文档理解得分从 22.0% 升至 34.0%,FrontierCode 1.1 生产代码质量从 34.4% 升至 43.6%,WebDev Arena Elo 则从 1538 升至 1588

价格

入门费率为每百万输入 token 0.75 美元、每百万输出 3.75 美元,将持续至 2026 年 12 月 31 日,随后升至 1.50 美元7.50 美元。即便按标准费率计算,这也大约只有上一代 Flash 的一半——同一版本既降价又提升能力,这正是 Flash 级模型成为高频代理循环默认选择的原因。

首日分发

该模型已在 Google AI Studio、Android Studio、Gemini Enterprise Agent Platform 以及面向 160+ 个国家和地区的 AI Pro 与 Ultra 订阅用户的 Spark 中上线。同一天,GitHub 将其加入 Copilot 的模型选择器,覆盖 8 个界面——VS Code、Visual Studio、JetBrains、Xcode、Eclipse、CLI、云端代理和 Copilot 应用——按提供方公开价计费,而非按高阶请求乘数计费。Vercel 则将其以 50% 折扣接入 AI Gateway。

关于这些数字的说明

上述所有基准测试均由供应商发布,且由 Google 针对其自身旧模型运行。独立复现通常会比发布滞后数周,而 AutomationBench 尤其缺乏外部历史数据。