Google 于 9 月 1 日推出 Gemini 的 agentic 视频理解功能,称其可将分析成本最高降低 66%、令牌消耗最高减少 88%,同时将准确率最高提升 7%。该功能通过在 API 配置中将处理方式设为 agentic 启用,且按标准 Gemini API 令牌定价,不收取额外功能费用

常见解读错在哪里

88% 的令牌减少,读起来像是模型内部取得了压缩突破。但事实并非如此。agentic 模式让 Gemini 自行决定抓取哪些时刻、以什么帧率抓取,以及使用画面、音频还是转录文本,取代了旧有的固定帧率采样。模型看的视频更少了。这确实是一种真实且有用的能力,但它受限于模型自身对“哪些内容可以跳过”的判断:如果某项任务的相关证据分散在整个时长中,就没有什么可跳过的,节省也会随之消失。

两组数字之间的差距

注意,成本节省(66%)明显小于令牌节省(88%)。两者之间的差异,来自 agentic 循环本身——判断该看什么本身也会消耗令牌。这三个数字都以“最高”为限定,因此只是上限,而不是预期值。

它真正落地在哪里

第二个解读错误在于分发范围。这项功能只上线于Flash 系列——Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite——且仅通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 提供。Gemini 应用会“很快”获得该功能,而 YouTube 的“Ask YouTube”则要到“未来几个月”才会加入。多数报道用消费者应用来示意此次发布,但该应用目前并未提供这项功能。

定价选择传递了什么信号

Google 声称,Gemini 3.7 Flash“在测试模型中实现了准确率与成本的帕累托前沿”,并且对该模式不额外收费。视频一直是长上下文难以发挥作用的场景,因为固定帧率会让成本按时长而不是按信息量增长。打破这种耦合之后,又不单独为其定价,说明 Google 希望把长视频分析变成一种默认工作负载,而不是专业化工作负载。