Google 于 8 月 26 日 17:00 UTC 发布了 Gemini 3.5 Transcribe,这是一款面向语音界面的语音转文字模型。该帖文包含四个词错误率数据,其中两个会被引用;另外两个则描述了多语言表现。
两组数据
第一组来自外部评测机构 Artificial Analysis:该模型“在流式和非流式使用场景中分别实现平均词错误率(WER)4.0% 和 2.6%”。第二组则是 Google 自身在 FLEURS 多语言基准上的测试,覆盖主要语言和地区:“流式模式下 WER 为 5.50%,非流式使用场景下 WER 为 5.04%。”在这篇帖文中,最好和最差的数据之间相差 2.1 倍。
常见表述哪里说错了
被广泛传播的是 2.6%,而它被用来支撑该模型可处理 85+ 种语言 的说法。但这其实是两项不同的测量。2.6% 是对帖子所称的主要使用场景计算出的平均值;而在标准多语言基准上,对应的数据是 5.04%——几乎高出一倍。转录模型的错误率只有在结合其测试语言集和音频条件时才有意义,而这篇帖文罕见地同时公开了两者。偏差出现在下游:第三方数据被硬套到多语言说法上,拼出一个源文中并不存在的规格。
这是预览版,不是正式发布
当前状态是 public preview。这一点很关键。该模型可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise agent 平台访问,并出现在部分国家和语言的 Android 上 Rambler、macOS 版 Gemini 应用,以及 Gboard 和 Google Antigravity 中。Chrome 列为“即将推出”。public preview 不意味着服务等级承诺,也不保证价格稳定,更不保证该接口会以当前形态持续存在。
为什么流式数据比标题更重要
在两组数据中,流式模式都比非流式更差——分别是 4.0% 对 2.6%,以及 5.50% 对 5.04%。这在预期之中:流式模型必须在听完整句子前就决定输出词语。但真正决定该模型适用场景的,恰恰是流式数据,因为它面向的是实时语音代理。任何拿 2.6% 去衡量语音产品的人,实际上是在用某些条件下的批量处理结果来做判断;而决定产品是否好用的数字,则是 5.50% 的多语言流式数据。
