Google 于 UTC 时间 8 月 27 日 16:00 向开发者发布了 Gemini Omni 1.1 Flash,新增场景扩展、首尾帧插值、低成本草稿模式以及视频参考条件控制。文档将 gemini-omni-1.1-flash 描述为“专为高速视频生成、编辑和电影级控制而设计的高性能多模态模型”。它已在 Google AI Studio、Gemini API、Gemini Enterprise Agent Platform 和 Google Flow 上线,场景扩展功能则面向全球 Gemini 应用中的 AI Plus、Pro 和 Ultra 订阅用户开放。
实际新增了什么
场景扩展每轮可最多追加 10 秒,官方标称的总时长上限为 40 秒。视频参考功能最多接受三秒的现有素材,以保持人物或环境一致。画幅比例默认是 16:9,也支持 9:16。SynthID 水印已内置。Adobe Firefly、Figma Weave 和 Runway 被列为生产用户;Figma Weave 的创意总监表示,这一模型“让团队不再只是生成视频,而是真正实现导演式创作”。
常见说法哪里错了
围绕这一模型流传着三种说法,但都与 Google 自己的页面相矛盾。首先,“4K 视频生成”是后处理结果:模型卡将 4K 和 1080p 都标注为放大输出,原生生成最高止于 720p——在草稿模式下则是 360p。其次,“40 秒视频”把上限与单次生成混为一谈。40 秒只能通过一次次把 10 秒片段接到现有片段末尾来实现;模型无法一次性生成 40 秒,也无法在中间插入。第三,“速度提升 60%、成本降至三分之一”只适用于 360p 草稿路径——这实际上是把分辨率折扣说成了效率提升。
一处标为可直接用于生产,另一处标为预览版
这篇博客将此次发布描述为可直接用于生产。但 Google Cloud 面向企业版本的文档页面标题则为 “Gemini Omni 1.1 Flash Preview”。在 Google 的三种交付渠道中,面向用户的可用状态和发布阶段并不相同,而相关报道却将它们简单合并成了一种说法。
没人带走的地理限制
为上传的视频添加额外对话在欧洲经济区、瑞士和英国不可用。语音编辑在任何地区都不受支持。多数报道都没有提到这两项限制。
