模型发布

Google DeepMind 发布 Gemini Omni 1.1 Flash:把生成式视频拉进"可控"区间

Google DeepMind 上线 Gemini Omni 1.1 Flash,主打场景扩展、首尾帧控制和 4K 输出三项能力,让开发者在视频生成上首次同时掌控时长、过渡与分辨率,向生产链路更近一步。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Google DeepMind 发布 Gemini Omni 1.1 Flash:把生成式视频拉进"可控"区间

Google DeepMind 近期上线了 Gemini Omni 1.1 Flash,这是其多模态生成视频模型的一次重要迭代。与早期版本相比,新模型没有主打

,而是把重心放在控制精度上,试图解决生成式视频最难的一环——让画面按人的意图走。

这次更新包含三块核心能力:场景扩展(Scene Extension)、首尾帧控制(First/Last Frame Control)以及 4K 高清输出。单独看都不算颠覆,但组合起来,意味着开发者第一次可以在一个模型里同时控制时长、起止画面和输出分辨率。

场景扩展:把

做到 40 秒

场景扩展功能允许模型回看最多 10 秒的先前画面,并以 10 秒为增量累积延长,最长支持 40 秒的连续生成。AI 在生成下一段时不再是

,而是能记住前几秒里的人物、构图和色调。

这对长镜头和连续叙事的帮助最直接。以前做 30 秒短片往往要靠多段拼接、再后期修补色调和角色一致性;现在模型自己能延续风格,省掉大量手工对齐工作

首尾帧控制:从随机生成到定点过渡

首尾帧控制允许开发者指定起始画面和结束画面,模型在中间自动生成平滑过渡。相当于给了创作者两个锚点:开头长什么样、结尾落在哪里由人定,中间怎么走交给模型补完。

实际用法上,这适合做产品演示、转场动画和短视频开场。用户只需提供两张关键帧,就能拿到一段风格连贯的过渡片段,比纯文字 prompt 稳定得多

4K 输出:终于能直接进生产链路

新模型支持 4K 高清输出,这是面向商业用途的关键一步。此前很多生成视频到 1080p 就开始模糊细节,做广告或电商素材基本不可用。4K 加上前两项控制能力,让它在影视预演、品牌短片和电商主图视频里有了落地可能。

对开发者来说,这次更新最大的意义是

。场景长度、首尾帧、输出分辨率都可以作为参数传入,不再只是

。这意味着可以嵌入自动化产线,做批量素材生成。

中文用户最值得关注的是这些能力何时通过 API 进入 Vertex AI 或面向个人开发者的渠道。Google 系模型在国内直接调用并不容易,但围绕它的工作流、二次封装和本地化部署很快会出现。独立创作者可以先盯着首尾帧控制这类功能,何时有可平替的开源或国产方案上线。

后续值得观察的点有三个:40 秒时长上限是否还会拉长、首尾帧控制是否支持参考图而非仅限首帧,以及 4K 输出对应的推理成本。成本打不下来,再强的控制力也只能停在 demo 阶段。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具