Gemini Omni 1.1 Flash:这次为视频控制发布了什么
Google 的 Gemini Omni 1.1 Flash 是一次面向制作的视频更新:延长场景、指定首尾帧、用 360p 打草稿,再生成 1080p 或 4K 输出。

2026 年 8 月 27 日,Google 发布了 Gemini Omni 1.1 Flash——这是 I/O 首发的 Omni Flash 视频模型迎来的首次面向制作的更新。官方公告和 Google 的 X 帖把它定性为一次控制向的发布,而不是改名:延长一个场景,锁定起始帧和结束帧,附上短视频参考,用 360p 低成本打草稿,再为你要留下的那几条生成 1080p 或 4K。
这和我们在 Gemini Omni Flash:已发布的功能与 Google 有意保留的内容里写过的 5 月 19 日消费端首发,不是同一份工作。最初的 Flash 卖点是对话式编辑和任意对任意输入,硬性上限是 10 秒片段,6 月 30 日的开发者 API 里也没有场景延长。1.1 这一轮,是想把这些片段做够长、做够清晰、做够受控,好进制作流水线。
这篇文章是能力盘点:1.1 实际加了什么,哪些限制还在,以及其中哪些任务你今天就能在 OmniArt 上跑。
Gemini Omni 1.1 Flash 实际发布了什么
Google 的 API id 是 gemini-omni-1.1-flash(在 Gemini Enterprise Agent Platform 上的预览版是 gemini-omni-1.1-flash-preview)。默认输出仍是 720p 横屏;16:9 和 9:16 仍是仅有的两种画面比例。SynthID 水印仍然强制添加。
| 能力 | 原版 Omni Flash | Omni 1.1 Flash |
|---|---|---|
| 片段时长 | 每次生成 10 秒 | 每次生成 10 秒,可按 10 秒步进延长,累计最长 40 秒 |
| 场景延长 | 不在 6 月 30 日 API 里 | 会分析最多 10 秒 的前置画面(不只是最后一秒) |
| 首尾帧 | 不是独立的 API 模式 | 在两帧关键画面之间插值出连续运动 |
| 视频参考 | 一段;超过 3 秒的片段不会被完整处理 | 最多 三段,每段 3 秒 |
| 草稿分辨率 | 默认 720p,没有更便宜的预览档 | 360p 草稿,Google 称最高可快 60%,成本大约是 720p 的三分之一 |
| 成片分辨率 | I/O 时未披露;OmniArt 提供 720p | 1080p 或 4K 输出,文档写明是在 720p 生成后再输出 |
| 可用表面 | Gemini 应用、Flow、YouTube,随后是 6 月 30 日 API | Google AI Studio、Gemini API、Gemini Enterprise Agent Platform、Google Flow;场景延长也出现在面向 Google AI Plus、Pro 和 Ultra 的 Gemini 应用里 |
I/O 时被保留的那份清单没有移动。Google 当前文档仍然写着:不支持语音编辑,不支持上传音频参考,虚拟形象模式也从未进入这次发布。1.1 加的是方向和长度。它没有补上那些因安全而保留的功能。
场景延长:10 秒上下文,最长 40 秒
场景延长是头条。你从已有片段的尾部继续往下走,而不是指望一次新的 10 秒生成能对上它。
Google 自己的数字:模型现在会读取最多 10 秒的前置画面——“相对此前只参考最后一秒的模型,这是一次跃升”——然后追加 3–10 秒。按 10 秒步进重复,直到累计片段达到 40 秒。源片最后几帧会被改写,这样接缝就不是硬切。你不能往前补,也不能延长片段中间。
延长用的提示词可以短到 "Continue the scene.",也可以具体到一次新的运镜。Google 文档写得很明确:带时间戳的延长提示词里,0 秒指的是新片段的起点,不是原片的起点。需要配乐变化时,把音频写进提示词;否则模型会尽量让它连贯。
在你围绕这件事规划一条 40 秒成片之前,有两条约束很要紧:
- 用于延长的上传源片必须是 10 秒或更短,除非你延长的是同一多轮会话里模型已经生成过的片段。
- 延长上传片段在 欧洲经济区、瑞士和英国不可用。延长模型生成的片段,在 API 本身可用的所有地区都能用。
在 OmniArt 上,Seedance 2.5 已经覆盖了一类相近的任务:把任意不超过 30 秒的结果反复延长,累计最长 60 秒,或一次长视频生成跑出 30–180 秒。那是今天工作台里做长段可控视频的路径。1.1 这条 40 秒的 Omni 原生延长链,是同一想法在 Google 表面上的版本。
首尾帧
指定一张起始图和一张结束图;Omni 1.1 会生成两者之间的连续运动。Google 把这一定位给环绕运镜、变焦转场和循环片段——最后一种做法是把同一张图同时用作首帧和尾帧。
提示词标签用来绑定角色。Google 文档写了简单的 FIRST_FRAME 和 LAST_FRAME 标签,直接放进提示词;更复杂的提示词可以显式声明来源:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
标签按原样留在提示词里。周围的指令才是你描述运动的地方:一条连续镜头,不要跳切,两张静帧之间摄像机做什么。
在 OmniArt 上,PixVerse V6 已经提供了在确认过的起始帧和结束帧之间做转场的工作流。如果需求是“从这一帧走到那一帧”,你不必等 Omni 1.1 作为独立模型 id 落地。如果需求是“在 Omni Flash 的对话线程里做这件事”,那目前仍在 Google 的 Interactions API 上。
视频参考,每段最长三秒
1.1 允许你把短参考视频丢进同一条多模态提示词,和文本、图片放在一起。Google 的公开演示把三段舞者视频映射到三张角色静帧上,并要求一条连续镜头。
文档里的上限比营销口径更严。视频参考最适合做外形相似;参考片段里的音频会被忽略;你最多能用 三段、每段最长 3 秒。Google 还说,跨多段视频做参照或推理,并不支持当成叙事对照——把每段视频当作主体或动作参考,而不是当作第二路要去剪的素材。
相对 6 月 30 日预览,这是一次真实的扩展:当时只接受一段视频参考,而且超过 3 秒的片段不会被完整处理。它仍然不是任意对任意设想里音频输入的那一半。声音仍然要写进提示词里。
OmniArt 当前的 Gemini Omni 入口接受一段参考视频(MP4 或 MOV,1–10 秒),并可混入最多五张参考图,计费按源片段时长计算。今天要用单段动作参考,就走这条路径。更大的参考包,Seedance 2.5 仍是工作台里专门做这件事的模型。
360p 草稿与 1080p / 4K 输出
分辨率阶梯是另一项制作向变化。默认生成是 720p。你现在可以请求:
- 360p——Google 的低价草稿档。宣称最高可快 60%,成本大约是 720p 的三分之一。Flow 允许你用 360p 打草稿,再把留下的那条下载成 720p。
- 1080p 或 4K——文档写明是在 720p 生成后再输出,面向社交、数字或播出级成片。
有用的工作流就是最直观的那条:用 360p 探索运镜、表演和剪点,再把 1080p 或 4K 生成花在你真正要交付的那一条上。这和在 OmniArt 上先用快速模型打草稿、再用更高成本模型收尾是同一套纪律——只是现在变成了同一款 Omni 模型上的分辨率切换。
说明
Google 随 1.1 公告发布了一张按分辨率列出的 API 价格表。把 360p “约为 720p 的三分之一”这条口径,当成 Google 自己的对比,而不是 OmniArt 的积分计算。OmniArt 的 Gemini Omni 入口目前按 720p、3–10 秒的界面计费。
原生 4K 生成在这条产品线里仍然是 Veo 3.1 的任务。1.1 的 4K 路径是给 Omni 片段做的成片步骤,并不是在说 Omni 已经取代 Veo 去做大屏交付。
目前在哪些地方可用,OmniArt 今天开放了什么
Google 于 8 月 27 日在自家技术栈上铺开 1.1:
- Google AI Studio 和 Gemini API(
gemini-omni-1.1-flash) - Gemini Enterprise Agent Platform(
gemini-omni-1.1-flash-preview) - Google Flow,包括起始/结束帧、360p 草稿,以及 1080p / 4K 导出
- Gemini 应用里的场景延长,面向 Google AI Plus、Pro 和 Ultra 订阅用户
标准 Gemini Omni 生成已经在 OmniArt 上:720p,3–10 秒,原生音频,最多五张参考图和一段参考视频,Starter 套餐及以上可用。OmniArt 目前没有单独开放 gemini-omni-1.1-flash 这个模型 id,也没有 40 秒延长链、首尾帧任务,或 360p / 1080p / 4K 分辨率阶梯。保留会话的对话式编辑仍然需要 Google 的 Interactions API,这一点在我们报道 6 月 30 日开发者 API 时就是如此。
警告
不要拿 OmniArt 当前的 Gemini Omni 选择器去规划 40 秒的 Omni 1.1 交付。工作台上线的模型仍是 720p、10 秒的 Omni Flash 界面。1.1 特有的控制请先用 Google 的 API 或 Flow,直到这里上线独立的模型入口。
如何对照 Veo 3.1 和 Seedance 2.5 选型
1.1 并没有让 Google 产品线的其余部分退役,也没有让 Omni 成为 OmniArt 里唯一的可控视频选项。按镜头选:
| 这个镜头需要 | 去用 |
|---|---|
| 在同一条 Omni 对话线程里做聊天式修改 | Google 的 API / Flow 上的 Gemini Omni 1.1 |
| 原生 4K、空间音频、播出级成片 | OmniArt 上的 Veo 3.1 |
| 30 秒单次成片、60 秒延长,或 180 秒长视频 | OmniArt 上的 Seedance 2.5 |
| 今天就在工作台里做首尾帧插值 | PixVerse V6 转场,或 Seedance 2.5 首尾帧 |
| 带单段视频参考的快速 720p Omni 生成 | OmniArt 上的 Gemini Omni |
| 大规模多模态参考包 | Seedance 2.5 |
模式和 I/O 时一样:新的 Omni 发布是加法。已经能覆盖需求的模型你继续留着,当任务明确是 Omni 的对话式控制,外加更长、更清晰的成片时,再把 1.1 加进来。
对前 10 秒这一拍仍然适用的提示词习惯——一个清晰动作、声音写进提示词、没有负向提示词字段——见 Omni Flash 提示词指南。工作台里已经能做延长的那款模型,延长用语见 Seedance 2.5 编辑与延长指南。
本周在 OmniArt 上该做什么
如果你想试 Omni 本身,打开视频工作台里的 Gemini Omni,跑当前这条 10 秒、720p 的界面:文本、参考图,或一段短视频参考。把它和 Veo 3.1、Seedance 2.5、PixVerse V6、Kling 以及阵容里的其余模型并排比较——一个余额,一套提示词语法。
如果需求正好是 1.1 的新控制——40 秒的 Omni 原生延长、在 Omni 内部做首尾帧插值,或 360p 再出 4K 的循环——本周请用 Google AI Studio、Flow 或 Gemini API,并把 OmniArt 当作你已经在生成项目其余部分的地方。
这种拆分是暂时的,和当初 Flash API 的缺口一样。等 1.1 的控制作为可选择的 OmniArt 模型落地,它们会变成一个已经在持续产出的工作台里的又一个选项,而不是一个让你等待的理由。
常见问题
Gemini Omni 1.1 Flash 是什么?
Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日对 Omni Flash 的更新,Omni Flash 是一款多模态视频生成和编辑模型。它在原有的对话式编辑和文本/图片/视频输入之上,加入了场景延长、首尾帧插值、短视频参考、360p 草稿,以及 1080p / 4K 输出。
Gemini Omni 1.1 Flash 能在 OmniArt 上用吗?
不能作为独立的模型 id。OmniArt 目前提供标准 Gemini Omni 生成,720p、3–10 秒。1.1 特有的控制——40 秒延长、首尾帧、360p 草稿,以及 1080p / 4K 输出——正在 Google AI Studio、Flow、Gemini API 和 Gemini Enterprise Agent Platform 上铺开。
Omni 1.1 Flash 的视频能有多长?
单次生成仍是 10 秒片段。场景延长每次追加 3–10 秒,使用最多 10 秒的前置画面作为上下文,累计最长 40 秒。用于延长的上传源片必须是 10 秒或更短。
Omni 1.1 Flash 能原生生成 4K 吗?
Google 文档把 1080p 和 4K 写成在默认 720p 生成后再输出,而不是一条原生 4K 拍摄路径。要在 OmniArt 上做原生 4K 视频,Veo 3.1 仍是 Google 产品线里为这种成片准备的模型。
1.1 有没有加入音频参考上传或语音编辑?
没有。Google 当前的 Omni 文档仍然把音频参考上传和语音编辑列为不支持。视频参考里的音频会被忽略。声音仍然靠提示词来引导,这和我们在任意对任意输入那篇文章里记录的一致。
准备好创作了吗?
开始用 AI 生成精彩内容