Update模型与洞察18 分钟阅读

Gemini Omni 1.1 Flash:这次为视频控制发布了什么

Google 的 Gemini Omni 1.1 Flash 是一次面向制作的视频更新:延长场景、指定首尾帧、用 360p 打草稿,再生成 1080p 或 4K 输出。

OmniArt 团队
Gemini Omni 1.1 Flash:这次为视频控制发布了什么

2026 年 8 月 27 日,Google 发布了 Gemini Omni 1.1 Flash——这是 I/O 首发的 Omni Flash 视频模型迎来的首次面向制作的更新。官方公告Google 的 X 帖把它定性为一次控制向的发布,而不是改名:延长一个场景,锁定起始帧和结束帧,附上短视频参考,用 360p 低成本打草稿,再为你要留下的那几条生成 1080p 或 4K。

这和我们在 Gemini Omni Flash:已发布的功能与 Google 有意保留的内容里写过的 5 月 19 日消费端首发,不是同一份工作。最初的 Flash 卖点是对话式编辑和任意对任意输入,硬性上限是 10 秒片段,6 月 30 日的开发者 API 里也没有场景延长。1.1 这一轮,是想把这些片段做够长、做够清晰、做够受控,好进制作流水线。

这篇文章是能力盘点:1.1 实际加了什么,哪些限制还在,以及其中哪些任务你今天就能在 OmniArt 上跑。

Gemini Omni 1.1 Flash 实际发布了什么

Google 的 API id 是 gemini-omni-1.1-flash(在 Gemini Enterprise Agent Platform 上的预览版是 gemini-omni-1.1-flash-preview)。默认输出仍是 720p 横屏;16:9 和 9:16 仍是仅有的两种画面比例。SynthID 水印仍然强制添加。

能力原版 Omni FlashOmni 1.1 Flash
片段时长每次生成 10 秒每次生成 10 秒,可按 10 秒步进延长,累计最长 40 秒
场景延长不在 6 月 30 日 API 里会分析最多 10 秒 的前置画面(不只是最后一秒)
首尾帧不是独立的 API 模式在两帧关键画面之间插值出连续运动
视频参考一段;超过 3 秒的片段不会被完整处理最多 三段,每段 3 秒
草稿分辨率默认 720p,没有更便宜的预览档360p 草稿,Google 称最高可快 60%,成本大约是 720p 的三分之一
成片分辨率I/O 时未披露;OmniArt 提供 720p1080p4K 输出,文档写明是在 720p 生成后再输出
可用表面Gemini 应用、Flow、YouTube,随后是 6 月 30 日 APIGoogle AI Studio、Gemini API、Gemini Enterprise Agent Platform、Google Flow;场景延长也出现在面向 Google AI Plus、Pro 和 Ultra 的 Gemini 应用里

I/O 时被保留的那份清单没有移动。Google 当前文档仍然写着:不支持语音编辑,不支持上传音频参考,虚拟形象模式也从未进入这次发布。1.1 加的是方向和长度。它没有补上那些因安全而保留的功能。

场景延长:10 秒上下文,最长 40 秒

场景延长是头条。你从已有片段的尾部继续往下走,而不是指望一次新的 10 秒生成能对上它。

Google 自己的数字:模型现在会读取最多 10 秒的前置画面——“相对此前只参考最后一秒的模型,这是一次跃升”——然后追加 3–10 秒。按 10 秒步进重复,直到累计片段达到 40 秒。源片最后几帧会被改写,这样接缝就不是硬切。你不能往前补,也不能延长片段中间。

Gemini Omni 1.1 Flash 场景延长演示Google 官方演示:Omni 1.1 Flash 根据前置画面继续一个场景,同时保住角色身份、光影和叙事上下文。看接缝,而不只是看新动作:身份、光影和配乐应当在延长后活下来,而不是重置。

延长用的提示词可以短到 "Continue the scene.",也可以具体到一次新的运镜。Google 文档写得很明确:带时间戳的延长提示词里,0 秒指的是片段的起点,不是原片的起点。需要配乐变化时,把音频写进提示词;否则模型会尽量让它连贯。

在你围绕这件事规划一条 40 秒成片之前,有两条约束很要紧:

  • 用于延长的上传源片必须是 10 秒或更短,除非你延长的是同一多轮会话里模型已经生成过的片段。
  • 延长上传片段在 欧洲经济区、瑞士和英国不可用。延长模型生成的片段,在 API 本身可用的所有地区都能用。

在 OmniArt 上,Seedance 2.5 已经覆盖了一类相近的任务:把任意不超过 30 秒的结果反复延长,累计最长 60 秒,或一次长视频生成跑出 30–180 秒。那是今天工作台里做长段可控视频的路径。1.1 这条 40 秒的 Omni 原生延长链,是同一想法在 Google 表面上的版本。

首尾帧

指定一张起始图和一张结束图;Omni 1.1 会生成两者之间的连续运动。Google 把这一定位给环绕运镜、变焦转场和循环片段——最后一种做法是把同一张图同时用作首帧和尾帧。

Gemini Omni 1.1 Flash 首尾帧演示Google 官方演示:Omni 1.1 Flash 在指定的起始镜头和结束帧之间,插值出连续的运镜运动。真正有用的测试是:中间这段运动读起来是不是同一镜——一次甩镜、一次变焦、一次循环——而不是两张静帧加一次叠化。

提示词标签用来绑定角色。Google 文档写了简单的 FIRST_FRAMELAST_FRAME 标签,直接放进提示词;更复杂的提示词可以显式声明来源:

[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]

标签按原样留在提示词里。周围的指令才是你描述运动的地方:一条连续镜头,不要跳切,两张静帧之间摄像机做什么。

在 OmniArt 上,PixVerse V6 已经提供了在确认过的起始帧和结束帧之间做转场的工作流。如果需求是“从这一帧走到那一帧”,你不必等 Omni 1.1 作为独立模型 id 落地。如果需求是“在 Omni Flash 的对话线程里做这件事”,那目前仍在 Google 的 Interactions API 上。

视频参考,每段最长三秒

1.1 允许你把短参考视频丢进同一条多模态提示词,和文本、图片放在一起。Google 的公开演示把三段舞者视频映射到三张角色静帧上,并要求一条连续镜头。

Gemini Omni 1.1 Flash 视频参考演示Google 官方演示:Omni 1.1 Flash 用短参考片段,把动作和角色表演迁移进一个新场景。每段视频做的是动作工作,不是外形工作:静帧承担身份,三秒视频承担舞蹈。

文档里的上限比营销口径更严。视频参考最适合做外形相似;参考片段里的音频会被忽略;你最多能用 三段、每段最长 3 秒。Google 还说,跨多段视频做参照或推理,并不支持当成叙事对照——把每段视频当作主体或动作参考,而不是当作第二路要去剪的素材。

相对 6 月 30 日预览,这是一次真实的扩展:当时只接受一段视频参考,而且超过 3 秒的片段不会被完整处理。它仍然不是任意对任意设想里音频输入的那一半。声音仍然要写进提示词里。

OmniArt 当前的 Gemini Omni 入口接受一段参考视频(MP4 或 MOV,1–10 秒),并可混入最多五张参考图,计费按源片段时长计算。今天要用单段动作参考,就走这条路径。更大的参考包,Seedance 2.5 仍是工作台里专门做这件事的模型。

360p 草稿与 1080p / 4K 输出

分辨率阶梯是另一项制作向变化。默认生成是 720p。你现在可以请求:

  • 360p——Google 的低价草稿档。宣称最高可快 60%,成本大约是 720p 的三分之一。Flow 允许你用 360p 打草稿,再把留下的那条下载成 720p。
  • 1080p4K——文档写明是在 720p 生成后再输出,面向社交、数字或播出级成片。

有用的工作流就是最直观的那条:用 360p 探索运镜、表演和剪点,再把 1080p 或 4K 生成花在你真正要交付的那一条上。这和在 OmniArt 上先用快速模型打草稿、再用更高成本模型收尾是同一套纪律——只是现在变成了同一款 Omni 模型上的分辨率切换。

说明

Google 随 1.1 公告发布了一张按分辨率列出的 API 价格表。把 360p “约为 720p 的三分之一”这条口径,当成 Google 自己的对比,而不是 OmniArt 的积分计算。OmniArt 的 Gemini Omni 入口目前按 720p、3–10 秒的界面计费。

原生 4K 生成在这条产品线里仍然是 Veo 3.1 的任务。1.1 的 4K 路径是给 Omni 片段做的成片步骤,并不是在说 Omni 已经取代 Veo 去做大屏交付。

目前在哪些地方可用,OmniArt 今天开放了什么

Google 于 8 月 27 日在自家技术栈上铺开 1.1:

  • Google AI StudioGemini APIgemini-omni-1.1-flash
  • Gemini Enterprise Agent Platformgemini-omni-1.1-flash-preview
  • Google Flow,包括起始/结束帧、360p 草稿,以及 1080p / 4K 导出
  • Gemini 应用里的场景延长,面向 Google AI Plus、Pro 和 Ultra 订阅用户

标准 Gemini Omni 生成已经在 OmniArt 上:720p,3–10 秒,原生音频,最多五张参考图和一段参考视频,Starter 套餐及以上可用。OmniArt 目前没有单独开放 gemini-omni-1.1-flash 这个模型 id,也没有 40 秒延长链、首尾帧任务,或 360p / 1080p / 4K 分辨率阶梯。保留会话的对话式编辑仍然需要 Google 的 Interactions API,这一点在我们报道 6 月 30 日开发者 API 时就是如此。

警告

不要拿 OmniArt 当前的 Gemini Omni 选择器去规划 40 秒的 Omni 1.1 交付。工作台上线的模型仍是 720p、10 秒的 Omni Flash 界面。1.1 特有的控制请先用 Google 的 API 或 Flow,直到这里上线独立的模型入口。

如何对照 Veo 3.1 和 Seedance 2.5 选型

1.1 并没有让 Google 产品线的其余部分退役,也没有让 Omni 成为 OmniArt 里唯一的可控视频选项。按镜头选:

这个镜头需要去用
在同一条 Omni 对话线程里做聊天式修改Google 的 API / Flow 上的 Gemini Omni 1.1
原生 4K、空间音频、播出级成片OmniArt 上的 Veo 3.1
30 秒单次成片、60 秒延长,或 180 秒长视频OmniArt 上的 Seedance 2.5
今天就在工作台里做首尾帧插值PixVerse V6 转场,或 Seedance 2.5 首尾帧
带单段视频参考的快速 720p Omni 生成OmniArt 上的 Gemini Omni
大规模多模态参考包Seedance 2.5

模式和 I/O 时一样:新的 Omni 发布是加法。已经能覆盖需求的模型你继续留着,当任务明确是 Omni 的对话式控制,外加更长、更清晰的成片时,再把 1.1 加进来。

对前 10 秒这一拍仍然适用的提示词习惯——一个清晰动作、声音写进提示词、没有负向提示词字段——见 Omni Flash 提示词指南。工作台里已经能做延长的那款模型,延长用语见 Seedance 2.5 编辑与延长指南

本周在 OmniArt 上该做什么

如果你想试 Omni 本身,打开视频工作台里的 Gemini Omni,跑当前这条 10 秒、720p 的界面:文本、参考图,或一段短视频参考。把它和 Veo 3.1、Seedance 2.5、PixVerse V6、Kling 以及阵容里的其余模型并排比较——一个余额,一套提示词语法。

如果需求正好是 1.1 的新控制——40 秒的 Omni 原生延长、在 Omni 内部做首尾帧插值,或 360p 再出 4K 的循环——本周请用 Google AI Studio、Flow 或 Gemini API,并把 OmniArt 当作你已经在生成项目其余部分的地方。

这种拆分是暂时的,和当初 Flash API 的缺口一样。等 1.1 的控制作为可选择的 OmniArt 模型落地,它们会变成一个已经在持续产出的工作台里的又一个选项,而不是一个让你等待的理由。

常见问题

Gemini Omni 1.1 Flash 是什么?

Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日对 Omni Flash 的更新,Omni Flash 是一款多模态视频生成和编辑模型。它在原有的对话式编辑和文本/图片/视频输入之上,加入了场景延长、首尾帧插值、短视频参考、360p 草稿,以及 1080p / 4K 输出。

Gemini Omni 1.1 Flash 能在 OmniArt 上用吗?

不能作为独立的模型 id。OmniArt 目前提供标准 Gemini Omni 生成,720p、3–10 秒。1.1 特有的控制——40 秒延长、首尾帧、360p 草稿,以及 1080p / 4K 输出——正在 Google AI Studio、Flow、Gemini API 和 Gemini Enterprise Agent Platform 上铺开。

Omni 1.1 Flash 的视频能有多长?

单次生成仍是 10 秒片段。场景延长每次追加 3–10 秒,使用最多 10 秒的前置画面作为上下文,累计最长 40 秒。用于延长的上传源片必须是 10 秒或更短。

Omni 1.1 Flash 能原生生成 4K 吗?

Google 文档把 1080p 和 4K 写成在默认 720p 生成后再输出,而不是一条原生 4K 拍摄路径。要在 OmniArt 上做原生 4K 视频,Veo 3.1 仍是 Google 产品线里为这种成片准备的模型。

1.1 有没有加入音频参考上传或语音编辑?

没有。Google 当前的 Omni 文档仍然把音频参考上传和语音编辑列为不支持。视频参考里的音频会被忽略。声音仍然靠提示词来引导,这和我们在任意对任意输入那篇文章里记录的一致。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始