industry模型与洞察20 分钟阅读

实时 AI 视频与世界模型:写给创作者的一次讲清楚

实时 AI 视频和世界模型到底指什么,交互式视频生成与批处理式文生视频差在哪里,以及这对今天就要交片的创作者到底改变了什么、又没改变什么。

OmniArt 团队
实时 AI 视频与世界模型:写给创作者的一次讲清楚

实时 AI 视频是当下生成式媒体里被讨论得最多的前沿,同时也是定义得最不清楚的一个。看是谁在讲,它可以指一个渲染速度快过播放速度的模型,可以指一个你能在运行中用键盘操控的模型,也可以指一个把整个模拟环境装在脑子里的模型。这是三个不同的技术问题,有三条不同的时间线,而把它们塞进同一个标题,正是创作者最后围绕着还不存在的能力做规划的原因。

这篇文章要把这些说法拆开。“实时生成”实际描述的是什么,“世界模型”是什么、不是什么,谁在这个方向上做东西,硬约束在哪里,以及——对任何这个月手上有交付的人最要紧的那部分——它对今天要出的活改变了什么、又没改变什么。简版答案是:生产用的视频仍然跑在批处理模型上,而且还会跑一段时间。

AI 视频里的“实时”到底指什么

大多数创作者在用的模型是批处理模型。你写一份需求、提交,模型把整段片子当成一个整体来规划和渲染,几秒或几分钟之后你拿到一个成品文件。输出里没有任何东西是在你观看的过程中决定的。这次生成是一个任务。

实时生成把这个循环反了过来。模型不是产出一段成品片子,而是连续产出帧,快到这条流可以边生成边被观看——而且关键在于,快到中途送进来的输入能影响接下来的帧。最后这条性质,才是人们说“实时”时通常想表达的意思,而它更准确的名字是交互式视频生成

同一个标签底下其实藏着三种截然不同的主张:

主张它的意思为什么难
渲染快过播放一段片子渲染完的时间少于看完它的时间主要是效率和基础设施问题
流式生成帧逐步到达,而不是一次性全部到达需要因果式、逐帧的架构
交互式生成你在流中途的输入会改变接下来发生什么需要模型持有并更新状态

第一种是一次优化。第三种是另一个门类的系统。

世界模型是什么(以及不是什么)

世界模型不只是一个能跑得更久的视频模型。区别在于状态。一个文生视频模型把提示词映射成一串帧;提示词就是全部指令,那串帧就是全部答案。一个世界模型维护着一个场景的内部表示——里面有什么、东西在哪、它们怎么表现——并把帧作为这个表示的一个视图生成出来,同时根据动作去更新它。

这就是为什么世界模型总是和游戏引擎一起被讨论,而不是和视频工具一起。这个类比不精确,但有用:

性质批处理文生视频世界模型
输出单位一段成品片子一个持续生成的视图
指令一条提示词,一开始给出一条提示词加持续输入的动作
内部状态隐式的,渲染完就丢掉显式的,并在一次会话期间持续存在
成功条件片子符合需求你在环境里移动时它始终保持自洽
失败形态镜头不对,片子内部漂移物体消失、几何自相矛盾、物理崩坏

真正有意思的研究问题是持久性:如果你从一个物体转过身去再转回来,它还在吗,还在同一个位置吗,看起来还一样吗?批处理模型从来不必回答这个问题。世界模型的成败就在这上面。

值得注意的入场者

有三股比较松散的力量在推这件事,而它们想要的东西不一样。

谷歌的 Genie 一类世界模型

Google DeepMind 的 Genie 系列是多数人引用的参照点。它的卖点是从一条提示词或一张图出发,做动作条件约束下的可漫游环境生成——你描述一个地方,然后你在里面移动,模型生成接下来的每一个视图,而不是回放一段预渲染好的画面。公开演示强调的是让人觉得有响应感的交互帧率,以及在一段连续探索里撑得住的自洽性;而它的定位一直被明确说成研究取向,被引用的动机里,智能体训练和具身智能至少和内容创作一样重。

PixVerse R1

PixVerse 把 R1 定位成一个实时世界模型,而不是又一次文生视频发布,并且面向创作者与偏游戏的受众,把它当成 Genie 一类系统的替代方案来推。这个定位值得注意,因为它来自一家视频生成公司而不是研究实验室,这说明这个门类正在被当成一个产品面来认真对待,而不只是当成一篇论文。在有独立的实机对比出现之前,把那些具体指标当成厂商宣传来看——在这个领域,发布会里的质量和真正交付的质量此前就已经出现过分叉。

偏游戏的中间地带

第三股力量最不上头条,可能也最有实际后果:把生成模型放进传统引擎内部或旁边的那些工作。在引擎输出之上做神经渲染、把生成的素材和环境喂进一条正常的制作流水线、生成式的非玩家角色行为、逐帧应用的风格迁移。这里没有一样是完整的世界模型。但它们全都会更早落地,因为它们继承了引擎的确定性和可控性,只在生成确实更好的地方才用生成。

说明

看发布公告时要留意这些说法:“实时”但没有说明交互循环,通常指的是渲染快,而不是可操控的生成。“世界模型”被用在一个定长片段生成器上,通常意味着市场部走得比架构快了一步。

决定时间线的那些约束

在演示和可靠的创作工具之间横着四个问题。它们一个都还远没解决,而在其中一个上取得进展往往要拿另一个来付账。

延迟对比画质。 交互性强加了一个硬性的单帧算力预算:模型在下一帧到期之前能产出多少,就是你能拿到的全部。批处理模型想在一帧上花多久都可以。交互式系统里的每一分画质都必须在那个预算内被买下来,这就是为什么交互式输出看起来比批处理输出落后一代——也是为什么就算两边都在进步,它看起来还会继续落后。

分辨率和细节。 同一份预算,换算到像素上。批处理流水线负担得起精修环节和放大环节;一个按需生成帧的系统一般做不到,至少不可能不引入它本来就是要避开的那份延迟。

跨时间的连贯性。 这是最深的那一个。长时程的一致性需要对已经生成过的内容有记忆,而记忆要花算力,这份算力又和帧预算相互竞争。物体漂移、几何悄悄自相矛盾、同一个位置两次造访之间光线变了,全都是同一个局限的症状。这方面的进展是真实的,但是渐进式的;诚实的说法是:会话在一段时间里保持自洽,然后就不自洽了。

控制精度。 交互只有在模型按你的本意响应输入时才有用。方向性的移动相对好办。而精确、可重复、逐帧准确的调度——一个电影导演或游戏设计师真正需要的那种——要难得多,而且在“会即兴发挥的系统”和“完全照令执行的系统”之间存在一个尚未解决的张力。

还有一个较少被提到的经济约束。一次批处理渲染是一个有边界、可计费的任务。一次交互式会话是一条开放的算力流,而每一秒都有人在付钱。这一点在研究做完之前很久,就已经在塑造这个门类的产品能长成什么样。

这对创作者改变了什么——以及没改变什么

目前还没改变的部分

如果你在给客户、给投放、给观众交视频,实时世界模型不是你流水线的一部分,装作它是会让你误一次交期。成品片子的画质、分辨率、音频、镜头控制和参考图还原度,全都仍然活在批处理模型里——也就是今天 OmniArt 上可用的 Seedance、Veo、Kling、Sora、PixVerse 和 Grok Imagine 这些代次。它们每一个都是为交互式系统所牺牲的那件事做优化的:花掉真实的算力,把一段片子做到它能达到的最好。

这也不是一条替代路线。交互式生成和批处理生成优化的是同一个取舍的两个相反端点。一个世界模型很出色的未来,并不意味着批处理模型会过时,就像实时游戏引擎并没有让离线的影视渲染过时一样。

确实改变了的部分

现在有三件事值得调整。

  • 预演会最先变便宜。 可操控生成第一个真正有用的应用,是在投入一次成品渲染之前先探索一个空间或一个走位方案。当你还在做决定时,粗糙、可交互、能立刻改,胜过精致但慢。
  • 提示词不再是唯一的接口。 随着模型开始接收持续的输入,需求描述会越来越不像段落,而越来越像导演调度——一个起始状态加一串意图。那些已经习惯用镜头和节拍而不是用句子思考的创作者,会适应得更快。
  • 偏游戏的活会比偏影视的活先打开。 交互式媒体愿意用画质换响应速度,因为观众是在参与而不是在观看。那是这项技术第一个真正具备竞争力的地方。

能迁移过去的能力

你在今天的模型上学到的东西没有一样是白学的。精确描述一个场景、指定镜头和光线、跨镜头维持一个角色或一种质感,以及建立一套可复用的评测习惯——同一份需求、同一批参考、同一套评分标准,拿去跑任何新东西——全都能直接平移。接口会变;把你想要什么说清楚这门手艺不会。

警告

对这个门类里的跑分说法要格外小心。交互式系统很难被公平比较,而一个针对某条短而讨巧的环境路径优化过的演示,几乎不能说明它在一次更长的会话里表现如何。等实机测试出来,再去改你的流水线。

今天在 OmniArt 上你能做什么

OmniArt 不提供实时世界模型生成,我们宁愿直说,也不愿把这条界线模糊掉。视频工作区确实提供的,是当下的批处理阵容集中在一个地方——Seedance 2.0、Veo 3.1、Kling、Sora 2、PixVerse V6 和 C1、Google Gemini Omni、Happy Horse,以及 Grok Imagine——共用一份余额,共用一套提示词语法。

这件事对迎接交互式的未来,比听起来更有用。准备的方式,就是在那些能迁移的部分上练快:

  1. 在便宜的档位上迭代。 先在快速档或迷你档上起草一个镜头,把构图和运动定下来,再把同一份需求跑到更高档位上。这是交互循环在批处理世界里的等价物,也是你搞清楚一份需求到底在要求什么的方式。
  2. 用续接干活,而不是一次成型。 OmniArt 上有专门的 Grok Imagine Extend 和 Modify 模型,它们作用在一段已经完成的片子上——延长它或改动它,而不是从头重新生成——而且 Extend 对视频工作区里任何模型出的画面都适用。你也可以手动串起来:用转场模式,或者把一段片子的最后一帧当成下一段的起始图喂回去。不管走哪条路,用续接的方式思考,练的正是交互式生成将来会要求的那种顺序性、有状态意识的习惯。
  3. 用同一份需求比模型。 一条提示词,几个模型,并排放。这是这个领域里评估任何东西唯一诚实的方法,也是那个能让你用一个下午而不是一个季度去评估一项全新能力的习惯。

想完整逛一遍工作区里的模型,见 所有 AI 视频模型集中在一个工作区。想现在就开一个镜头,去 创作页

常见问题

创作者今天用得上实时 AI 视频吗?

快速渲染用得上。真正可交互、可操控的生成还是一项新兴能力,目前只有演示和早期产品,不是一件可靠的生产工具。成品视频的活跑在批处理模型上。

世界模型和文生视频模型的区别是什么?

文生视频模型把一条提示词变成一段成品片子。世界模型维护一个场景的持久内部状态,并根据持续输入的动作生成它的视图——这就是为什么“你回到一个地方时它是否还一致”比片子本身的画质更重要。

世界模型会取代批处理视频模型吗?

不太可能,至少不会作为一个门类被取代。两者优化的是同一个“延迟对比画质”取舍的两个相反端点,所以更该把它们理解成互补的工具,而不是前后两代。

现在该学什么来做准备?

精确的场景描述、镜头与光线的调度、跨镜头的一致性,以及一套可复用的对比习惯。不管接口最后长成什么样,这些全都能迁移。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始