guide教程与操作指南19 分钟阅读

怎么用 AI 扩展视频画面:一套真实能跑通的流程

用 AI 扩展视频画面的实操流程:先用 OmniArt 的图片模型把关键帧延展到新的宽高比,再用图生视频重建镜头,并讲清这套做法在哪里会失效。

OmniArt 团队
怎么用 AI 扩展视频画面:一套真实能跑通的流程

你拍的是竖屏,客户要的是 16:9。或者一段 4:3 的存档素材必须填满宽屏首屏的位置。或者一段 1:1 的产品循环片要当 9:16 的故事版投出去,还不能把产品切掉一半。本能反应是裁剪,而裁剪正是好素材去送命的地方——你要么丢掉构图的边缘,要么接受上下黑边加一个更小的主体。

干净的解法是把视频画面向外扩展,而不是往里切:保住每一个原始像素,在空出来的边缘里生成新的画面信息。专门做视频外扩的工具正是逐帧干这件事的。OmniArt 不是——工作区里今天没有一键扩展视频画面的功能。

OmniArt 有的,是一套复合流程的两半,它们合起来能走到同一个结果:图片模型能带着区域与锚点控制把一张静帧延展到新的宽高比,视频模型阵容又能把这张延展后的静帧重新变回运动画面。这篇指南会把五个阶段从头走到尾,同时也把代价说清楚——你是在重建这个镜头,而不是在扩展原始素材。对一段缓慢、静止、以背景为主的片子,这种重建往往和真东西看不出区别。对一段手持穿过人群的推镜,就不行。

“扩展视频画面”到底指什么

有四种完全不同的操作被叫成同一个名字,而挑错了那一个,就是这件活里被浪费掉的大部分时间。

做法你的像素会怎样代价
裁剪/平移扫描原始像素保留,边缘被丢掉构图和主体大小
上下黑边/模糊边柱全部保留,边缘用黑条或一份模糊副本填上屏幕面积;观感像是转发
视频外扩全部保留,边缘逐帧生成需要一个专门的外扩模型
复合式重建(本文的做法)原片变成参考,另外生成一段更宽的新片与源素材逐帧对应的还原度

复合式重建位于外扩和重拍之间:把一帧有代表性的静帧延展到目标比例,让它动起来,再把新片的运动和调色匹配到原片上,好让两者能待在同一条剪辑线里。

警告

对这件事要看得清楚。OmniArt 没有原生的视频外扩——这套流程是从一张延展后的静帧重新生成镜头,而不是把你现有的画面加宽。它不会逐像素保住你的源素材,也撑不过一个快速运镜或带同步对白的镜头。如果这段素材是必须保持拍摄原样的核心镜头,请改用专门的视频外扩工具,或者按更宽的比例重拍。

这套做法什么时候好用,什么时候会翻车

在花掉一份额度之前先判断镜头。决定一切的变量是:更宽的画面要求多少新信息。

效果好的情况:

  • 固定机位或近乎静止的镜头。 三脚架上的产品台面、静物、缓慢的环境背景——原始画框之外几乎没有东西需要独立运动。
  • 边缘是环境和材质。 影棚背景、天空、墙面、水面、植被、虚化光斑。图片模型延展连续材质相当可信。
  • 缓慢、单一方向的运镜。 一个轻推或轻移,你能用提示词重新描述出来。
  • 短片段。 3–6 秒。片子越短,相对源素材累积的偏移越少。
  • 主体居中。 如果主体从不走进新生成的边缘区域,需要做对的事情就少得多。

会翻车,而且通常翻得很惨:

  • 快速或复杂的运镜。 手持、甩镜、摇臂——新的边缘区域需要几何上正确的视差,而模型没有任何依据去凭空造出来。
  • 复杂的遮挡关系。 主体从前景物体后面经过、人群横穿画面、四肢在边缘进出。
  • 需要口型同步的口播镜头。 你没法重新生成一段表演还让对白对得上。别试。
  • 边缘出现可辨识的人物或有授权的产品。 模型在边缘造出来的东西就是造出来的——这是法律问题,不只是审美问题。
  • 长镜头。 超过大约 8 秒,重建出来的片子会以任何调色都藏不住的方式偏离源素材。

如果你的镜头落在第二张清单里,就到这里停下。老老实实加黑边,或者一次有品位的裁剪,都比一段肉眼可见地在晃的重建更好。

阶段 1:导出一帧有代表性的画面

拖动源片的时间轴,按完整分辨率导出一张 PNG 静帧。“有代表性”这几个字是真在干活的——下游的一切都会继承这一帧的构图、光线和主体位置。

  • 挑一帧主体处在最典型位置的画面,而不是最极端的位置。
  • 避开带运动模糊的帧。模糊会被烤进延展结果,然后被视频模型再糊一遍。
  • 如果镜头有运动,优先选运镜中段的一帧,这样重建出来的运动在两侧都有同等余量。
  • 用无损格式导出。画面边缘的一处压缩伪影,会在延展后的图里变成一道接缝。

现在就把源片的比例、分辨率和时长记下来——这三个数在阶段 4 都要用。

阶段 2:把静帧延展到目标宽高比

打开 OmniArt 的图片工作区,挑一个能接收你的静帧作为参考、并把目标宽高比作为参数的模型。Seedream 5.0 Pro 在这里是务实的选择,因为它支持区域与锚点编辑以及多图融合——你可以把原图钉成参考,同时告诉模型新内容属于某一侧特定的边缘区域。

上传导出的那一帧,把输出宽高比设成你的目标(16:9、9:16、4:5——投放位需要什么就设什么),然后为边缘区域写提示词,而不是为整幅画面写。

把一张 9:16 的产品镜头延展到 16:9:

“把参考图作为画面的精确中心。参考图的所有元素在内容、比例、位置、颜色和光线上完全保持不变。只向左右两侧向外扩展场景,继续同一张胡桃木桌面、同一块无缝的暖灰色背景,以及同一道来自左上方的柔和主光。匹配现有的景深和颗粒。不要加入任何新物体、人物、文字或道具。”

把一段 4:3 的外景延展到 16:9:

“把参考图作为锚点区域并完全保留。向左右继续这个场景:同样的阴天天空渐变、同样的树线密度、同样的湿沥青反光。让地平线在整个宽度上保持完全相同的高度。摄影质感,不做风格化,不添加车辆或人物。”

有三个习惯能把一次干净的延展和一次一眼假的延展区分开:

  1. 先说要保留什么,再说要加什么。 你不明确钉住原始区域,模型就会在那一块上漂。
  2. 点明方向。 “只向左右”能阻止模型悄悄把整幅构图重新平衡一遍。
  3. 点明连续性锚点。 地平线高度、主光方向、表面材质、景深、颗粒——这些正是眼睛在接缝处会去核对的东西。

生成三到四个变体,在接缝处按 100% 比例对比,不要缩着看。凡是有可见明暗台阶、地平线弯折,或者材质在某个表面中途变了性格的,都淘汰。如果一个变体除了某一侧边缘之外都对,就只对那一块再跑一次区域编辑,而不是把整张图重摇一遍。

阶段 3:把延展后的静帧重新驱动成运动画面

把通过的宽幅静帧带进视频工作区,用它生成一段图生视频。延展后的静帧成了第一帧,所以模型是在一张已经具备正确宽高比的画面上做动画——加宽这个问题在运动进场之前就已经解决了。

你的提示词只有一个任务:复现源片的运动。把原片多看几遍,按镜头、主体的顺序描述它们实际在做什么。

“让参考图动起来。镜头在 5 秒内极缓慢推进,无抖动,无倾斜。主体保持居中且静止。蒸汽向上并向右飘。背景保持静止。光线全程不变。锁定构图,无剪切,无变焦突跳。”

模型的选择跟着镜头走。Seedance 2.0 让你把延展后的静帧钉成带标签的参考,在运动中保住身份一致性。当片子必须和原生 4K 素材放在一起时,Veo 3.1 是那个选择。Kling 3.0 是一次要重建很多镜头时的性价比选项,PixVerse 则能快速出偏社媒调性的片子,适合便宜地多跑几轮。它们都在同一个工作区里,所以试两个只是换一次下拉选项——更完整的对比见 2026 年最好的图生视频 AI 模型

时长对上源片,生成两到三个种子。评判每一个时专门看新生成的边缘区域,因为一个不稳的模型最先在那里暴露自己。

阶段 4:把运动、时长和调色匹配到源片

这是决定这次重建能不能过关的阶段。把新片直接放在原片上面一层轨道,然后对比它们。

要检查什么怎么查怎么修
运动速度在同一个播放头位置切换两段片子给生成的片子变速;小幅的速度调整看不出来
运动方向对比两段片子的首帧和末帧带明确方向重写提示词;不要在剪辑里硬掰
时长对齐帧数,而不是取整到秒修剪,而不是拉伸超过大约 10%
颜色和颗粒两段都上示波器,再按 100% 对比一块平面向源片方向调色并补上匹配的颗粒;渲染出来的画面太干净了
主体大小用 50% 不透明度叠加缩放这段片子;如果差了超过几个百分点,回阶段 2 重新延展

提示

先把生成的片子调色匹配到源片,然后在两段之上统一加一层轻微的颗粒。一层共用的颗粒层,比任何逐段调色都更能掩盖噪点结构上的细小差异。

阶段 5:把它剪进去

生成的片子现在是一份可用的宽幅素材,但最强的剪法通常不会只靠它。

  • 直接替换。 如果重建立得住,就把它当成这个镜头用。最简单,也是静态背景下的正确答案。
  • 把原片叠在重建之上。 把源片按原始尺寸放在生成的宽幅片子上层,主体位置对齐。你真实的素材在中间播放,生成的边缘填满两侧——这是这套流程能逼近真正外扩的极限,也是画面中心必须保持真实时该用的版本。
  • 绕着它剪。 用宽幅片子做交代镜头,近景时刻切回裁剪过的原片。镜头之间的运动会盖掉差异。

按目标比例导出,除了显示器之外也在手机上看一遍。在笔记本上读作“稍微有点软”的接缝,在一块又小又亮的屏幕上会读作“明显是假的”。

值得直说的局限

  • 这不是外扩。 生成出来的片子是一次全新的渲染。与源素材逐帧对应的还原度按定义就已经没了,没有任何提示词能拿回来。
  • 音频撑不过这次重建。 和画面动作绑定的声音需要重新对齐,而对白基本上做不到。
  • 成本随迭代次数增长,而不是随时长增长。 大部分花费都进了延展变体和种子对比里。
  • 长片会漂。 超过大约 8 秒,就分段重建,再在段之间剪。
  • 有时候换个工具就是唯一正确的答案。 要加宽的镜头很多、素材不可替代,或者客户会逐帧对比,这些都指向一个专门做外扩的工具,或者按更宽的比例重拍。知道什么时候不该用这套流程,也是把它用好的一部分。

常见问题

OmniArt 能一步扩展视频画面吗?

不能。工作区里没有原生的视频外扩。上面这套流程是通过用图片模型延展一张静帧、再用图生视频模型重新生成运动,来达到类似的结果。

结果会和原片一模一样吗?

不会,也不该被当成一模一样来卖。在静止、以材质为主的镜头上,这个差别放进剪辑里通常察觉不到。在任何有真实运镜的镜头上,它是看得见的。

我能让原始素材留在画面中间吗?

可以——那就是阶段 5 里的叠加方案。把源片按原始尺寸叠在生成的宽幅片子上层。你真实的像素在中间播放,生成的内容只填边缘。

在 OmniArt 上开始

挑一段静止的片子和一个目标比例。导出一帧有代表性的画面,在图片工作区里用 Seedream 5.0 Pro 按新的宽高比把它延展开,再用图生视频模型让结果动起来,然后匹配调色并剪进去。二十分钟就能告诉你这条重建路线对那个镜头行不行——在你把一整批素材都押上去之前。

两半都在同一个地方,所以这个循环是一个工作区、一份余额,而不是两份订阅。带一帧画面和一块干净的背景,从 创作工作区 开始。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始