Guide教程与操作指南18 分钟阅读

怎么用 AI 扩展视频画面:一套真实能跑通的流程

用 AI 扩展视频画面的实操流程:先用 OmniArt 的图片模型把关键帧延展到新的画面比例,再用图生视频重建镜头,并讲清这套做法在哪里会失效。

OmniArt 团队
怎么用 AI 扩展视频画面:一套真实能跑通的流程

你拍的是竖屏,客户要的是 16:9。或者一段 4:3 的存档素材必须填满宽屏首屏的位置。或者一段 1:1 的产品循环片要当 9:16 的故事版投出去,还不能把产品切掉一半。本能反应是裁剪,而裁剪正是好素材去送命的地方——你要么丢掉构图的边缘,要么接受上下黑边加一个更小的主体。

干净的解法是把视频画面向外扩展,而不是往里切:保住每一个原始像素,在空出来的边缘里生成新的画面信息。专门做视频外扩的工具正是逐帧干这件事的。OmniArt 不是——工作台里今天没有一键扩展视频画面的功能。

OmniArt 有的,是一套复合流程的两半,它们合起来能走到同一个结果:图片模型能带着区域与锚点控制把一张静帧延展到新的画面比例,视频模型阵容又能把这张延展后的静帧重新变回运动画面。这篇指南会把五个阶段从头走到尾,同时也把代价说清楚——你是在重建这个镜头,而不是在扩展原始素材。对一段缓慢、静止、以背景为主的片子,这种重建往往和真东西看不出区别。对一段手持穿过人群的推镜,就不行。

“扩展视频画面”到底指什么

有四种完全不同的操作被叫成同一个名字,而挑错了那一个,就是这件活里被浪费掉的大部分时间。

做法你的像素会怎样代价
裁剪/平移扫描原始像素保留,边缘被丢掉构图和主体大小
上下黑边/模糊边柱全部保留,边缘用黑条或一份模糊副本填上屏幕面积;观感像是转发
视频外扩全部保留,边缘逐帧生成需要一个专门的外扩模型
复合式重建(本文的做法)原片变成参考,另外生成一段更宽的新片与源素材逐帧对应的还原度

复合式重建位于外扩和重拍之间:把一帧有代表性的静帧延展到目标比例,让它动起来,再把新片的运动和调色匹配到原片上,好让两者能待在同一条剪辑线里。

警告

对这件事要看得清楚。OmniArt 没有原生的视频外扩——这套流程是从一张延展后的静帧重新生成镜头,而不是把你现有的画面加宽。它不会逐像素保住你的源素材,也撑不过一个快速运镜或带同步对白的镜头。如果这段素材是必须保持拍摄原样的核心镜头,请改用专门的视频外扩工具,或者按更宽的比例重拍。

这套做法什么时候好用,什么时候会翻车

在花掉一份积分之前先判断镜头。决定一切的变量是:更宽的画面要求多少新信息。

效果好的情况:

  • 固定机位或近乎静止的镜头。 三脚架上的产品台面、静物、缓慢的环境背景——原始画框之外几乎没有东西需要独立运动。
  • 边缘是环境和材质。 影棚背景、天空、墙面、水面、植被、虚化光斑。图片模型延展连续材质相当可信。
  • 缓慢、单一方向的运镜。 一个轻推或轻移,你能用提示词重新描述出来。
  • 短片段。 3–6 秒。片子越短,相对源素材累积的偏移越少。
  • 主体居中。 如果主体从不走进新生成的边缘区域,需要做对的事情就少得多。

会翻车,而且通常翻得很惨:

  • 快速或复杂的运镜。 手持、甩镜、摇臂——新的边缘区域需要几何上正确的视差,而模型没有任何依据去凭空造出来。
  • 复杂的遮挡关系。 主体从前景物体后面经过、人群横穿画面、四肢在边缘进出。
  • 需要口型同步的口播镜头。 你没法重新生成一段表演还让对白对得上。别试。
  • 边缘出现可辨识的人物或有授权的产品。 模型在边缘造出来的东西就是造出来的——这是法律问题,不只是审美问题。
  • 长镜头。 超过大约 8 秒,重建出来的片子会以任何调色都藏不住的方式偏离源素材。

如果你的镜头落在第二张清单里,就到这里停下。老老实实加黑边,或者一次有品位的裁剪,都比一段肉眼可见地在晃的重建更好。

阶段 1:导出一帧有代表性的画面

拖动源片的时间轴,按完整分辨率导出一张 PNG 静帧。“有代表性”这几个字是真在干活的——下游的一切都会继承这一帧的构图、光线和主体位置。

  • 挑一帧主体处在最典型位置的画面,而不是最极端的位置。
  • 避开带运动模糊的帧。模糊会被烤进延展结果,然后被视频模型再糊一遍。
  • 如果镜头有运动,优先选运镜中段的一帧,这样重建出来的运动在两侧都有同等余量。
  • 用无损格式导出。画面边缘的一处压缩伪影,会在延展后的图里变成一道接缝。

现在就把源片的比例、分辨率和时长记下来——这三个数在阶段 4 都要用。

阶段 2:把静帧延展到目标画面比例

打开 OmniArt 的图片工作台,挑一个能接收你的静帧作为参考、并把目标画面比例作为参数的模型。Seedream 5.0 Pro 在这里是务实的选择,因为它支持区域与锚点编辑以及多图融合——你可以把原图钉成参考,同时告诉模型新内容属于某一侧特定的边缘区域。

上传导出的那一帧,把输出画面比例设成你的目标(16:9、9:16、4:5——投放位需要什么就设什么),然后为边缘区域写提示词,而不是为整幅画面写。

把一张 9:16 的产品镜头延展到 16:9:

“Use the reference image as the exact center of the frame. Keep every element of the reference unchanged in content, scale, position, color, and lighting. Extend the scene outward to the left and right only, continuing the same walnut tabletop, the same seamless warm-gray backdrop, and the same soft key light from the upper left. Match the existing depth of field and grain. Add no new objects, no people, no text, no props.”

把一段 4:3 的外景延展到 16:9:

“Use the reference image as the anchor region and preserve it exactly. Continue the scene left and right: the same overcast sky gradient, the same treeline density, the same wet asphalt reflections. Keep the horizon at an identical height across the full width. Photographic, no stylization, no added vehicles or figures.”

有三个习惯能把一次干净的延展和一次一眼假的延展区分开:

  1. 先说要保留什么,再说要加什么。 你不明确钉住原始区域,模型就会在那一块上漂。
  2. 点明方向。 “只向左右”能阻止模型悄悄把整幅构图重新平衡一遍。
  3. 点明连续性锚点。 地平线高度、主光方向、表面材质、景深、颗粒——这些正是眼睛在接缝处会去核对的东西。

生成三到四个变体,在接缝处按 100% 比例对比,不要缩着看。凡是有可见明暗台阶、地平线弯折,或者材质在某个表面中途变了性格的,都淘汰。如果一个变体除了某一侧边缘之外都对,就只对那一块再跑一次区域编辑,而不是把整张图重摇一遍。

阶段 3:把延展后的静帧重新驱动成运动画面

把通过的宽幅静帧带进视频工作台,用它生成一段图生视频。延展后的静帧成了第一帧,所以模型是在一张已经具备正确画面比例的画面上做动画——加宽这个问题在运动进场之前就已经解决了。

你的提示词只有一个任务:复现源片的运动。把原片多看几遍,按镜头、主体的顺序描述它们实际在做什么。

“Animate the reference image. Camera pushes in very slowly over 5 seconds, no shake, no tilt. The subject stays centered and static. Steam drifts upward and to the right. Background remains still. Lighting unchanged throughout. Locked framing, no cuts, no zoom snap.”

模型的选择跟着镜头走。Seedance 2.0 让你把延展后的静帧钉成带标签的参考,在运动中保住身份一致性。当片子必须和原生 4K 素材放在一起时,Veo 3.1 是那个选择。Kling 3.0 是一次要重建很多镜头时的性价比选项,PixVerse 则能快速出偏社媒调性的片子,适合便宜地多跑几轮。它们都在同一个工作台里,所以试两个只是换一次下拉选项——更完整的对比见 2026 年最好的图生视频 AI 模型

时长对上源片,生成两到三个 Seed。评判每一个时专门看新生成的边缘区域,因为一个不稳的模型最先在那里暴露自己。

阶段 4:把运动、时长和调色匹配到源片

这是决定这次重建能不能过关的阶段。把新片直接放在原片上面一层轨道,然后对比它们。

要检查什么怎么查怎么修
运动速度在同一个播放头位置切换两段片子给生成的片子变速;小幅的速度调整看不出来
运动方向对比两段片子的首帧和末帧带明确方向重写提示词;不要在剪辑里硬掰
时长对齐帧数,而不是取整到秒修剪,而不是拉伸超过大约 10%
颜色和颗粒两段都上示波器,再按 100% 对比一块平面向源片方向调色并补上匹配的颗粒;生成出来的画面太干净了
主体大小用 50% 不透明度叠加缩放这段片子;如果差了超过几个百分点,回阶段 2 重新延展

提示

先把生成的片子调色匹配到源片,然后在两段之上统一加一层轻微的颗粒。一层共用的颗粒层,比任何逐段调色都更能掩盖噪点结构上的细小差异。

阶段 5:把它剪进去

生成的片子现在是一份可用的宽幅素材,但最强的剪法通常不会只靠它。

  • 直接替换。 如果重建立得住,就把它当成这个镜头用。最简单,也是静态背景下的正确答案。
  • 把原片叠在重建之上。 把源片按原始尺寸放在生成的宽幅片子上层,主体位置对齐。你真实的素材在中间播放,生成的边缘填满两侧——这是这套流程能逼近真正外扩的极限,也是画面中心必须保持真实时该用的版本。
  • 绕着它剪。 用宽幅片子做交代镜头,近景时刻切回裁剪过的原片。镜头之间的运动会盖掉差异。

按目标比例导出,除了显示器之外也在手机上看一遍。在笔记本上读作“稍微有点软”的接缝,在一块又小又亮的屏幕上会读作“明显是假的”。

值得直说的局限

  • 这不是外扩。 生成出来的片子是一次全新的生成。与源素材逐帧对应的还原度按定义就已经没了,没有任何提示词能拿回来。
  • 音频撑不过这次重建。 和画面动作绑定的声音需要重新对齐,而对白基本上做不到。
  • 成本随迭代次数增长,而不是随时长增长。 大部分花费都进了延展变体和 Seed 对比里。
  • 长片会漂。 超过大约 8 秒,就分段重建,再在段之间剪。
  • 有时候换个工具就是唯一正确的答案。 要加宽的镜头很多、素材不可替代,或者客户会逐帧对比,这些都指向一个专门做外扩的工具,或者按更宽的比例重拍。知道什么时候不该用这套流程,也是把它用好的一部分。

常见问题

OmniArt 能一步扩展视频画面吗?

不能。工作台里没有原生的视频外扩。上面这套流程是通过用图片模型延展一张静帧、再用图生视频模型重新生成运动,来达到类似的结果。

结果会和原片一模一样吗?

不会,也不该被当成一模一样来卖。在静止、以材质为主的镜头上,这个差别放进剪辑里通常察觉不到。在任何有真实运镜的镜头上,它是看得见的。

我能让原始素材留在画面中间吗?

可以——那就是阶段 5 里的叠加方案。把源片按原始尺寸叠在生成的宽幅片子上层。你真实的像素在中间播放,生成的内容只填边缘。

在 OmniArt 上开始

挑一段静止的片子和一个目标比例。导出一帧有代表性的画面,在图片工作台里用 Seedream 5.0 Pro 按新的画面比例把它延展开,再用图生视频模型让结果动起来,然后匹配调色并剪进去。二十分钟就能告诉你这条重建路线对那个镜头行不行——在你把一整批素材都押上去之前。

两半都在同一个地方,所以这个循环是一个工作台、一份余额,而不是两份订阅。带一帧画面和一块干净的背景,从 创作工作台 开始。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始