AI 生成任务

视频转视频(vid2vid)详解

又称 vid2vid, v2v, video to video ai, 视频风格化, 视频重绘

视频转视频(video to video ai,常缩写为 vid2vid)以一段现成素材为主输入,把它重新渲染一遍:换风格、换光、换掉画面里的某个物体,而原本的运动和节奏被保留下来。难点从来不是新观感,而是让这套观感在每一帧上都一模一样。

什么被保留,什么被改掉

从素材出发的理由,正是那些你不希望模型发明的东西:表演、运镜、一个手势的时间点、切点在哪。这些用文字描述极贵甚至根本描述不出来,而交给模型一段视频,等于零成本就把它们拿到了。

你要改的是渲染:媒介、色调、光、画面里的某个物体、背景。一个好用的心智模型是:源素材提供「什么时候、在哪里」,提示词提供「长什么样」。

值得分清的三类

  • 整体风格化。 整帧按新媒介或新色调重渲。控制最松,视觉变化最大,也最容易把你在意的细节一起丢掉。
  • 结构引导。 模型不吃原始像素,而是吃从素材里抽出的深度、姿态、边缘等信号。这是「大幅换观感、同时保住版式和肢体位置」的做法。
  • 指令式局部编辑。 一个明确改动(把外套变成皮的、去掉那辆停着的车)在整段里一致地生效,通常配遮罩。范围最窄,也最可靠。

大部分对视频转视频的失望,来自明明是第三类需求,却动用了第一类。

时序一致性就是全部难点

任何逐帧的图像编辑,在静帧上都对,在动起来之后都错,因为模型对每一处模糊区域都独立做决定,而逐帧的决定并不相同。布料纹理在爬,头发在重排,背景细节在沸腾。观众说不出问题在哪,只会觉得廉价。

真正有效的做法,本质都是在减少独立决定的数量:

做法怎么稳住
时序注意力生成时每帧参考相邻帧
光流引导风格化后的细节沿估计出的运动往前带
关键帧传播只做几帧,再扩散到整段
遮罩编辑根本只重渲很小的一块

由此得出的实操推论:要求改得越少,画面越稳。风格化推到 40% 的片子撑得住,同一段推成彻底重新解释就会沸腾。

素材怎么准备

  1. 按切点切开。 一次一个镜头,没有例外。
  2. 优先用稳定、曝光正常的源。 手持抖动、重压缩、卷帘快门都会给模型错误的运动线索。
  3. 只截你要的那几秒。 计费通常按帧或按秒,跑三秒胜过跑十秒然后重做。
  4. 考虑降帧处理。 按 12 到 16fps 处理再补帧,往往比逐帧处理 30fps 素材更便宜也更稳。
  5. 不能变的地方先遮住。 人脸、logo、字体,恰好是重渲最先破坏的元素。
  6. 拿最难的两秒去测。 镜头里运动最快的那一段决定参数能不能用,容易的部分永远看着都行。

它目前还撑不住的场景

主体运动快、运动模糊重、人脸很小、画面里有文字、物体出画又入画,这五种依然是稳定的失败案例。如果你的镜头五条全中,再怎么改提示词也救不回来。替代方案是直接生成这个镜头而不是转换它,或者先用遮罩把主体抠出来、分层重建画面,用几个可控的步骤换掉一个不可控的步骤。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 18 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Restyle this clip as hand-painted gouache animation, keep the original camera move and timing exactly, flat shadows, visible brush texture

试一下:视频转视频(vid2vid)

打开生成器,参数已经预填好。

常见问题

这和拿图像模型逐帧改有什么区别?
图像模型把每一帧当成毫无关系的独立图片,每次编出来的细节都不一样,结果就是画面在「沸腾」。vid2vid 会让每一帧参考相邻帧,或者只风格化少数关键帧再向全片传播,观感才稳得住。
输出为什么在闪?
因为模型在每一帧上对模糊区域的解释都不同。解法是少改一点、把改动幅度降下来而不是把片子降分辨率,或者换成从关键帧传播的模型。事后加颗粒能盖住残余轻微闪烁,但盖不住整片沸腾的肌理。
它会保留原本的运动和节奏吗?
结构保持型的处理会保留,这本来就是「用素材当输入」的主要理由:表演、运镜、切点都留着,只换渲染。松散型处理会漂,所以节奏重要时,交片前拿最后一帧和源对一下。
一次能处理多长?
通常几秒,而且永远是一个镜头。开工前先按切点把时间线切开,因为模型拿到两个无关镜头会试图在交界处融合。每个镜头单独处理,再按原时间线拼回去。
能只改画面里的一个物体吗?
能,用遮罩。把这个物体或区域在整段里抠出来,作为编辑区域传进去,遮罩外的部分完全不动。不给遮罩,就等于在重渲整帧,然后祈祷其余部分没变。
vid2vid 和 v2v 是一回事吗?
是,两个都是同一任务的简写。vid2vid 来自论文和开源工具,产品界面上更常写「视频转视频」或干脆叫视频编辑。

相关术语