什么被保留,什么被改掉
从素材出发的理由,正是那些你不希望模型发明的东西:表演、运镜、一个手势的时间点、切点在哪。这些用文字描述极贵甚至根本描述不出来,而交给模型一段视频,等于零成本就把它们拿到了。
你要改的是渲染:媒介、色调、光、画面里的某个物体、背景。一个好用的心智模型是:源素材提供「什么时候、在哪里」,提示词提供「长什么样」。
值得分清的三类
- 整体风格化。 整帧按新媒介或新色调重渲。控制最松,视觉变化最大,也最容易把你在意的细节一起丢掉。
- 结构引导。 模型不吃原始像素,而是吃从素材里抽出的深度、姿态、边缘等信号。这是「大幅换观感、同时保住版式和肢体位置」的做法。
- 指令式局部编辑。 一个明确改动(把外套变成皮的、去掉那辆停着的车)在整段里一致地生效,通常配遮罩。范围最窄,也最可靠。
大部分对视频转视频的失望,来自明明是第三类需求,却动用了第一类。
时序一致性就是全部难点
任何逐帧的图像编辑,在静帧上都对,在动起来之后都错,因为模型对每一处模糊区域都独立做决定,而逐帧的决定并不相同。布料纹理在爬,头发在重排,背景细节在沸腾。观众说不出问题在哪,只会觉得廉价。
真正有效的做法,本质都是在减少独立决定的数量:
| 做法 | 怎么稳住 |
|---|---|
| 时序注意力 | 生成时每帧参考相邻帧 |
| 光流引导 | 风格化后的细节沿估计出的运动往前带 |
| 关键帧传播 | 只做几帧,再扩散到整段 |
| 遮罩编辑 | 根本只重渲很小的一块 |
由此得出的实操推论:要求改得越少,画面越稳。风格化推到 40% 的片子撑得住,同一段推成彻底重新解释就会沸腾。
素材怎么准备
- 按切点切开。 一次一个镜头,没有例外。
- 优先用稳定、曝光正常的源。 手持抖动、重压缩、卷帘快门都会给模型错误的运动线索。
- 只截你要的那几秒。 计费通常按帧或按秒,跑三秒胜过跑十秒然后重做。
- 考虑降帧处理。 按 12 到 16fps 处理再补帧,往往比逐帧处理 30fps 素材更便宜也更稳。
- 不能变的地方先遮住。 人脸、logo、字体,恰好是重渲最先破坏的元素。
- 拿最难的两秒去测。 镜头里运动最快的那一段决定参数能不能用,容易的部分永远看着都行。
它目前还撑不住的场景
主体运动快、运动模糊重、人脸很小、画面里有文字、物体出画又入画,这五种依然是稳定的失败案例。如果你的镜头五条全中,再怎么改提示词也救不回来。替代方案是直接生成这个镜头而不是转换它,或者先用遮罩把主体抠出来、分层重建画面,用几个可控的步骤换掉一个不可控的步骤。