模型在画面里找什么
这类模型同时干两件活。它要把画面里的东西分类到「能猜出这玩意儿会发出什么声音」的程度,还要定位「有事发生」的那些时刻:一次撞击、一次落脚、一扇门碰上门框、一只手落在台面上。第二件活才是决定结果能不能用的那件。
这个次序和直觉相反。看起来难点应该在于合成一声可信的关门,但可信的关门声现在很便宜;贵的是判断出门碰上门框发生在第 71 帧而不是第 74 帧。声音和画面是被观众一起审的,而这个观众能接受一扇木门听起来略带金属味,绝不接受一扇门在关上之前就发出关门声。
这也解释了为什么它的输出擅长连续声、弱于离散事件。雨、车流、室内底噪和风都没有需要对齐的起振点,所以它们几乎每次都落得可信;脚步、撞击和拿放物件的噪声,才是错误能被听出来的地方。
提示词怎么写
时机已经由视频承担了,所以提示词应该承担材质,并且把你打算自己提供的东西全部排除掉。
- 点名表面,不只是动作。
footsteps on wet gravel产出的东西能用;只写footsteps会得到一个和你画面不搭的通用闷响。 - 锚定那一个关键事件。
a heavy wooden door closing on the third second给了模型一个对齐目标,而不是让它自己去找出所有事件。 - 要的是「层」,不是「混音」。 把脚步、环境和音效在一次请求里生成,你拿到的是一个没法重新配比的立体声文件。分几次跑更贵,但在剪辑里有用得多。
- 狠狠地排除。
no music, no voices几乎总值得写上。模型会把这两样当织体加进来,而它们都会和你真正的混音打架。 - 片段压短。 准确度随长度下降,因为事件清单在变长;八秒同步正确的声音比三十秒会漂的更值钱。
原生音频和 v2a 怎么选
现在很多视频模型能在生成画面的同一次里出声音,暴露出来是一个开关而不是一个独立步骤。有这个选项时它通常是更好的那个,因为声画是一起被决定的,同步根本不是一个匹配问题。
分工只取决于「什么已经存在」。如果画面是你生成的,就把原生音频打开,把它当成兜底 —— 用在出来是无声的、或者生成的声音不对的片段上。如果素材是实拍的、来自没有音频的模型、或者你就是想保住画面换掉声音,那 v2a 是唯一的路。
依赖原生音频之前有一个坑值得知道:它倾向于不管你要不要都塞进音乐和人声,而且事后没法把它们从音效里分出来,因为那是一整个混音。任何需要垫在真实对白底下的场合,把画面按无声生成、再跑 v2a 做音效,能拿到原生音频给不了的控制权。
它和真人拟音的分界
传统拟音之所以存在,是因为同期录到的声音又薄、又不一致、还混着一堆你不想要的东西。拟音师看着画面同步地把声音演出来,产出的素材干净、在该夸张的地方夸张、并且是分层的。
生成音频把这份活里最不有趣的部分做得不错:环境垫层、背景层、以及没人会去细听的音效。它最弱的地方恰恰是拟音师创造价值的地方 —— 表演。一个角色犹豫时脚步略微变重,这是一个表演选择,而一个看着画面的模型不做选择。用 v2a 去铺满声轨里那百分之九十「只需要在那儿」的部分,把承载意义的那几个瞬间留在手动控制之下。