AI 生成任务

视频生成音频(V2A):从画面里生出声音

又称 v2a, AI 拟音, video to audio, 视频转音效

视频生成音频(常简称 v2a)是看着画面为一段无声素材生成声音,产出的音效和屏幕上发生的事对齐。它是拟音的自动化形态,而它真正的难点是同步,不是音质。

模型在画面里找什么

这类模型同时干两件活。它要把画面里的东西分类到「能猜出这玩意儿会发出什么声音」的程度,还要定位「有事发生」的那些时刻:一次撞击、一次落脚、一扇门碰上门框、一只手落在台面上。第二件活才是决定结果能不能用的那件。

这个次序和直觉相反。看起来难点应该在于合成一声可信的关门,但可信的关门声现在很便宜;贵的是判断出门碰上门框发生在第 71 帧而不是第 74 帧。声音和画面是被观众一起审的,而这个观众能接受一扇木门听起来略带金属味,绝不接受一扇门在关上之前就发出关门声。

这也解释了为什么它的输出擅长连续声、弱于离散事件。雨、车流、室内底噪和风都没有需要对齐的起振点,所以它们几乎每次都落得可信;脚步、撞击和拿放物件的噪声,才是错误能被听出来的地方。

提示词怎么写

时机已经由视频承担了,所以提示词应该承担材质,并且把你打算自己提供的东西全部排除掉。

  • 点名表面,不只是动作。 footsteps on wet gravel 产出的东西能用;只写 footsteps 会得到一个和你画面不搭的通用闷响。
  • 锚定那一个关键事件。 a heavy wooden door closing on the third second 给了模型一个对齐目标,而不是让它自己去找出所有事件。
  • 要的是「层」,不是「混音」。 把脚步、环境和音效在一次请求里生成,你拿到的是一个没法重新配比的立体声文件。分几次跑更贵,但在剪辑里有用得多。
  • 狠狠地排除。 no music, no voices 几乎总值得写上。模型会把这两样当织体加进来,而它们都会和你真正的混音打架。
  • 片段压短。 准确度随长度下降,因为事件清单在变长;八秒同步正确的声音比三十秒会漂的更值钱。

原生音频和 v2a 怎么选

现在很多视频模型能在生成画面的同一次里出声音,暴露出来是一个开关而不是一个独立步骤。有这个选项时它通常是更好的那个,因为声画是一起被决定的,同步根本不是一个匹配问题。

分工只取决于「什么已经存在」。如果画面是你生成的,就把原生音频打开,把它当成兜底 —— 用在出来是无声的、或者生成的声音不对的片段上。如果素材是实拍的、来自没有音频的模型、或者你就是想保住画面换掉声音,那 v2a 是唯一的路。

依赖原生音频之前有一个坑值得知道:它倾向于不管你要不要都塞进音乐和人声,而且事后没法把它们从音效里分出来,因为那是一整个混音。任何需要垫在真实对白底下的场合,把画面按无声生成、再跑 v2a 做音效,能拿到原生音频给不了的控制权。

它和真人拟音的分界

传统拟音之所以存在,是因为同期录到的声音又薄、又不一致、还混着一堆你不想要的东西。拟音师看着画面同步地把声音演出来,产出的素材干净、在该夸张的地方夸张、并且是分层的。

生成音频把这份活里最不有趣的部分做得不错:环境垫层、背景层、以及没人会去细听的音效。它最弱的地方恰恰是拟音师创造价值的地方 —— 表演。一个角色犹豫时脚步略微变重,这是一个表演选择,而一个看着画面的模型不做选择。用 v2a 去铺满声轨里那百分之九十「只需要在那儿」的部分,把承载意义的那几个瞬间留在手动控制之下。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Footsteps on wet gravel with a slight scuff on each step, a heavy wooden door closing on the third second, distant traffic hum underneath, no music, no voices

试一下:视频生成音频

打开生成器,参数已经预填好。

常见问题

v2a 的输入到底是什么?
一段无声视频,通常还有一个可选的文字提示词来描述你想要的声音。视频提供时机和事件,提示词提供材质和质感。只给视频的话,模型会自己猜东西是什么材料做的,而这正是大部分「听起来不对」的来源。
为什么同步比声音本身更难?
因为一个很像的声音放偏四十毫秒就是坏的,而一个略微不对的声音卡在正确那一帧上却听着没问题。观众对「材质不对」极其宽容,对「时机不对」极其苛刻,所以模型必须精确地找出撞击发生在哪一帧。
它和文字生成音效模型有什么区别?
音效模型只吃文字,给你一个不带任何时间信息的孤立声音;视频生成音频看画面,所以输出天生就落在事件发生的位置上。建素材库时用音效模型,手上有一条成片要铺声音时用 v2a。
什么是原生音频,什么时候该改用它?
有些视频模型能在生成画面的同一次里一并生成声音,这就是原生音频,它通常同步得更好,因为声画出自同一个过程。已经存在的素材用 v2a;反正要生成这个镜头的话,用原生音频。
它能做对白吗?
做不了有用的。这一族模型是在音效和环境声上训练的,要求它说话会得到含混的非语言,落在让人别扭的区间里。人声应该来自文字转语音或者真实录音,再垫到生成的音效底下混。
能只生成环境底噪、保留我自己的音效吗?
能,而且这往往是最好的分工。明确要求那一层,其余全部用否定句排除,比如「只要室内底噪和远处车流,不要脚步声,不要音乐」。环境垫层是生成音频最可信的地方,因为没有任何东西需要卡帧。

相关术语