「没有声音」为什么是个问题
在厨房里录一段对话,文件里装着的东西不止那段对话。它装着冰箱、这栋楼、外面的马路、空气流动,以及麦克风自身的本底噪声。这个复合体就是那个厨房的声音,而听者在第一秒之内就已经学会了它。
现在把对白里一次口误剪掉、留一个空隙。接下来的东西不是安静,是什么都没有,而从厨房的本底噪声掉到绝对零,是你能放进一条声轨里最显眼的东西之一。听者听到的不是一次剪辑,是一个故障。
室内底噪就是为了防止这件事存在的。它是同一个复合体、在什么都不发生的时候录下来的,于是剪辑师手里有了这个地方「不带对白的声音」的无限供应。把它垫在一场戏底下,整条声轨就连续了,而连续性正是让剪切消失的那个东西。
怎么录得对
要求很严,而这正是它必须当天录、不能事后凑的原因。
- 同一支麦、同一个位置、同一套设置。 用另一支麦录的垫底和对白自身的本底噪声不匹配,那就等于白录。
- 至少三十秒,最好六十秒。 这段素材会被循环,而短循环会靠重复出现的细节暴露自己。
- 所有人别动。 片场标准做法是完全静止,因为一只挪动的脚就能让一段变得不可用。
- 每套灯位录一条。 如果灯变了、风扇开了、窗户被打开了,那在声学上就是另一个空间,需要它自己的录音。
- 跳过这一步是经典的低成本失误,而它事后没法完全补救。能做的是「提取」:从对白条里收割安静的片段 —— 这管用,但拿到的是短而别扭的碎片。
用生成的方式做一条
连续环境声几乎是文字生成音频最理想的任务,因为它的全部要点就是什么都不发生:没有时机要卡、没有事件要摆、没有表演要匹配 —— 生成音频通常有的每一个弱点在这里都不存在。
提示词应该描述本底噪声的组成部分,而不是一种气氛。 Very low air conditioning rumble, faint hum from a computer fan, distant muffled traffic through closed glass 给了模型一叠具体的连续声源;而要求一种情绪(比如「诡异的空办公室」)往往会拿回带事件和音乐的东西。
然后明确约束形状。 要长度、要一致性,并把不想要的全部排除:sixty seconds, perfectly consistent, no voices, no music, no events。模型会不请自来地加质感,而一条里面有远处关门声的垫底是没法循环的。
对生成视频来说,这件事不再是替代品,而是正确方法。没有场地,所以没有需要匹配的对象,这场戏的本底噪声就是你决定的那个。先把垫底搭起来、再把音效放在它上面,复现的正是真实混音使用的层级次序,而这也是让无声的生成素材不再听起来像合成物的最便宜的一招。