它在做录音做不到的事
同期声给你的是对白、一些车流,以及当时恰好在附近的其他东西。它给不了你一个「地方」,因为真实的声学现实又薄、在不同条之间不一致、还混着一堆你不想要的素材。
声音设计用一个被构建出来的东西替换掉它。结果并不比同期录音更真实,它是更可读。成片里的一扇门比任何真实的门都更响、更干净、更具体,而观众接受它是一扇门,因为它符合「门」意味着什么,而不是符合一扇门测出来是什么。
这就是底层原则。每一个选择都关于可读性和意义,而不是关于准确 —— 这也是为什么为一个不存在的东西造声音,遵循的手艺和做一记脚步完全相同。
那些层
这份活按层组织,好让混音之后能重新配比而不必重剪。
- 室内底噪 / 环境层。 一层连续的垫底。建立空间,而更重要的是,它阻止了寂静。
- 背景层。 车流、鸟、远处人群、机器。不具体,让世界在画框之外继续运转。
- 拟音层。 同步的人身声音:脚步、衣物、拿放。看着画面演出来。
- 硬音效层。 具体的响事件:门、枪声、撞车。按帧摆放。
- 设计元素层。 现实里没有来源的声音,用不相干的录音加处理搭出来。
- 空间层。 混响和滤波,把其余所有层放进同一个房间里。
刚接触这件事的人的本能是从最上面开始,从那些响而具体的东西开始。专业次序是反的:把垫底做对,其余一切都变容易,因为你现在是在往一个「地方」里加声音,而不是往一片虚空里加。
给生成素材搭一套
生成视频通常是无声的,或者带着一条没法重新配比的融合音轨,于是整份活都摊在你面前。走通它的路径就沿着那些层,而它和「生成能做什么、不能做什么」正好对得上。
从垫底层开始,而且用生成的方式做。 连续环境声是文字生成音频最理想的场合,因为没有任何东西需要同步:low HVAC hum with a faint electrical buzz from strip lights, thirty seconds, consistent throughout。明确要求长度和一致性,并用否定句把其余一切排除掉 —— 不说的话,模型会把音乐和人声当质感加进来。
然后处理同步事件,这是生成较弱的地方。 要么用视频生成音频模型(它看画面、把声音放在它检测到的事件上),要么生成孤立音效再手动摆放。手动摆放更慢也更准,而对任何观众会注意到的东西来说,准确胜出。
有两个习惯决定了一套混音能用还是不能用。每一层都生成成独立文件,绝不合成一次请求,因为一个立体声文件没法相对对白重新配比。以及从一开始就把一切垫在对白轨底下混 —— 单独听起来正确的音效,几乎总会压过说话。