剪辑与声音

什么是声音设计(sound design)?

又称 sound design, 音效设计, 声音剪辑

声音设计是构建一部片子除对白和配乐之外的全部听觉内容:音效、环境声、质感层,以及那些在现实里没有来源的被造出来的声音。它是分层搭建的而不是录下来的,它的活是让画面听起来像一个真实存在的地方。

它在做录音做不到的事

同期声给你的是对白、一些车流,以及当时恰好在附近的其他东西。它给不了你一个「地方」,因为真实的声学现实又薄、在不同条之间不一致、还混着一堆你不想要的素材。

声音设计用一个被构建出来的东西替换掉它。结果并不比同期录音更真实,它是更可读。成片里的一扇门比任何真实的门都更响、更干净、更具体,而观众接受它是一扇门,因为它符合「门」意味着什么,而不是符合一扇门测出来是什么。

这就是底层原则。每一个选择都关于可读性和意义,而不是关于准确 —— 这也是为什么为一个不存在的东西造声音,遵循的手艺和做一记脚步完全相同。

那些层

这份活按层组织,好让混音之后能重新配比而不必重剪。

  • 室内底噪 / 环境层。 一层连续的垫底。建立空间,而更重要的是,它阻止了寂静。
  • 背景层。 车流、鸟、远处人群、机器。不具体,让世界在画框之外继续运转。
  • 拟音层。 同步的人身声音:脚步、衣物、拿放。看着画面演出来。
  • 硬音效层。 具体的响事件:门、枪声、撞车。按帧摆放。
  • 设计元素层。 现实里没有来源的声音,用不相干的录音加处理搭出来。
  • 空间层。 混响和滤波,把其余所有层放进同一个房间里。

刚接触这件事的人的本能是从最上面开始,从那些响而具体的东西开始。专业次序是反的:把垫底做对,其余一切都变容易,因为你现在是在往一个「地方」里加声音,而不是往一片虚空里加。

给生成素材搭一套

生成视频通常是无声的,或者带着一条没法重新配比的融合音轨,于是整份活都摊在你面前。走通它的路径就沿着那些层,而它和「生成能做什么、不能做什么」正好对得上。

从垫底层开始,而且用生成的方式做。 连续环境声是文字生成音频最理想的场合,因为没有任何东西需要同步:low HVAC hum with a faint electrical buzz from strip lights, thirty seconds, consistent throughout。明确要求长度和一致性,并用否定句把其余一切排除掉 —— 不说的话,模型会把音乐和人声当质感加进来。

然后处理同步事件,这是生成较弱的地方。 要么用视频生成音频模型(它看画面、把声音放在它检测到的事件上),要么生成孤立音效再手动摆放。手动摆放更慢也更准,而对任何观众会注意到的东西来说,准确胜出。

有两个习惯决定了一套混音能用还是不能用。每一层都生成成独立文件,绝不合成一次请求,因为一个立体声文件没法相对对白重新配比。以及从一开始就把一切垫在对白轨底下混 —— 单独听起来正确的音效,几乎总会压过说话。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Continuous room tone for an empty office at night, low HVAC hum with a faint electrical buzz from strip lights, no music, no voices, no footsteps, thirty seconds, consistent throughout

试一下:声音设计

打开生成器,参数已经预填好。

常见问题

声音设计和拟音有什么区别?
拟音是它内部的一个具体工种:在录音棚里看着画面把日常同步声音演出来,主要是脚步、衣物摩擦和手持物件。声音设计还涵盖其余一切,包括环境声、音效、转场,以及从来不存在的声音,比如一艘飞船或者一头怪物。
标准的层级有哪些?
从下往上:室内底噪或环境层、背景音效层、拟音层、硬音效层、被设计出来的元素层,然后是混音用混响和空间感做的处理。每一层都单独剪,好让混音能相对对白重新配比,而不必重做前面的活。
哪一层最要紧?
环境底噪层,而它恰好是新手最容易跳过的。一场没有连续背景的戏听起来是死的,会让每个音效都像贴上去的。在所有东西底下加一层安静而一致的垫底,通常是业余混音能拿到的最大一笔改善。
音效该多响?
一旦有对白,就要比本能感觉的更轻。几乎每一个孤立听起来正确的音效,垫在说话底下都太响了。工作方法是从一开始就把音效相对对白轨去混,而不是先单独配平、之后才发现冲突。
生成音频能干这份活吗?
能干一部分,而分工是可预测的。垫底层和背景质感很适合生成,因为没有任何东西需要卡帧;脚步、撞击这类同步事件需要「视频生成音频」(它读画面来定时机)或者手动摆放。任何承载表演节拍的东西都该留在手动控制之下。

相关术语