剪辑与声音

什么是拟音(Foley)?

又称 foley, 拟音师, foley sound, 音效拟音

拟音是在录音棚里对着画面用手工现场表演日常声音、再干净录下来交给混音的工序。成片里的脚步声、衣服摩擦声、钥匙、杯子、门把手,基本都是拟音做的,而不是现场同期录到的。

拟音到底包含什么

成片里几乎所有细碎的声音都是拍完之后补的。现场录音师的任务是对白,话筒指着脸,其它声音都是副产品:脚步偏轴、衣服被埋掉、道具的响声被机器盖住。拟音就是把这一层重新演一遍,做成干净、独立的素材,交给混音去塑形。

一次拟音通常拆成三遍走,知道这个分法有用,因为它决定了你该点什么单:

  • 脚步。 每一步都要踩在正确的材质上,轻重和步态跟着画面里的演员。这一遍决定了一个角色「有多重」。
  • 动作。 衣服摩擦、外套挪动、手掌划过桌面。观众不会有意识地听见这一层,但缺了它,演员就像贴在背景上,而不是站在场景里。
  • 道具与特定音。 钥匙、杯子、门锁、纸张、手机放下。凡是有明确起点、必须卡在某一帧的声音都归这里。

一次拟音棚的流程

拟音棚是一屋子材质:碎石坑、沙坑、木板、瓷砖、浴缸,还有一扇装在架子上的门。拟音师看着剪好的画面实时表演,录音师同步录,一条线索一般录几遍。之后由音效剪辑把素材对到画面上,逐帧微调。

之所以坚持「表演」而不是「拼贴」,关键在于意图。演员疲了,第二步就会拖一点;有人怕吵醒别人,杯子落下就会轻一点。这些东西没法靠把文件拖到时间线上得到。

和素材库怎么分工

素材库赢在那些没法在棚里演的东西:车流、风雨、飞机、枪械。拟音赢在一切由身体产生的声音,因为身体有节奏,而一个素材文件并不知道你的演员在干什么。另一个不常被提的好处是干净:自己演出来的声音版权是自己的,录得干、透视关系也是你要的那一种。

AI 生成音效能替到哪一步

文本生成音频这几年在「短的单个事件」和「连续质感」上已经相当能用。要一段湿碎石上的踩踏、瓷杯落在木桌上、布料挪动的声音,出来的东西可以直接进轨。这确实覆盖了拟音工作里的一部分,而且比翻素材库快得多。

它替不了的是对位。模型不知道你的演员脚跟落在第几帧,所以每个事件还是得你自己摆。想让生成素材真的能用,有两个习惯:

  • 单一事件、干声、近距离。带混响、带音乐的文件在分层混音里基本是废的。
  • 同一个动作多生成几条变体。真实脚步不会两步完全一样,一条文件循环使用是让场景瞬间变假的最快方式。

如果直接从视频出音效而不是从文字描述出,时间点会更接近,因为模型看见了动作本身。但它仍然需要有人把事件推到准确的位置,也仍然需要把脚步那一遍当成表演来对待,而不是当成填空。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Single person walking on wet gravel at a steady pace, close perspective, dry recording with no reverb tail, no music

试一下:拟音

打开生成器,参数已经预填好。

常见问题

拟音和音效素材有什么区别?
拟音是人对着画面现场演出来的,所以天然对得上、而且带着动作的表演信息。音效素材通常来自素材库或外采录音,由音效剪辑摆上时间线。实际混音里两者都用:身体产生的声音交给拟音,车流、天气、机械交给素材库。
现场已经录到脚步了,为什么还要重做?
现场话筒是对着人脸的,脚步进来时偏轴、音量不匀,还混着机器和工作人员的声音,事后也没法单独调整。重新表演一遍能得到一条干净、可控的独立轨,混音时想推高压低都不影响对白。
拟音师具体做什么?
拟音师看着剪好的片子,在话筒前用身体和道具把声音演出来:在碎石、木板、瓷砖的坑里走路,挑的道具以「听起来对」为标准而不是「看起来对」。这份工作更接近表演,因为节奏和轻重要跟着银幕上的演员。
为什么叫 foley?
来自环球影业的录音师 Jack Foley,他在有声片早期摸索出对着放映画面即时表演音效的做法。这个名字先变成职位名,后来又变成动词,剪辑师会说某段素材「还没 foley 过」。
AI 能做拟音吗?
能做素材,做不了对位。音频模型按文字描述生成一段表面质感或单个撞击声已经相当可用,确实能省掉翻素材库的时间。但每一步落在哪一帧,仍然要人一个个摆上去。

相关术语