这个形状说的是什么
把两个片段放上时间线,把第一个片段的音频往右拉,越过它画面结束的位置。视频停了,声音继续在下一个镜头底下走,这一对就划出一个 L。这个叫法来自胶片和磁带时代,一直沿用到今天的每一套剪辑软件,而在那里这个操作通常只是拖一下某一轨。
术语底下的实质就是声画分切:画面和声音切在不同的帧上。这本该是常态。当每次转场都把两者切在同一点上,整段剪辑会带上一种节拍器般的机械感,观众在能解释原因之前,先把它读成业余。
剪辑师为什么一直在用它
主要战场是对话覆盖。两个人的一场戏,有用的画面比说话的时刻多,因为听的那个人常常比说的那个人更有意思。留住一个人的声音、把画面移到另一个人身上,你就同时得到了两者。你看过的几乎每一场对话,大部分活都是这一个动作在干。
它一次解决三个问题:
- 反应。 你能看着一句话落在接住它的人身上。
- 烂条。 如果某句台词最好的念法出自一条画面不能用的戏,那就留住声音,把画面切走。
- 节奏。 因为画面和声音断在不同的时刻,这场戏不会落进「一句话一个镜头」的固定模式。
同一个装置在对话之外也成立。车的引擎声或一个房间的环境声在剪切之后多留一秒,就把两个空间系在了一起。音乐跨过一次换景,会让第二个地方显得是延续,而不是新的开头。
后延多长合适
要判断的是:拖着的声音从哪一刻起不再属于新画面。实操上,用来做顺滑的 L-cut 大概是几帧到半秒,没人会注意到。作为表达手段时可以延续好几秒,那时出画的声音已经变成盖在新场上的一层,这是很强的效果,也必须是有意的。
两个习惯有帮助。声音是环境声时用淡出而不是硬切,因为一段房间底噪突然消失,等于替你刚藏好的那次剪切打了广告。另外检查后延的声音有没有和入画镜头需要的东西撞上,这是画面看着很顺、声音却显得挤的最常见原因。
在生成素材上怎么用
声画分切是最容易用在 AI 素材上的技法之一,恰恰因为画面和声音本来就没有绑在一起。生成的片段通常是无声的,所以每一个声音决定本来就是你的,剪辑点也是自由的。
真正要注意的是:
- 对白按独立音频搭。 无论来自真人录音、克隆声音还是语音合成,每句都保留成独立片段。这样让一个声音跨过剪切只是拖一下,不需要重新生成。
- 有意生成聆听镜头。 这个技法之所以划算,是因为你在留住一句话的时候有地方可去,所以反应镜头要和说话镜头一样认真地生成。一个安静的近景配一点细微动作,便宜且可以反复用。
- 整场戏底下铺一条连续环境声。 各自独立生成的镜头没有共享的声学空间,一条贯穿所有镜头的房间底噪,才是让它们像同一个地点的原因,顺带还能盖住每个刀口。
- 不要让声音烧进片段里。 如果模型连音频一起生成,把它静音重搭。烧进去的声音一定和它的画面同时结束,而这正是这个技法需要避开的一件事。
在一场戏里交替使用 L-cut 和 J-cut,是让一串生成镜头不显得像清单的关键。画面可以是一个个做出来的,声轨却可以是连续的,而观众判断一场戏是不是同一个地方,实际用的就是声音的连续性。