剪辑与声音

什么是声音桥(sound bridge)?

又称 sound bridge, 声音过渡, 音频叠接, 声桥

声音桥是让音频跨过剪切点延续下去:一场戏的声音延续进下一场,或者下一场的声音提前开始,从而把画面已经分开的两个地点或时间连起来。它是让转场显得「有动机」而不是「机械」的标准做法。

声音跨过剪切点,改变了这一刀

画面剪切是瞬时的:这一帧是卧室,下一帧是街道,中间没有任何过渡状态。声音不是这样运作的,而声音桥利用的正是这个错配。

当一层音频不间断地跨过画面剪切点,观众就在一个不连续的时刻里被给了一个连续的东西可以握住。这条接缝不再是一次断裂,而变成了某个仍在进行的事情里的一次视角变化。这就是为什么声音桥是「表现时间流逝」、「在地点之间移动」、以及「在不明说的前提下把两件事主题性地连起来」的默认手法。

延续的方向改变含义。从上一场保留下来的声音读起来是回忆,或者是一个还没结束的念头;从下一场提前到来的声音读起来是预感,或者是未来在侵入。两者是同一个技法指向相反方向,而有意识地在它们之间做选择,就是这门手艺的大半。

值得区分的几种

  • 延后型。 外切的声音延续到入切的画面上。反思的、余音未散的。
  • 提前型。 入切的声音在它的画面之前先响。预感的、有推力的,在当代剪辑里比前者更常见。
  • 中性第三层。 配乐、雨声,或者一段抽象质感,不属于任何一场,横铺在接缝上。当两场戏各自都有会打架的具体声音时很好用。
  • 声音上的匹配剪。 两个不同来源听起来相似,于是这一刀像一个持续着的单一声音:水壶变成警笛、掌声变成雨声。这是最过瘾的版本,也是最难找到素材的版本。

以上全部需要的都是「内部结构不强」的音频。一段连续的低鸣、人群声、一个延续的音,都桥得很好;一句对白、或者一段有明确乐句结尾的音乐则不行,因为那个声音会宣告自己的边界,观众还是听得到接缝。

画面是生成的时候怎么搭

这里有一个具体的坑:会产出原生音轨的视频模型,给你的是每个片段一个融合文件,而那段音频没法延伸到自己那个镜头之外。声音桥按定义就必须跨过镜头边界,所以原生音频让这个手法直接不可用。

可行做法是从一开始就把音频当成独立的一层。

画面按无声生成,或者把原生音轨丢掉。然后用文字生成音频模型,把桥用的声音生成成一个长文件,比任何一个镜头都长:一条连续垫底,没有事件,除非你要,否则明确排除音乐和人声。

把这条垫底横铺在两个片段上,让它真正不间断,然后把每场戏各自具体的音效放在它上面的独立轨道里。具体那几层可以跟着画面剪,垫底不剪 —— 这恰好就是这个效果需要的结构。

画面这一侧也有一个提示词细节要紧:接缝两侧的镜头里都该有一点空白,一两秒什么都不发生的时间,因为桥需要有个落脚处。一个从第一帧满到最后一帧的片段,让音频无处呼吸,转场最后会显得挤,而不是显得连贯。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Empty school corridor at night, absolute quiet with only a faint distant hum, static wide shot, held for six seconds with no action, no music, no voices

试一下:声音桥

打开生成器,参数已经预填好。

常见问题

它和 J-cut、L-cut 有什么区别?
那两个说的是做法,这个说的是目的。J-cut 让音频提前进来,L-cut 让音频延后出去,两者都可以用来搭一座声音桥。这个词描述的是「用声音把两场戏接起来」这个效果,而不是音视频剪切点的具体排布方式。
常见的变体有哪些?
前一场的声音延续到后一场画面上,读起来是余音未散的念头;后一场的声音在它的画面之前先响,把观众往前拉;还有第三种,用一层不属于任何一场的声音(比如配乐或者共享的质感)横铺在接缝上。
它为什么让转场更顺?
因为注意力对听和看的处理方式不同。画面剪切是瞬时且离散的,而声音是连续的,所以一层不间断的音频给了观众一个在画面改变时可以握住的东西。把这份连续性拿掉,恰恰就是硬切之所以「硬」的原因。
什么声音最好用?
连续、不具体的那些:雨、车流、人群、机器、一个持续的乐音。任何有明确起止的声音都会把注意力吸到自己身上,从而不再起桥的作用。一句对白也能用,但只有当它本来就意在评论下一场戏时才行。
生成素材怎么搭?
音频要和画面分开生成,并且当成独立的一层来处理。和生成片段融合在一起的原生音轨没法延伸到自己那个镜头之外,所以用它做桥是不可能的。生成一条长的连续垫底、横铺在两个片段上,才是可行路径。

相关术语