剪辑与声音

J-cut 是什么?声音先到,画面后到

又称 J-cut, j cut, 声音先入, 声画分切

J-cut 指下一个镜头的声音在画面切换之前就先进来,于是你还在看着上一个镜头,却已经听见了新的场景。它是让转场显得「被带过去」而不是「被硬切」的标准做法,也是绝大多数对话戏不会声画同点切的原因。

这个字母是怎么来的

把两个片段排在时间线上。如果你把第二个片段的音频往左拖,让它比自己的画面先开始,这一对就形成一个转过来的形状:上面的视频起得晚,下面的音频起得早,看起来像字母 J。这个叫法从磁带剪辑时代一直沿用到今天。

从机制上说它属于声画分切:画面和声音在不同的点上切,而不是切在同一帧。这才是常态,不是例外。每次转场都把声画切在同一帧,是让一段剪辑显得像幻灯片的直接原因。

它为什么起作用

在剪辑里,听总是快于看。新声音在你还看着旧镜头时到来,你就开始为这次变化做准备,等画面来的时候你其实已经在往那边走了。这次转场于是显得是有原因的,而不是被强加的。

另一层作用在注意力上。提前到来的声音告诉观众接下来该看哪里,所以 J-cut 在信息量大的段落里特别好用:隔壁房间传来的一句台词,能在那个空间还没建立起来之前先把观众拉过去。

常见的三种形态:

  • 台词先入。 下一场的第一句压在当前镜头的尾巴上。这就是预叠,也是电视剧里最常见的转场。
  • 环境声先入。 车流、操场、病房的监护仪提前一秒响起,新地点在被看见之前先被听见。
  • 音乐先入。 音乐在剪切之前起,会让后面整段显得比实际开始得更早。

具体怎么放

要决定的只有一件事:声音从哪里开始。可靠的做法是让出画的画面告诉你答案。把声音放在一个自然的停顿上:一句话落地之后、一个动作结束时、一次呼吸上。压在一句台词的中间,会让两个人声挤在同一个瞬间,读起来就是错。

两个值得保持的习惯。除非要的就是那一下惊吓,进来的声音用淡入而不是硬切。还有别叠:一次 J-cut 加一段音乐推起来加一次甩镜,等于什么都没留下,因为三个信号同时到达会互相抵消。

用生成素材怎么做

这个手法完全不依赖画面,所以在 AI 素材上格外好用。生成出来的片段通常要么没声音,要么声音不能用,反正声音层都要自己搭,而声画分切只是一个「每个元素从哪里起」的决定。

几点实操:

  • 有意把声音和画面分开生成。 无论这段声音来自下一句台词的语音合成、一条生成的环境声底,还是一段音乐,都让它作为独立元素存在,起点才由你决定。
  • 留够余量。 入画那个镜头的头部要比实际需要的长一点。J-cut 吃掉的是出画画面的尾巴,而你真正需要空间的是音频的头部。
  • 让入画镜头的开头保持无声。 如果生成片段自带声音,你先铺进去的那段先入声会在剪切点上和它撞在一起。
  • 两个镜头底下走同一条环境声,前提是这两个地点本来该彼此靠近。这一条加上一句提前的台词,就足以让观众相信两个各自独立生成的镜头处在同一栋楼里。

反过来同样的逻辑就是 L-cut,出画的声音继续盖过新画面。大多数段落两种都用,交替着来,让没有两次转场落在同一个位置上。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

A woman opens a heavy office door and steps into a bright corridor, natural motion, static camera, cool daylight, 35mm

试一下:J-cut(声音先入)

打开生成器,参数已经预填好。

常见问题

为什么叫 J-cut?
来自它在时间线上的形状。音频轨比视频轨往左伸出去一截,在下方且更靠前,两个片段合起来像字母 J。L-cut 是它的镜像,声音朝右拖在后面。
J-cut 和 L-cut 有什么区别?
方向不同。J-cut 让下一场的声音提前进来,声音领着画面走;L-cut 让上一场的声音在画面已经换掉之后继续留着,声音拖在画面后面。两者都属于声画分切,大多数场景转换都会用到其中一种。
什么是 pre-lap(预叠)?
同一件事,从另一头命名。预叠指把下一场的一句台词铺在当前这场的尾巴上。剪辑师习惯上在专指台词时说预叠,在泛指任何声音(包括环境声和音乐)时说 J-cut。
声音该提前多久进来?
一般是一两拍,从半秒到两秒左右。要长到观众在画面确认之前先意识到这个新声音,又要短到他们不会开始纳闷自己在听什么。声音本身指向明确时(比如车流、人群)可以提前更多。
对话戏里用得上吗?
这个手法主要就活在对话戏里。让回答略微提前于切到说话人的那一刀,一场对话就显得是被推着走的,而不是拼起来的,也避免每一轮交锋都落在同一个节奏上。每句都声画同点直切,正是对话段落显得机械的原因。

相关术语