这个字母是怎么来的
把两个片段排在时间线上。如果你把第二个片段的音频往左拖,让它比自己的画面先开始,这一对就形成一个转过来的形状:上面的视频起得晚,下面的音频起得早,看起来像字母 J。这个叫法从磁带剪辑时代一直沿用到今天。
从机制上说它属于声画分切:画面和声音在不同的点上切,而不是切在同一帧。这才是常态,不是例外。每次转场都把声画切在同一帧,是让一段剪辑显得像幻灯片的直接原因。
它为什么起作用
在剪辑里,听总是快于看。新声音在你还看着旧镜头时到来,你就开始为这次变化做准备,等画面来的时候你其实已经在往那边走了。这次转场于是显得是有原因的,而不是被强加的。
另一层作用在注意力上。提前到来的声音告诉观众接下来该看哪里,所以 J-cut 在信息量大的段落里特别好用:隔壁房间传来的一句台词,能在那个空间还没建立起来之前先把观众拉过去。
常见的三种形态:
- 台词先入。 下一场的第一句压在当前镜头的尾巴上。这就是预叠,也是电视剧里最常见的转场。
- 环境声先入。 车流、操场、病房的监护仪提前一秒响起,新地点在被看见之前先被听见。
- 音乐先入。 音乐在剪切之前起,会让后面整段显得比实际开始得更早。
具体怎么放
要决定的只有一件事:声音从哪里开始。可靠的做法是让出画的画面告诉你答案。把声音放在一个自然的停顿上:一句话落地之后、一个动作结束时、一次呼吸上。压在一句台词的中间,会让两个人声挤在同一个瞬间,读起来就是错。
两个值得保持的习惯。除非要的就是那一下惊吓,进来的声音用淡入而不是硬切。还有别叠:一次 J-cut 加一段音乐推起来加一次甩镜,等于什么都没留下,因为三个信号同时到达会互相抵消。
用生成素材怎么做
这个手法完全不依赖画面,所以在 AI 素材上格外好用。生成出来的片段通常要么没声音,要么声音不能用,反正声音层都要自己搭,而声画分切只是一个「每个元素从哪里起」的决定。
几点实操:
- 有意把声音和画面分开生成。 无论这段声音来自下一句台词的语音合成、一条生成的环境声底,还是一段音乐,都让它作为独立元素存在,起点才由你决定。
- 留够余量。 入画那个镜头的头部要比实际需要的长一点。J-cut 吃掉的是出画画面的尾巴,而你真正需要空间的是音频的头部。
- 让入画镜头的开头保持无声。 如果生成片段自带声音,你先铺进去的那段先入声会在剪切点上和它撞在一起。
- 两个镜头底下走同一条环境声,前提是这两个地点本来该彼此靠近。这一条加上一句提前的台词,就足以让观众相信两个各自独立生成的镜头处在同一栋楼里。
反过来同样的逻辑就是 L-cut,出画的声音继续盖过新画面。大多数段落两种都用,交替着来,让没有两次转场落在同一个位置上。