AI 生成任务

口型同步是什么:让画面里的嘴跟上音频

又称 对口型, lip sync, lipsync, 音频驱动

口型同步(lip sync)是让照片或视频里的一张脸对上给定音频的任务。模型逐帧重画嘴、下颌,通常还包括整个下半脸,让口型与声音对齐,画面其余部分保持原样。

模型改的是哪一部分

一次口型同步是一次局部编辑。模型先检测人脸,圈出嘴和下颌周围的区域,逐帧只重新生成这块区域,再把它融合回原画面。身份、头发、背景、运镜全都来自你的素材,不动。

这个作用范围解释了几乎所有瑕疵。因为是把区域贴回去的,融合边界上的肤色或锐度差异会表现为下巴周围一块淡淡的补丁;因为区域很小,牙齿和舌头能分到的像素极少;又因为头部姿态来自素材本身,模型无法修正「头在做的动作和新音频不匹配」这种问题。

怎么挑素材

多数糟糕的结果在开跑之前就已经决定了。按重要程度大致排序:

  • 脸占多少像素。 一张 4K 画面里的远景小脸,不如一段 720p 的近景。脸太小就先裁到脸上,同步完再合回去。
  • 嘴是否可见。 手、话筒、烟、头发都不能挡住嘴。哪怕只有几帧被遮,也会出现明显的撕裂。
  • 角度。 接近正面到四分之三侧面都稳;纯侧面不行,因为有半边嘴根本不在画面里可供重建。
  • 运动模糊与压缩。 两者都会毁掉嘴部细节。一段干净、光线均匀、动作不大的素材,胜过一段动感十足的。
  • 原片的嘴在做什么。 主体本来就在说话,模型有可参考的下颌几何;一连十秒紧闭着嘴反而更难。

音频要先处理好

音频要在同步之前处理,不是之后。去掉音乐和背景人声,压掉混响,把音量归一化,并且剪掉开头的静音,让第一个音素落在你以为的位置上。如果声音是生成的,就保持干声,混响留到同步之后、在最终混音里再加。

长段落建议按自然句读切成十到二十秒左右的片段分别跑。单次跑得越长,时间对齐越容易在后半段走偏;分段的另一个好处是某一句坏了只重跑那一句,不用整场重来。

常见翻车与原因

  • 快语速时嘴糊成一团。 像素不够,或者音频的辅音被混响抹平了。
  • 下颌抖动、牙关打颤。 帧间不稳定,噪点多或暗光素材上尤其常见。
  • 下巴周围一圈补丁。 融合边界不匹配,通常来自调色很重或颗粒明显的素材。
  • 嘴是对的,但感觉不对。 头和眉毛还在演原来那句台词。这是这项技术的天花板。

口型同步和数字人生成的区别

这两件事经常被混为一谈。口型同步编辑的是一段已有素材,除了嘴什么都保留。数字人类的模型是用一张肖像加音频,把整段表演都造出来,包括头部运动和表情。有想保留的实拍素材时选口型同步;只有一张照片、还需要它看着是活的,就该走整段表演合成。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Sync the speaker to the supplied narration, keep head pose and lighting unchanged, natural jaw movement, no exaggerated mouth opening

试一下:口型同步(Lip Sync)

打开生成器,参数已经预填好。

常见问题

口型同步和配音有什么区别?
配音只换声音、不动画面,嘴自然就对不上了。口型同步是改画面,让嘴去对上新的声音。做本地化时这两件事其实是一体的两半。
一张静态照片能做吗?
能。只有一张静图时,模型要从零编造全部的口型和下颌运动,通常还会加一点轻微头部动作,免得看着像僵住。接近正面、嘴部清晰无遮挡的脸效果最好。
为什么牙齿看起来不对?
牙齿小、对比强,而且一个音节里只露一小会儿,能给模型的信息量非常少。常见解法是给脸更多像素:裁得更紧,或者换分辨率更高的素材。脸部区域的像素量比整帧尺寸重要得多。
什么样的音频效果最好?
单人说话、背后没有音乐、房间混响小、音量稳定。混响是最麻烦的一项,它会把模型用来定位口型的辅音起始点糊掉,混响重的录音出来的时间点就是软的。
能对上和原片不同的语言吗?
能,而且这是最常见的用法。麻烦在于原片的头部动作和表情仍然对应旧的表演,所以原片演得越用力,就算嘴做得再好也会有一点微妙的错位。

相关术语