模型改的是哪一部分
一次口型同步是一次局部编辑。模型先检测人脸,圈出嘴和下颌周围的区域,逐帧只重新生成这块区域,再把它融合回原画面。身份、头发、背景、运镜全都来自你的素材,不动。
这个作用范围解释了几乎所有瑕疵。因为是把区域贴回去的,融合边界上的肤色或锐度差异会表现为下巴周围一块淡淡的补丁;因为区域很小,牙齿和舌头能分到的像素极少;又因为头部姿态来自素材本身,模型无法修正「头在做的动作和新音频不匹配」这种问题。
怎么挑素材
多数糟糕的结果在开跑之前就已经决定了。按重要程度大致排序:
- 脸占多少像素。 一张 4K 画面里的远景小脸,不如一段 720p 的近景。脸太小就先裁到脸上,同步完再合回去。
- 嘴是否可见。 手、话筒、烟、头发都不能挡住嘴。哪怕只有几帧被遮,也会出现明显的撕裂。
- 角度。 接近正面到四分之三侧面都稳;纯侧面不行,因为有半边嘴根本不在画面里可供重建。
- 运动模糊与压缩。 两者都会毁掉嘴部细节。一段干净、光线均匀、动作不大的素材,胜过一段动感十足的。
- 原片的嘴在做什么。 主体本来就在说话,模型有可参考的下颌几何;一连十秒紧闭着嘴反而更难。
音频要先处理好
音频要在同步之前处理,不是之后。去掉音乐和背景人声,压掉混响,把音量归一化,并且剪掉开头的静音,让第一个音素落在你以为的位置上。如果声音是生成的,就保持干声,混响留到同步之后、在最终混音里再加。
长段落建议按自然句读切成十到二十秒左右的片段分别跑。单次跑得越长,时间对齐越容易在后半段走偏;分段的另一个好处是某一句坏了只重跑那一句,不用整场重来。
常见翻车与原因
- 快语速时嘴糊成一团。 像素不够,或者音频的辅音被混响抹平了。
- 下颌抖动、牙关打颤。 帧间不稳定,噪点多或暗光素材上尤其常见。
- 下巴周围一圈补丁。 融合边界不匹配,通常来自调色很重或颗粒明显的素材。
- 嘴是对的,但感觉不对。 头和眉毛还在演原来那句台词。这是这项技术的天花板。
口型同步和数字人生成的区别
这两件事经常被混为一谈。口型同步编辑的是一段已有素材,除了嘴什么都保留。数字人类的模型是用一张肖像加音频,把整段表演都造出来,包括头部运动和表情。有想保留的实拍素材时选口型同步;只有一张照片、还需要它看着是活的,就该走整段表演合成。