说话数字人
一张人像照片加一段配音,做成口播视频,不用出镜也不用拍摄。
给一段音频和一张人脸,让画面里的人物准确说出这段话 —— 口型对得上,做数字人、配音和多语种版本都用它。
不需要拍摄,一张照片或一段视频加上音频,就能得到这个人说这段话的画面。
模型分析音频的音节来对齐嘴型,比在视频提示词里描述「说话」可靠得多 —— 那样通常只能得到嘴在动。
同一段画面配上不同语言的音频,口型跟着新语言走,海外版本不用重新拍一遍。
有的擅长静态照片出说话视频,有的更适合给已有视频换配音,同一素材可以换模型再试。
一张人像照片加一段配音,做成口播视频,不用出镜也不用拍摄。

已有的视频换一条配音,口型跟着新音频对齐,画面不用动。

AI 生成的视频里人物嘴型和台词不对,用它重新对齐。
同一个人物讲多种语言,各个市场的版本看起来都是本人在说。
打开 AI 口型同步,上传一张人脸照片或一段视频。
上传要说的音频 —— 可以来自文字转语音或声音克隆。
生成后下载,或者送进画布接着剪。
在视频生成里写「这个人在说话」,得到的通常是嘴在动 —— 动的方式和你的台词毫无关系。因为模型只知道「要有说话这个动作」,不知道具体说什么。
口型同步是另一条路:它拿着真实的音频,逐个音节去对齐嘴型。所以人物说出的是你给的那段话,而不是随机的嘴部运动。
这一步通常是内容链条上的最后一环 —— 稿子写好、配音生成、然后让人物说出来。
需要的东西很少:一张人脸 + 一段音频。但人脸的质量直接决定结果:
音频这边,三条路都能用:文字转语音生成的(写稿挑音色最快)、声音克隆生成的(要特定音色时)、或者你自己录的。
把它当成组装的最后一步:先把音频做对(这是决定成片质量的关键 —— 配音听着别扭,口型再准也没用),再把人脸准备好,最后合成。
顺序上值得注意的是:先确定音频,再做口型同步。反过来的话,每次改稿都要重新合成一遍视频,成本比重新生成一段配音高得多。
两样:一张正面清晰的人脸(照片或视频都行),和一段音频。人脸最好是正面、五官清楚、嘴部没有被遮挡;侧脸、戴口罩、光线太暗都会明显影响口型对齐的效果。
可以用文字转语音生成 —— 写好稿子挑个音色就有了;想用特定的某个声音就先用声音克隆。当然也可以上传你自己录的音频。这三条路的产物在这里都能用。
因为那样通常只能得到「嘴在动」,动的方式和你的台词没关系。口型同步是拿着真实音频去对齐音节的,所以口型能对上具体的字。要人物说出确定的内容,就该用这一页。
支持,不同模型对各语言的口型精度略有差别。中文和英文通常都能对得比较准;如果一次结果不理想,换个模型用同一组素材再试一次,常常就好了。
Prompt*
图片*
Audio*