AI 嘴型同步

給一段音訊和一張人臉,讓畫面裡的人物準確說出這段話 —— 嘴型對得上,做數位人、配音和多語種版本都用它。

核心能力

音訊加人臉,直接出說話影片

不需要拍攝,一張照片或一段影片加上音訊,就能得到這個人說這段話的畫面。

嘴型跟著語音走

模型分析音訊的音節來對齊嘴型,比在影片提示詞裡描述「說話」可靠得多 —— 那樣通常只能得到嘴在動。

換語言不用重拍

同一段畫面配上不同語言的音訊,嘴型跟著新語言走,海外版本不用重新拍一遍。

幾個模型可選

有的擅長靜態照片出說話影片,有的更適合給已有影片換配音,同一素材可以換模型再試。

使用場景

說話數位人

說話數位人

一張人像照片加一段配音,做成口播影片,不用出鏡也不用拍攝。

影片配音與在地化

影片配音與在地化

已有的影片換一條配音,嘴型跟著新音訊對齊,畫面不用動。

修正嘴型漂移

修正嘴型漂移

AI 生成的影片裡人物嘴型和台詞不對,用它重新對齊。

多語種代言人

多語種代言人

同一個人物講多種語言,各個市場的版本看起來都是本人在說。

如何使用

01

打開 AI 嘴型同步,上傳一張人臉照片或一段影片。

02

上傳要說的音訊 —— 可以來自文字轉語音或聲音複製。

03

生成後下載,或者送進畫布接著剪。

深入瞭解

讓畫面裡的人說出確定的話

在影片生成裡寫「這個人在說話」,得到的通常是嘴在動 —— 動的方式和你的台詞毫無關係。因為模型只知道「要有說話這個動作」,不知道具體說什麼。

嘴型同步是另一條路:它拿著真實的音訊,逐個音節去對齊嘴型。所以人物說出的是你給的那段話,而不是隨機的嘴部運動。

這一步通常是內容鏈條上的最後一環 —— 稿子寫好、配音生成、然後讓人物說出來。

素材決定效果

需要的東西很少:一張人臉 + 一段音訊。但人臉的品質直接決定結果:

  • 正面、五官清晰 —— 側臉和大角度的偏轉會讓對齊變差
  • 嘴部沒有遮擋 —— 口罩、手、麥克風擋住嘴會直接影響判斷
  • 光線足夠 —— 太暗看不清嘴部輪廓

音訊這邊,三條路都能用:文字轉語音生成的(寫稿挑音色最快)、聲音複製生成的(要特定音色時)、或者你自己錄的。

什麼時候該換個工具

  • 要生成一個全新的畫面 —— 用影片生成,這一頁需要你先有人臉素材。
  • 只要音訊不要畫面 —— 用文字轉語音或聲音複製。
  • 要遷移的是肢體動作而不是嘴型 —— 用運動控制。
  • 要接長已有片段 —— 用影片延長。

該怎麼想這件事

把它當成組裝的最後一步:先把音訊做對(這是決定成片品質的關鍵 —— 配音聽著彆扭,嘴型再準也沒用),再把人臉準備好,最後合成。

順序上值得注意的是:先確定音訊,再做嘴型同步。反過來的話,每次改稿都要重新合成一遍影片,成本比重新生成一段配音高得多。

常見問題

需要準備什麼素材?+

兩樣:一張正面清晰的人臉(照片或影片都行),和一段音訊。人臉最好是正面、五官清楚、嘴部沒有被遮擋;側臉、戴口罩、光線太暗都會明顯影響嘴型對齊的效果。

音訊從哪裡來?+

可以用文字轉語音生成 —— 寫好稿子挑個音色就有了;想用特定的某個聲音就先用聲音複製。當然也可以上傳你自己錄的音訊。這三條路的產物在這裡都能用。

為什麼不直接在影片生成裡描述「他在說話」?+

因為那樣通常只能得到「嘴在動」,動的方式和你的台詞沒關係。嘴型同步是拿著真實音訊去對齊音節的,所以嘴型能對上具體的字。要人物說出確定的內容,就該用這一頁。

支援中文嗎?+

支援,不同模型對各語言的嘴型精度略有差別。中文和英文通常都能對得比較準;如果一次結果不理想,換個模型用同一組素材再試一次,常常就好了。

更多模型