說話數位人
一張人像照片加一段配音,做成口播影片,不用出鏡也不用拍攝。
給一段音訊和一張人臉,讓畫面裡的人物準確說出這段話 —— 嘴型對得上,做數位人、配音和多語種版本都用它。
不需要拍攝,一張照片或一段影片加上音訊,就能得到這個人說這段話的畫面。
模型分析音訊的音節來對齊嘴型,比在影片提示詞裡描述「說話」可靠得多 —— 那樣通常只能得到嘴在動。
同一段畫面配上不同語言的音訊,嘴型跟著新語言走,海外版本不用重新拍一遍。
有的擅長靜態照片出說話影片,有的更適合給已有影片換配音,同一素材可以換模型再試。
一張人像照片加一段配音,做成口播影片,不用出鏡也不用拍攝。

已有的影片換一條配音,嘴型跟著新音訊對齊,畫面不用動。

AI 生成的影片裡人物嘴型和台詞不對,用它重新對齊。
同一個人物講多種語言,各個市場的版本看起來都是本人在說。
打開 AI 嘴型同步,上傳一張人臉照片或一段影片。
上傳要說的音訊 —— 可以來自文字轉語音或聲音複製。
生成後下載,或者送進畫布接著剪。
在影片生成裡寫「這個人在說話」,得到的通常是嘴在動 —— 動的方式和你的台詞毫無關係。因為模型只知道「要有說話這個動作」,不知道具體說什麼。
嘴型同步是另一條路:它拿著真實的音訊,逐個音節去對齊嘴型。所以人物說出的是你給的那段話,而不是隨機的嘴部運動。
這一步通常是內容鏈條上的最後一環 —— 稿子寫好、配音生成、然後讓人物說出來。
需要的東西很少:一張人臉 + 一段音訊。但人臉的品質直接決定結果:
音訊這邊,三條路都能用:文字轉語音生成的(寫稿挑音色最快)、聲音複製生成的(要特定音色時)、或者你自己錄的。
把它當成組裝的最後一步:先把音訊做對(這是決定成片品質的關鍵 —— 配音聽著彆扭,嘴型再準也沒用),再把人臉準備好,最後合成。
順序上值得注意的是:先確定音訊,再做嘴型同步。反過來的話,每次改稿都要重新合成一遍影片,成本比重新生成一段配音高得多。
兩樣:一張正面清晰的人臉(照片或影片都行),和一段音訊。人臉最好是正面、五官清楚、嘴部沒有被遮擋;側臉、戴口罩、光線太暗都會明顯影響嘴型對齊的效果。
可以用文字轉語音生成 —— 寫好稿子挑個音色就有了;想用特定的某個聲音就先用聲音複製。當然也可以上傳你自己錄的音訊。這三條路的產物在這裡都能用。
因為那樣通常只能得到「嘴在動」,動的方式和你的台詞沒關係。嘴型同步是拿著真實音訊去對齊音節的,所以嘴型能對上具體的字。要人物說出確定的內容,就該用這一頁。
支援,不同模型對各語言的嘴型精度略有差別。中文和英文通常都能對得比較準;如果一次結果不理想,換個模型用同一組素材再試一次,常常就好了。
Prompt*
圖片*
Audio*