トーキングアバター
ポートレート 1 枚と音声トラックがあれば、プレゼンター動画になります。カメラの前に立つ時間も、撮影も不要。
音声と顔を渡すだけで、画面の中の人物がその通りに話し出します。口の形まで一致。トーキングアバター、吹き替え、多言語版を支えるツールです。
撮影は不要です。写真 1 枚かクリップ 1 本に音声を足すだけで、その人物がそのセリフを話している映像になります。
音節単位で音声に合わせます。動画モデルに「話している」とプロンプトを書く方法より格段に安定します——あちらはたいてい、ただ口が動くだけの映像になります。
同じ映像の下に別言語のトラックを敷けば、口はその言語に合わせて動きます。海外版のために撮影し直す必要はありません。
静止画を話すクリップに変えるのが得意なモデルもあれば、既存の動画を吹き替え直すのが得意なモデルもあります。同じ素材を別のモデルで試し直せます。
ポートレート 1 枚と音声トラックがあれば、プレゼンター動画になります。カメラの前に立つ時間も、撮影も不要。

既存の映像に新しい音声トラックを敷くと、口だけが合わせ直され、絵はそのまま保たれます。

AI で生成したクリップの口がセリフと合っていないとき、ここで合わせ直せます。
同じ人物が複数の言語を話す。どの市場向けの版も、本人が実際に話しているように見えます。
AI リップシンクを開き、顔をアップロードします。写真でも動画クリップでも構いません。
話させたい音声をアップロードします。テキスト読み上げやボイスクローンで作ったものでも構いません。
結果をダウンロードするか、キャンバスに送って編集を続けます。
動画ジェネレーターに「この人物が話している」と書くと、たいていは口が動くだけの映像になり、その動きはあなたのセリフと何の関係もありません。モデルは「話すという行為が起きるべきだ」とだけ理解していて、何を話しているかは知らないからです。
リップシンクは別の道を通ります。実際の音声を保持し、音節単位で口の形を合わせていく。だから人物は、一般的な口の動きを演じるのではなく、あなたが渡したセリフを話します。
この工程はたいてい、一連の作業の最後の環になります。台本を書き、声を生成し、それを人物に話させる、という流れです。
必要なものはごくわずかです。顔と音声トラックだけ。ただし顔の質が、結果を直接左右します。
音声側は 3 通りとも使えます。テキスト読み上げ(最速。書いて声を選ぶだけ)、ボイスクローン(特定の声が必要なとき)、自分で録音した音声。
これは「組み立て」の工程だと考えてください。まず音声を仕上げる(体感品質を決めるのはここです。読みが不自然なら、口の合わせがどれだけ完璧でも救えません)。次に顔を用意し、最後に合成する。
順序についてひとつ覚えておく価値のある注意点があります。リップシンクを回す前に音声を確定させること。 逆順だと、台本を変えるたびに動画を作り直すことになり、音声トラックを生成し直すよりはるかに高くつきます。
2 つです。正面を向いたはっきりした顔(写真または動画)と、音声トラック。顔は正面向きで、目鼻立ちが見え、口が遮られていないものを。横顔、マスク、極端に暗い環境は、いずれも合わせの精度を目に見えて落とします。
テキスト読み上げで作るのが最短です。台本を書いて声を選ぶだけ。特定の声が必要なら、先にボイスクローンで作ってください。自分で録音した音声をアップロードすることもできます。3 通りとも、このページで使えます。
それだと、口は動くものの、その動きはあなたのセリフとまったく関係がありません。リップシンクは実際の音声に音節単位で合わせるので、口が本当の言葉と一致します。人物に特定の内容を話させたいなら、このページです。
はい。ただし精度はモデルと言語によって多少ばらつきます。英語と中国語は概ねよく合います。結果が今ひとつなら、同じ素材を別のモデルで実行し直してください。たいていはそれで解決します。
Prompt*
イメージ*
Audio*