
讓照片動起來
靜態人像按參考動作動起來,不用拍攝。
給一段參考影片和你的角色,讓這個動作被完整遷移過來 —— 舞蹈、手勢、表情,動得準,人還是你的人。
用一段參考影片指定動作,比用文字描述準得多 —— 說「跳一段舞」模型會自由發揮,給它參考影片就是那段舞。
動作來自參考影片,外觀來自你的角色圖,兩樣分開控制。
一張靜態人像加一段參考動作,就能得到這個人做這個動作的影片。
一段參考動作可以分別套到不同角色上,得到動作一致、人物不同的一組影片。

靜態人像按參考動作動起來,不用拍攝。

參考一段舞蹈,讓你的角色跳同一段,動作對得上拍子。

同一段動作套到幾個不同角色上,得到成組的素材。

固定角色配上錄好的動作,批次產出人物一致的內容。
打開 AI 運動控制,上傳你的角色圖或影片。
上傳一段參考動作影片,指定要遷移的動作。
生成後下載,或者送進畫布接著剪。
在影片生成裡寫「跳一段舞」,你會得到模型理解的跳舞 —— 可能挺好看,但不是你要的那段。動作這種東西,文字描述的解析度太低了:節奏、幅度、姿態的細節,寫不進一句提示詞裡。
運動控制換了個輸入方式:給它一段參考影片。動作從影片裡提取,外觀從你的角色圖來,兩樣分開控制。所以你的角色會做出參考影片裡那個具體的動作。
參考影片的畫面品質不重要,它只用來提供動作,外觀完全來自你的角色圖。重要的是動作能被看清:
另一個要注意的是取景要匹配。參考是全身舞蹈、角色圖只有半身的話,模型得補出沒有的下半身,那部分不一定和你的角色一致。兩邊的取景範圍接近時效果最好。
這一頁的價值在於動作的確定性。所以它適合兩種情況:你有一段一定要復現的動作(某段舞、某個手勢),或者你要一批人物不同但動作一致的素材。
反過來,如果動作是什麼無所謂、只要「動起來」就行,那用影片生成更省事 —— 不用準備參考影片,一句話就夠。
圖生影片裡動作是模型自由決定的,你只能用文字大致引導 —— 說「跳舞」得到的是模型理解的跳舞。運動控制是拿一段真實影片當動作範本,所以動的是那段具體的動作。需要確定的動作時用這一頁,想看模型的想法時用圖生影片。
動作清楚、主體完整最重要。全身動作要能看到全身,手勢要能看清手;主體被遮擋、畫面太暗、或者同時有很多人,都會讓動作提取變差。參考影片的畫面品質不重要 —— 它只用來提供動作,外觀來自你的角色圖。
設計上不會 —— 動作來自參考,外觀來自你的角色。但兩者差異太大時(比如參考是全身舞蹈、角色圖只有半身)模型需要補全沒有的部分,那部分可能和你的角色不完全一致。
兩者管的是不同部位:嘴型同步對齊嘴型到音訊,運動控制遷移的是肢體動作和姿態。要做一個既有動作又在說話的角色,通常是先做動作再做嘴型。
Prompt
Image*
Video*