
让照片动起来
静态人像按参考动作动起来,不用拍摄。
给一段参考视频和你的角色,让这个动作被完整迁移过来 —— 舞蹈、手势、表情,动得准,人还是你的人。
用一段参考视频指定动作,比用文字描述准得多 —— 「跳一段舞」模型会自由发挥,给它参考视频就是那段舞。
动作来自参考视频,外观来自你的角色图,两样分开控制。
一张静态人像加一段参考动作,就能得到这个人做这个动作的视频。
一段参考动作可以分别套到不同角色上,得到动作一致、人物不同的一组视频。

静态人像按参考动作动起来,不用拍摄。

参考一段舞蹈,让你的角色跳同一段,动作对得上拍子。

同一段动作套到几个不同角色上,得到成组的素材。

固定角色配上录好的动作,批量产出人物一致的内容。
打开 AI 运动控制,上传你的角色图或视频。
上传一段参考动作视频,指定要迁移的动作。
生成后下载,或者送进画布接着剪。
在视频生成里写「跳一段舞」,你会得到模型理解的跳舞 —— 可能挺好看,但不是你要的那段。动作这种东西,文字描述的分辨率太低了:节奏、幅度、姿态的细节,写不进一句提示词里。
运动控制换了个输入方式:给它一段参考视频。动作从视频里提取,外观从你的角色图来,两样分开控制。所以你的角色会做出参考视频里那个具体的动作。
参考视频的画面质量不重要,它只用来提供动作,外观完全来自你的角色图。重要的是动作能被看清:
另一个要注意的是取景要匹配。参考是全身舞蹈、角色图只有半身的话,模型得补出没有的下半身,那部分不一定和你的角色一致。两边的取景范围接近时效果最好。
这一页的价值在于动作的确定性。所以它适合两种情况:你有一段一定要复现的动作(某段舞、某个手势),或者你要一批人物不同但动作一致的素材。
反过来,如果动作是什么无所谓、只要「动起来」就行,那用视频生成更省事 —— 不用准备参考视频,一句话就够。
图生视频里动作是模型自由决定的,你只能用文字大致引导 —— 说「跳舞」得到的是模型理解的跳舞。运动控制是拿一段真实视频当动作模板,所以动的是那段具体的动作。需要确定的动作时用这一页,想看模型的想法时用图生视频。
动作清楚、主体完整最重要。全身动作要能看到全身,手势要能看清手;主体被遮挡、画面太暗、或者同时有很多人,都会让动作提取变差。参考视频的画面质量不重要 —— 它只用来提供动作,外观来自你的角色图。
设计上不会 —— 动作来自参考,外观来自你的角色。但两者差异太大时(比如参考是全身舞蹈、角色图只有半身)模型需要补全没有的部分,那部分可能和你的角色不完全一致。
两者管的是不同部位:口型同步对齐嘴型到音频,运动控制迁移的是肢体动作和姿态。要做一个既有动作又在说话的角色,通常是先做动作再做口型。
Prompt
Image*
Video*