AI 运动控制

给一段参考视频和你的角色,让这个动作被完整迁移过来 —— 舞蹈、手势、表情,动得准,人还是你的人。

核心能力

动作照着参考走

用一段参考视频指定动作,比用文字描述准得多 —— 「跳一段舞」模型会自由发挥,给它参考视频就是那段舞。

角色还是你的角色

动作来自参考视频,外观来自你的角色图,两样分开控制。

让照片动起来

一张静态人像加一段参考动作,就能得到这个人做这个动作的视频。

同一动作套多个角色

一段参考动作可以分别套到不同角色上,得到动作一致、人物不同的一组视频。

使用场景

让照片动起来

让照片动起来

静态人像按参考动作动起来,不用拍摄。

舞蹈与动作视频

舞蹈与动作视频

参考一段舞蹈,让你的角色跳同一段,动作对得上拍子。

跨角色一致动作

跨角色一致动作

同一段动作套到几个不同角色上,得到成组的素材。

虚拟主播与角色内容

虚拟主播与角色内容

固定角色配上录好的动作,批量产出人物一致的内容。

如何使用

01

打开 AI 运动控制,上传你的角色图或视频。

02

上传一段参考动作视频,指定要迁移的动作。

03

生成后下载,或者送进画布接着剪。

深入了解

用参考视频指定动作,而不是描述它

在视频生成里写「跳一段舞」,你会得到模型理解的跳舞 —— 可能挺好看,但不是你要的那段。动作这种东西,文字描述的分辨率太低了:节奏、幅度、姿态的细节,写不进一句提示词里。

运动控制换了个输入方式:给它一段参考视频。动作从视频里提取,外观从你的角色图来,两样分开控制。所以你的角色会做出参考视频里那个具体的动作。

参考视频要看得清动作

参考视频的画面质量不重要,它只用来提供动作,外观完全来自你的角色图。重要的是动作能被看清:

  • 主体完整 —— 全身动作要能看到全身,手势要能看清手
  • 没有遮挡 —— 主体被挡住的部分,动作也就提取不到
  • 画面别太暗 —— 看不清轮廓就判断不了姿态
  • 最好只有一个人 —— 画面里几个人同时动,模型不知道该跟谁

另一个要注意的是取景要匹配。参考是全身舞蹈、角色图只有半身的话,模型得补出没有的下半身,那部分不一定和你的角色一致。两边的取景范围接近时效果最好。

什么时候该换个工具

  • 不在意具体动作 —— 用视频生成,一句描述让模型自由发挥更快。
  • 要对齐的是口型 —— 用口型同步,那是对着音频做的,管的是嘴。
  • 要精确控制起止画面 —— 用首尾帧。
  • 要改的是画面风格 —— 用视频编辑。

该怎么想这件事

这一页的价值在于动作的确定性。所以它适合两种情况:你有一段一定要复现的动作(某段舞、某个手势),或者你要一批人物不同但动作一致的素材。

反过来,如果动作是什么无所谓、只要「动起来」就行,那用视频生成更省事 —— 不用准备参考视频,一句话就够。

常见问题

和图生视频有什么区别?+

图生视频里动作是模型自由决定的,你只能用文字大致引导 —— 说「跳舞」得到的是模型理解的跳舞。运动控制是拿一段真实视频当动作模板,所以动的是那段具体的动作。需要确定的动作时用这一页,想看模型的想法时用图生视频。

参考视频有什么要求?+

动作清楚、主体完整最重要。全身动作要能看到全身,手势要能看清手;主体被遮挡、画面太暗、或者同时有很多人,都会让动作提取变差。参考视频的画面质量不重要 —— 它只用来提供动作,外观来自你的角色图。

角色的外观会被参考视频影响吗?+

设计上不会 —— 动作来自参考,外观来自你的角色。但两者差异太大时(比如参考是全身舞蹈、角色图只有半身)模型需要补全没有的部分,那部分可能和你的角色不完全一致。

和口型同步有什么关系?+

两者管的是不同部位:口型同步对齐嘴型到音频,运动控制迁移的是肢体动作和姿态。要做一个既有动作又在说话的角色,通常是先做动作再做口型。

更多模型