为什么这里运动参考胜过文字提示词
用文字描述一段舞蹈,是你能要求视频模型做的最不可靠的事之一 —— 时机、重量和节拍,恰恰是语言最不擅长指定的。改成绑定一段固定参考片,整个问题就消失了:动作本来就是对的,模型唯一的工作是让你的动物去执行它。这就是为什么这个模板结果稳定,而同样的事靠提示词去做通常做不到。
什么照片映射得干净
全身、面向镜头、背景和动物分得开。参考需要找到一个头、一个躯干和四条肢来驱动;面部特写只给了它一样,蜷着睡着的宠物一样都没给。和背景分离得好,也能让毛色花纹在运动中保持完整 —— 而这正是让人觉得「是我家那只」而不是随便一只的关键。