图生视频里模型仍然有权决定的部分
一次 i2v 生成只有一个任务:产出从你给的那一帧合理延续下去的画面。主体、色调、镜头质感、取景都已经定了,剩下开放的只有运动。而运动其实包含三件事,你不提模型也会替你决定:运镜、主体动作、以及环境动作(布料、水、头发、烟)。
三件都不写,多数模型的默认答案是缓慢推进加一点环境飘动。这个默认值就是大量 i2v 成品看起来都一个味道的原因。指名一个具体运动,是这个任务上最省力的质量提升。
怎么挑一张「动得好」的首帧
这一步决定了图生视频是出片还是出糊,而它发生在你写提示词之前。
- 比例对齐,分辨率贴着模型原生值。 其他尺寸进去都会被裁或被补边。
- 给运动留出空间。 想让镜头往右移,就别把主体贴在右边缘。
- 主体尽量完整入画。 被画框切掉的四肢重新进画时是模型编的,而编出来的四肢正是扭曲最容易出现的地方。
- 别用本身就带运动模糊的图。 模型会把已有的模糊当成材质,一路涂抹下去。
- 优先选定格在动作中间的图。 一个正在迈步、身体前倾的人物动得起来;一个端正站着的人物往往只会换来一次缓慢推镜。
- 留意背景复杂度。 密集人群、树叶、细密花纹,是时序瑕疵最先出现的位置。
提示词写运动,不写外观
观感已经定了,就把每个字都花在动作上。
[运镜], [主体动作], [环境动作], [什么保持不动]
一段片子一个运镜、一个主体动作。两个互相竞争的运镜,最快换来一段两边都不像的晃动。「什么保持不动」这一项很少有人写,但很有效:它给了模型一个稳定参照,而不是让它把所有东西一起漂。
最常见的浪费是重述外观。输入帧里明明就是「红外套的女人在巷子里」,你再写一遍不增加任何信息,还可能把输出往离那张帧更远的方向拉。
视频任务怎么选
| 你手里有 | 该用的任务 |
|---|---|
| 只有一个想法 | 文生视频 |
| 一张想让它动起来的图 | 图生视频(i2v) |
| 起点和终点都由你定 | 首尾帧 |
| 一段想换风格的素材 | 视频转视频 |
中间两项值得分清。同时给尾帧,生成就变成了在两个固定点之间插值,控制更紧,但那是另一种创作动作:你指定的是一次转场,不是一个镜头。
几种翻车与它们真正的解法
主体变形、该锁的机位在漂、背景在呼吸式起伏、手指自己叠在一起,这四种最常见,而没有一种是提示词措辞问题。
变形通常意味着你要的运动超出了模型从一帧能解出的范围,那就要得少一点。多余的运镜要靠明确写「机位锁定」压掉。背景起伏多半是源图太杂,回去简化那张静图。手是公认的弱项,务实的答案是把它挪出画面或让它保持静止,而不是把它描述得更仔细。