AI 生成任务

图生视频(i2v)模型详解

又称 i2v, img2vid, image2video, 图片转视频, 首帧动起来

图生视频(image to video,常缩写为 i2v)是一种生成任务:一张静态图作为片子的起始帧,模型只需要负责编造运动。观感被你给的这张图锁定,视频生成里最大的随机来源就此被拿掉。

图生视频里模型仍然有权决定的部分

一次 i2v 生成只有一个任务:产出从你给的那一帧合理延续下去的画面。主体、色调、镜头质感、取景都已经定了,剩下开放的只有运动。而运动其实包含三件事,你不提模型也会替你决定:运镜、主体动作、以及环境动作(布料、水、头发、烟)。

三件都不写,多数模型的默认答案是缓慢推进加一点环境飘动。这个默认值就是大量 i2v 成品看起来都一个味道的原因。指名一个具体运动,是这个任务上最省力的质量提升。

怎么挑一张「动得好」的首帧

这一步决定了图生视频是出片还是出糊,而它发生在你写提示词之前。

  • 比例对齐,分辨率贴着模型原生值。 其他尺寸进去都会被裁或被补边。
  • 给运动留出空间。 想让镜头往右移,就别把主体贴在右边缘。
  • 主体尽量完整入画。 被画框切掉的四肢重新进画时是模型编的,而编出来的四肢正是扭曲最容易出现的地方。
  • 别用本身就带运动模糊的图。 模型会把已有的模糊当成材质,一路涂抹下去。
  • 优先选定格在动作中间的图。 一个正在迈步、身体前倾的人物动得起来;一个端正站着的人物往往只会换来一次缓慢推镜。
  • 留意背景复杂度。 密集人群、树叶、细密花纹,是时序瑕疵最先出现的位置。

提示词写运动,不写外观

观感已经定了,就把每个字都花在动作上。

[运镜], [主体动作], [环境动作], [什么保持不动]

一段片子一个运镜、一个主体动作。两个互相竞争的运镜,最快换来一段两边都不像的晃动。「什么保持不动」这一项很少有人写,但很有效:它给了模型一个稳定参照,而不是让它把所有东西一起漂。

最常见的浪费是重述外观。输入帧里明明就是「红外套的女人在巷子里」,你再写一遍不增加任何信息,还可能把输出往离那张帧更远的方向拉。

视频任务怎么选

你手里有该用的任务
只有一个想法文生视频
一张想让它动起来的图图生视频(i2v)
起点和终点都由你定首尾帧
一段想换风格的素材视频转视频

中间两项值得分清。同时给尾帧,生成就变成了在两个固定点之间插值,控制更紧,但那是另一种创作动作:你指定的是一次转场,不是一个镜头。

几种翻车与它们真正的解法

主体变形、该锁的机位在漂、背景在呼吸式起伏、手指自己叠在一起,这四种最常见,而没有一种是提示词措辞问题。

变形通常意味着你要的运动超出了模型从一帧能解出的范围,那就要得少一点。多余的运镜要靠明确写「机位锁定」压掉。背景起伏多半是源图太杂,回去简化那张静图。手是公认的弱项,务实的答案是把它挪出画面或让它保持静止,而不是把它描述得更仔细。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 60 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Handheld camera drifts slowly right as the woman turns her head toward the window, curtains moving in the draft, no cuts

试一下:图生视频(i2v)

打开生成器,参数已经预填好。

常见问题

i2v 和 t2v 有什么区别?
T2V 只凭文字同时发明外观和运动,所以每次跑都可能完全不同;i2v 的外观继承你的图,只决定东西怎么动。如果你已经知道画面该长什么样,i2v 基本总是更好的选择。
为什么出来的片子几乎不动?
两个常见原因:提示词描述的是一个场景而不是一个动作,模型没东西可动;以及源图本身是静止构图,没有任何「正在发生」的暗示。指名一个具体运动,并挑一张定格在动作中间的图。
输入图必须和输出比例一致吗?
能一致就一致。比例不一致会在生成前被裁切或补边,你要么损失精心构好的画面,要么白送模型两条黑边让它去填。静图就按你最终要交付的比例生成。
img2vid 和 i2v 是一回事吗?
是。i2v、img2vid、image2video 指同一个任务。缩写来自开源工具链,产品文档一般写全称。
怎么做出超过单次长度的片子?
接力。导出第一段的最后一帧,作为第二段的输入图。接缝是连续的,因为两段共享同一张真实的帧;但整条链上画质会缓慢下滑,所以每几段就用一张新生成的静图重新锚定。
运镜能控制到什么程度?
能指定一个方向和大致速度,不能指定精确的轨迹和时间点。一段片子只写一个运镜,需要复杂运镜时拆成两段分别生成再对切,比让模型在一段里完成两个动作可靠得多。

相关术语