AI 生成任务

AI 视频里的关键帧:首帧与尾帧

又称 首帧, 尾帧, first frame, last frame, 首尾帧

关键帧是你预先固定、要求模型必须经过的一帧。在 AI 视频里真正重要的是两个,首帧和尾帧,只要提供其中任意一个,一次开放式生成就变成了受约束的生成。这是对一致性影响最大的单一手段。

固定一帧为什么会改变一切

一次无约束的文生视频,必须同时决定主体长什么样它怎么动。这两个决定会互相干扰。随着片子推进,微小的外观漂移不断累积,到第四秒主体可能已经明显换了个人。

固定一帧,就把第一个决定拿掉了。模型不再对「东西长什么样」有投票权,只需要产出与手里这张帧相符的运动。这就是关键帧约束成为最可靠的一致性工具的原因,也是它通常比在提示词里堆更多形容词更有效的原因。

三种模式

  • 仅首帧。 片子从你的图开始向前运动。最常用的一种:观感完全可控,运动仍带探索性。
  • 仅尾帧。 片子最终抵达你的图。适合终点才是重点的场景,比如落到一张产品图或一张标题卡上。
  • 首尾帧。 模型在两张固定图之间做插值。可控性最强,而且实际上是另一种任务,因为你指定的是一次转场,不是一个镜头。

首尾帧也是最容易翻车的一种。如果两张图在内容上相差太远,模型只能在它们之间编造一条不成立的路径,出来的就是变形而不是运动。

把多段接成序列

多数模型单次生成上限只有几秒。要做更长的:

  1. 从首帧生成第 1 段。
  2. 导出第 1 段的最后一帧。
  3. 把这一帧作为第 2 段的首帧。
  4. 重复。

因为相邻两段共享的是一张真实的帧、而不是对这张帧的描述,接缝是连续的而不只是「相似」。代价是整条链上的漂移:每段都会继承上一段的压缩痕迹和瑕疵,质量缓慢下降。长序列每几段就要用一张新生成的图重新锚定一次。

有关键帧时提示词怎么写

提供了关键帧,提示词就应该花在运动上,而不是外观。外观已经定了,重复描述只会和你给的那张帧争夺权重。

  • camera slowly dollies forward, subject turns to face the light
  • ⚠️ a woman in a red coat in an alley 重述了这张帧已经钉死的东西

还有一个值得养成的习惯:把源图留着。首帧是可复用的资产。某一段跑坏了,用同一张锚图换一条运动提示词重跑,比从头再来快得多,而且能让整个序列的观感保持一致。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 33 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Camera slowly dollies forward down a wet cobblestone alley at dusk; hold the framing and grade of the supplied first frame

试一下:关键帧

打开生成器,参数已经预填好。

常见问题

首帧和尾帧有什么区别?
首帧钉住片子从哪开始,模型只需要向前编造运动;尾帧钉住片子在哪结束,模型必须解出一条通往既定终点的路径。两个都给,生成就变成了在两个固定点之间做插值。
给关键帧真的能改善一致性吗?
改善非常明显。身份漂移的根源是没有任何东西锚定主体外观。首帧就是那个锚,主体在片中变样时,这通常是最省力的解法。
怎么做出超过单次生成长度的视频?
接力:取第 N 段的尾帧,作为第 N+1 段的首帧。每段都在模型的长度上限内,而接缝是连续的,因为两侧共享的是同一张真实的帧。
这和传统动画里的关键帧一样吗?
概念一样,一个序列必须经过的固定姿态,中间帧被补齐。区别在于谁来补:动画里是中间画师,这里是模型。
哪些模型支持首尾帧输入?
并非全都支持。本页的模型列表取自 ZOOOP 实时模型目录,反映的是当前真正接受首帧输入的那些,不是一份会过期的手工清单。

相关术语