固定一帧为什么会改变一切
一次无约束的文生视频,必须同时决定主体长什么样和它怎么动。这两个决定会互相干扰。随着片子推进,微小的外观漂移不断累积,到第四秒主体可能已经明显换了个人。
固定一帧,就把第一个决定拿掉了。模型不再对「东西长什么样」有投票权,只需要产出与手里这张帧相符的运动。这就是关键帧约束成为最可靠的一致性工具的原因,也是它通常比在提示词里堆更多形容词更有效的原因。
三种模式
- 仅首帧。 片子从你的图开始向前运动。最常用的一种:观感完全可控,运动仍带探索性。
- 仅尾帧。 片子最终抵达你的图。适合终点才是重点的场景,比如落到一张产品图或一张标题卡上。
- 首尾帧。 模型在两张固定图之间做插值。可控性最强,而且实际上是另一种任务,因为你指定的是一次转场,不是一个镜头。
首尾帧也是最容易翻车的一种。如果两张图在内容上相差太远,模型只能在它们之间编造一条不成立的路径,出来的就是变形而不是运动。
把多段接成序列
多数模型单次生成上限只有几秒。要做更长的:
- 从首帧生成第 1 段。
- 导出第 1 段的最后一帧。
- 把这一帧作为第 2 段的首帧。
- 重复。
因为相邻两段共享的是一张真实的帧、而不是对这张帧的描述,接缝是连续的而不只是「相似」。代价是整条链上的漂移:每段都会继承上一段的压缩痕迹和瑕疵,质量缓慢下降。长序列每几段就要用一张新生成的图重新锚定一次。
有关键帧时提示词怎么写
提供了关键帧,提示词就应该花在运动上,而不是外观。外观已经定了,重复描述只会和你给的那张帧争夺权重。
- ✅
camera slowly dollies forward, subject turns to face the light - ⚠️
a woman in a red coat in an alley重述了这张帧已经钉死的东西
还有一个值得养成的习惯:把源图留着。首帧是可复用的资产。某一段跑坏了,用同一张锚图换一条运动提示词重跑,比从头再来快得多,而且能让整个序列的观感保持一致。