模型实际在做什么
文生视频模型读你的提示词,生成一串必须彼此自洽的帧:同一个主体、同一套光、同一个世界,连贯地在时间里运动。它同时在做两件事,决定东西长什么样,以及决定它们怎么动。
这个双重任务正是 T2V 在所有视频任务里最松散的原因。没有参考帧锚定外观,每次跑都是一次全新的解读。同一条提示词跑两次,主体和取景可能完全不同。探索阶段这很有用,不在探索阶段就是麻烦。
T2V 还是 I2V:按「你已经知道多少」来选
| 文生视频 | 图生视频 | |
|---|---|---|
| 输入 | 仅提示词 | 图 + 提示词 |
| 外观 | 模型自己发明 | 被你的图锁定 |
| 适合 | 探索、找调性、找创意 | 执行已定的观感 |
| 身份漂移 | 较高 | 低得多 |
实操结论:如果你能把首帧描述清楚,更好的做法是先生成这张图,再交给图生视频模型。用多一步生成,换回大幅可控性。
怎么比较文生视频模型
有四个维度,而模型很少在四项上同时领先。
- 运动质量。 运动看起来是有物理感的,还是在滑动、扭曲?模型之间差异最大的就是这一项,也是最难靠提示词补救的一项。
- 提示词遵循度。 加到第几个从句开始被模型悄悄丢弃。用一条故意写过头的提示词去测,数数有几条真的生效了。
- 片长与帧率。 决定你是在拿 4 秒还是 10 秒的积木做剪辑,这会直接影响整段怎么设计。
- 时序一致性。 人脸、服装、背景在整段里是否稳住,而不是逐帧漂移。
价格和这四项都有互动。一个便宜到能跑六次的模型,往往胜过一次昂贵的生成,因为 T2V 的输出方差本来就大。
写一条稳的提示词
控制在一个主体、一个运镜、一个光感。顺序有影响:模型对靠前的 token 权重更高,所以把最不愿意丢的东西放最前面。
[运镜] on [主体] in [环境], [光线], [镜头/调色]
加第二个运镜或第二个主体,是丢失遵循度最快的方式。如果两个都要,分成两段生成再对切。反向提示词(negative prompt)能压掉反复出现的瑕疵,但它没法凭空给出模型本来不具备的控制力;如果你一直在跟同一种漂移较劲,解法是换任务,而不是把提示词写得更长。