AI 生成任务

文生视频模型详解

又称 t2v, txt2vid, text to video model, 文本生成视频

文生视频(text to video,T2V)是一种生成任务:模型只接受一段文字提示,不需要参考图,直接产出一段视频。主体长什么样、怎么取景、怎么运动,全部由模型一次性决定,这也是它可控性最低、最适合探索的原因。

模型实际在做什么

文生视频模型读你的提示词,生成一串必须彼此自洽的帧:同一个主体、同一套光、同一个世界,连贯地在时间里运动。它同时在做两件事,决定东西长什么样,以及决定它们怎么动。

这个双重任务正是 T2V 在所有视频任务里最松散的原因。没有参考帧锚定外观,每次跑都是一次全新的解读。同一条提示词跑两次,主体和取景可能完全不同。探索阶段这很有用,不在探索阶段就是麻烦。

T2V 还是 I2V:按「你已经知道多少」来选

文生视频图生视频
输入仅提示词图 + 提示词
外观模型自己发明被你的图锁定
适合探索、找调性、找创意执行已定的观感
身份漂移较高低得多

实操结论:如果你能把首帧描述清楚,更好的做法是先生成这张图,再交给图生视频模型。用多一步生成,换回大幅可控性。

怎么比较文生视频模型

有四个维度,而模型很少在四项上同时领先。

  • 运动质量。 运动看起来是有物理感的,还是在滑动、扭曲?模型之间差异最大的就是这一项,也是最难靠提示词补救的一项。
  • 提示词遵循度。 加到第几个从句开始被模型悄悄丢弃。用一条故意写过头的提示词去测,数数有几条真的生效了。
  • 片长与帧率。 决定你是在拿 4 秒还是 10 秒的积木做剪辑,这会直接影响整段怎么设计。
  • 时序一致性。 人脸、服装、背景在整段里是否稳住,而不是逐帧漂移。

价格和这四项都有互动。一个便宜到能跑六次的模型,往往胜过一次昂贵的生成,因为 T2V 的输出方差本来就大。

写一条稳的提示词

控制在一个主体、一个运镜、一个光感。顺序有影响:模型对靠前的 token 权重更高,所以把最不愿意丢的东西放最前面。

[运镜] on [主体] in [环境], [光线], [镜头/调色]

加第二个运镜或第二个主体,是丢失遵循度最快的方式。如果两个都要,分成两段生成再对切。反向提示词(negative prompt)能压掉反复出现的瑕疵,但它没法凭空给出模型本来不具备的控制力;如果你一直在跟同一种漂移较劲,解法是换任务,而不是把提示词写得更长。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

A slow push-in on a rain-streaked bus window at night, city lights sliding past out of focus, 24fps, anamorphic, muted teal grade

试一下:文生视频(T2V)

打开生成器,参数已经预填好。

常见问题

文生视频和图生视频有什么区别?
T2V 只从文字出发,主体长什么样由模型决定;I2V 从你提供的图出发,画面观感被锁定,模型只需要负责运动。如果你已经知道画面该是什么样,I2V 的可控性高得多。
T2V 和 I2V 哪个更好?
两者解决的不是同一个问题。还在探索、没有美术方向时用 T2V;观感重要时用 I2V,因为它直接消掉了一整个随机维度。
一次能生成多长?
目前主流模型单次 4 到 10 秒。更长的片子是多段拼起来的,常见做法是把上一段的尾帧接成下一段的首帧。
为什么输出会忽略提示词里的一部分?
提示词遵循度会随从句增加而下降,而且运动类指令和外观类指令会互相争夺权重。先砍到「一个主体 + 一个运镜 + 一个光感」,再一条一条加回去。
为什么主体在片中会变样?
时序一致性是视频生成最难的部分,而文生视频没有一张锚定帧把主体固定住。如果你在跟身份漂移作斗争,就该换成 I2V。
txt2vid 和 T2V 是一回事吗?
是。T2V、txt2vid、text2video 都是同一个任务的缩写。短写法来自研究和开源模型社区,产品文档里更常见拼全的写法。

相关术语