它约束什么,不约束什么
「同一个东西拍出不止一个镜头」之所以难,几乎全部来自一个事实:每次生成都是从零开始的。用文字描述一个角色,同样的提示词跑两遍,你会得到两个都符合描述、但不是同一个人的人。角色参考图的存在就是为了打破这一点 —— 交给模型的是像素,不是形容词。
它约束的是身份:脸部结构、头发、辨识性特征,通常还包括服装和颜色。它有意不约束的是这个镜头本身:姿势、构图、机位、光线、环境都还在提示词手里,而这正是重点。如果参考图连构图一起管了,你就没法把同一个人放进一个新场景。
这条分界也是大部分失败的来源。给模型一张风格化油画当角色参考,它会把笔触一起带过来,因为它无法判断你指的是这张图的哪些属性。给它一张硬侧光拍的照片,那道阴影就成了身份的一部分。
参考图怎么挑
规则都不性感,但它们比措辞重要得多。
- 中性、均匀的光。 平光正面或者柔和的窗光。阴影会被当成特征烤进去。
- 多个角度。 正面、四分之三侧、正侧。三到五张胜过一张,因为这时模型对一个脑袋的侧面是有真实信息的,不是在猜。
- 整组里的主体要一致。 同一个发型、同一个年龄段,如果服装重要就同一套服装。一组自相矛盾的参考图会被平均成第四个人。
- 背景干净。 画面里出现别人的脸,是最稳定地拿到「混血」结果的方式。
- 分辨率和锐度。 参考图的细节量就是输出细节量的上限。
对于反复出场的主体,参考图组只建一次,留在项目里,之后每个镜头都复用它。一组镜头之间的一致性来自参考图组是固定的,而不是来自某一次生成特别好。
配套的提示词怎么写
挂上参考图之后,提示词的职责变了:停止描述主体,开始描述除主体之外的一切。
把场景、景别和光线完整写出来,然后指名参考图而不是重述它的内容:the woman from the reference image, standing at a bus stop in the rain at night。在已经有参考图的情况下再补一句 dark hair, green eyes, mid thirties,并不会加强身份 —— 它引入了第二份更弱的描述,去和像素竞争,把脸拉向两者的平均值。
然后把必须保住的属性钉住:keep her face, hair length and jacket exactly as in the reference。模型对服装的态度比对脸松得多,所以服装的连续性通常需要专门点名。
条件允许时,让主体在画面里的比例和参考图接近。身份在中景到中近景之间保持得很好,在大远景里迅速崩掉 —— 那时一张脸只有几十个像素,根本没有可供约束的东西。
什么时候该换成 LoRA
角色参考图适合几个镜头、一次提案、一次性的需求。它不花额外的钱、不用训练、立刻就能用。
它有天花板。身份是被「暗示」而不是被「学会」的,所以在不寻常的姿势、参考图没覆盖到的正侧转身、以及较长的视频片段上都会松掉。如果同一个角色要跨几十个镜头出场,用二三十张图训练一个 LoRA,能在任何参考图组都覆盖不到的角度和表情上把相似度撑住,并且彻底消掉逐镜头的漂移。切换的实际信号是重复劳动:当你已经在因为「脸变了」而重摇镜头时,训练一次比继续重摇更便宜。