模型真正读到的是什么
扩散模型收到的不是你那句话。文本编码器把它变成一个向量,这个向量把去噪过程往「学到的描述与之接近」的那些图像上推。所有实用结论都从这里长出来。
这意味着模型在做「匹配」,不是在「服从」。它没法把「不要」当成一个操作来执行,没法维护一份计划,也没法反问你到底想要什么。所以整门手艺就是:把一个成品画面描述得足够准,让附近只剩下你能接受的画面;然后把每一个没起到收窄作用的词删掉。
对话模型正相反,这也是为什么大模型那套经验搬到图像上会失效。few shot prompting(少样本示例)和精心写的系统提示词都真实有效,但它们属于流水线里的语言层,比如那个帮你把一句想法扩写成镜头描述的助手、或者写训练标注的反推模型,而不属于图像模型本身。
一份站得住的提示词模板
顺序是有影响的:编码器给靠前的 token 更大权重,靠后的还可能被截断。所以把最不愿意丢的东西放最前面。
[景别] of [主体] [动作], [环境],
[光线], [镜头/光学], [色调/胶片], [运动,视频用]
套一下:Medium close-up of a fisherman mending a net, harbour wall, overcast diffused light, 85mm shallow focus, desaturated blue-grey grade。
值得占位置的内容:
- 具体的名词和动词。 「补渔网」远好于「拿着绳子做点什么」。
- 摄影层面的具体参数。 焦段、光的方向和质地、时间。这些在训练标注里出现频率极高,所以叫得动。
- 一个明确的主体。 两个主体各带一串形容词,属性一定会互相串味。
几乎从不值得占位置的:堆叠画质词(masterpiece、8k、超精细),它们主要把风格推向一种通用的塑料感;情绪化的恳求;以及描述「流程」而不是「画面」的句子。
按「对画面的实际影响」排序的手段
- 删词。 收益最高的一次编辑。把你在画面里看不出来的从句全删掉,剩下部分的跟随度立刻变好。
- 调顺序。 把最在意的东西提到最前面。同样的词,不同的结果。
- 负面提示词。 对反复出现的瑕疵(水印、多余肢体、乱码文字)有效,但它加不出模型本来就没有的控制力。
- 提示词权重。 适合给两个互相争抢的元素重新配平,倍数别开大。
- 风格锚点。 一个具名的媒介、年代或工艺(宝丽来、赛璐璐动画、钨丝灯室内)比一串形容词可靠得多,而且在一整个序列里更可复现。
什么时候「改词」是错的工具
提示词工程里最有价值的判断力,是认出天花板在哪。同一个问题改三轮还在,第四种写法也不会解决它,你只是在花积分证明这件事。这时候要伸手去拿提示词之外的东西:
| 问题 | 真正有效的动作 |
|---|---|
| 观感不是你脑子里那张 | 先把这一帧作为图生成出来,再当首帧用 |
| 角色跨镜头变样 | 参考图、固定种子,或训练一个 LoRA |
| 构图老是跑偏 | 上控制图或蒙版,而不是加形容词 |
| 招牌上的字是乱码 | 后期干净地补上,或换文本编码器更强的模型 |
| 运动不对 | 一段只给一个运镜,需要两个就拆成两段 |
真正把熟手和生手分开的那个习惯:留一份「跑通过的提示词」小库,把模型版本和种子一起记上。一条在特定模型上验证过的提示词模板,比任何通用规则都值钱,因为它记录的是那个模型的脾气,而每个模型都有自己的脾气。