加了一张图之后,什么变了
纯文字生成必须自己发明结构。一旦你给了图,结构就已经定了,模型的工作收窄成「重新解释它」。这就是图生图成为生产环节主力、而纯文字生成更像创意工具的原因:你大致能预判会拿回什么。
实现上,多数做法是先给你的图加噪,再朝提示词的方向去噪。加多少噪就是「强度」,它决定了这一轮是一次调色,还是一张全新的画。
强度这一个滑块,几乎就是全部界面
| 强度 | 留下什么 | 用来做什么 |
|---|---|---|
| 低(0.1–0.3) | 几乎全部 | 调色、小修补、加肌理 |
| 中(0.4–0.6) | 版式、姿态、色调 | 换风格、换材质、定观感 |
| 高(0.7–0.9) | 一个大致构图 | 松散再解释、概念变体 |
新手第一个错误是开高强度,然后惊讶源图没了;第二个错误是开低强度,然后断定这模型不会换风格。找到那个「结构稳住、风格能动」的数值,记下来,整个镜头都用它。
选对任务,比调参数重要
- 改整张画面的观感:图生图。
- 改一个物体或一块区域:局部重绘,配遮罩。
- 套用另一张图的美学:风格迁移,本质是把文字指令换成风格参考图的 i2i。
- 把画面往外扩:外扩绘制(outpainting)。
- 既要修错又要放大:先修,再放大。
在能完成任务的前提下选最窄的那个任务,是这套流程里最有价值的习惯。你多允许模型碰一个像素,就多一个像素可能被它做坏。
多张参考图
新一代模型可以同时接受多张图,各司其职:一张定构图、一张定角色身份、一张定商品或服装。i2i 从这里开始不再只是风格工具,而变成了组装工具。两条规则能让它真的转得起来:
- 在提示词里说清每张图是干什么的。不说,模型就猜,而它通常猜你想要一个平均值。
- 参考图要干净、裁紧到真正重要的那个东西上。一张杂乱的参考图会把杂乱一起贡献进来。
这一轮提示词怎么写
描述「要改成什么」,不要描述这张画。画就在模型眼前,重述它只会和你给的像素争夺权重。
- ✅
repaint as hand-inked comic art, flat shadows, keep pose and camera angle - ⚠️
a woman standing by a window in a blue dress只是重述了源图已经钉死的东西
两种可预期的翻车:文字和 logo 每跑一轮都会退化,因为它们每次都被重新合成一遍,重要就把它们遮掉;连续叠很多轮会让画质缓慢下滑,因为每轮都继承上一轮的瑕疵。发现自己在对同一个文件跑第四轮时,回到原图重来更省时间。