模型看到的是什么
一次局部重绘拿到三样输入:原图、标出待替换区域的遮罩、以及描述那里应该有什么的提示词。模型在生成遮罩内的新内容时,会以周围像素为条件,所以它能在边界处对上光线、肌理和透视。
正是这个「以周围为条件」,让局部重绘和整帧编辑的手感完全不同。模型不需要决定这张画讲什么,它解的是一个小得多的问题:在周围都长这样的前提下,这个洞里应该是什么。小问题的答案质量更高。
遮罩就是主要工作量
绝大多数糟糕的局部重绘,本质是遮罩问题,只是穿着提示词问题的外衣。
- 遮罩要比物体大一圈。 贴着轮廓画,等于告诉模型这个物体的确切剪影,而它会很配合地造一个同样形状的东西出来。
- 把「证据」一起框进去。 阴影、反光、接触点,正是让模型相信这个物体存在过的东西。去掉一盏灯却留着它打出的光,就会长回一个灯形状的东西。
- 边缘羽化。 硬边遮罩会留下可见接缝,几个像素的过渡能让融合落在渐变里。
- 一轮只处理一个物体。 一个遮罩里框两块无关区域,模型会试图把它们联系起来。
- 不要横跨强结构线画遮罩,比如地平线、桌沿、建筑转角,除非两侧都留够长度让模型把这条线接上。
任务怎么选
| 目的 | 该用的任务 |
|---|---|
| 去掉或替换画面里的某个东西 | 局部重绘 |
| 把画面往外扩 | 外扩绘制 |
| 改整张图的观感 | 图生图 |
| 把主体抠出来做合成 | 抠像 / 逐帧抠像 |
| 把小图变大 | 超分放大 |
在能解决问题的前提下用最窄的那个任务。为了修一只手而跑整帧重绘,等于把已经通过的部分全部重摇一次骰子。
这一轮提示词怎么写
描述那块区域应该有什么,而不是你想去掉什么。
- ✅
empty wet asphalt continuing the road markings, same overcast light - ⚠️
remove the car有时也行,但模型只能自己猜车的位置该换成什么
另外两个习惯。提示词要短:在一小块遮罩里写一长段,等于鼓励模型把一整个场景塞进这个补丁。以及,当填充结果已经接近对了,先换个种子重跑,再考虑改措辞 —— 在小遮罩里,方差通常比推敲文字更便宜。
视频局部重绘
视频局部重绘把同一个思路铺到时间上,是去威亚、去机械臂、换招牌、把现代物件从年代戏里拿掉的标准做法。有两点不同:遮罩必须跟着物体走,所以是跟踪而不是画;填充必须逐帧一致,所以模型需要参考相邻帧,而不是把每帧单独解一遍。
它最好用的情况是:物体挡住的那片背景在镜头别的时刻露出来过,这时填充是重建而不是发明。固定机位加运动主体是最容易的一档;一个静止物体挡着静止背景、整段都没露出来过,是最难的一档,也是补丁最容易「呼吸」的地方。