关键的不是「生成」,是「抽样」
大部分解释讲到「它能创造新内容」就停了,但有用的部分是「怎么造」。训练时,模型拟合的是一份分布:什么样的像素排布、声波、词序列是合理的。生成就是在你的提示词引导下,从这份分布里取出一个点。
由此有三个后果,每一个都会影响你的干活方式:
- 随机性是设计本身,不是故障。 跑两次就是抽两次样。提示词能做的是把抽样范围收窄,永远收不成一个点,只有固定种子才行。
- 模型追求的是「像」而不是「对」。 它的目标是让结果看起来像训练数据,所以一只结构自信但有六根手指的手,对它来说是完全合理的样本。这就是 AI 幻觉的来源。
- 中间没有检索这一步。 没有任何素材被从库里粘贴过来。所以指名要一个具体的真实物件时几乎拿不到准确形态,也所以「给一张参考图」远比「用文字描述那张图」有效。
你真正会接触到的几类模型
不需要记研究地图,只要认识日常工具背后的四类引擎。
- 扩散模型。 目前几乎所有在跑的图像和视频模型。从噪声出发,每一步去掉一点噪声,全程受提示词引导。界面上那些参数(步数、引导强度、重绘幅度、种子)就是它的旋钮。
- 自回归 Transformer。 文本为主,图像和音频也在往这边走。根据前面所有 token 预测下一个。对话模型、以及帮你改写或反推提示词的那个大模型,都在这一类。
- GAN。 在开放式生成上基本被取代了,但在放大、人脸修复这类「一次成型」的窄任务上仍是默认选择,因为快。
- 流匹配与一致性模型。 现在的主攻方向是把三十步压到一到四步还保持画质,这也是准实时预览能成立的前提。
真实工作流里会变的东西
用生成式 AI 更像导演,而不像操作软件。软件对同一输入给同一输出,而采样器给的是一族输出。相应地要调整几件事:
按「批」算预算,不要按「条」算。 单次运行等于抛硬币。一次跑四到八张再挑,通常比一次贵模型单跑一张更划算。
提示词失效时,把控制手段挪出提示词。 文字是一个很弱的方向盘。同一个问题改三轮提示词还在,说明该换结构性手段:参考图、首帧、蒙版、控制图,或者微调。
记录能让你回到现场的四样东西。 模型名、模型版本、种子、原样提示词。少了这四样,你喜欢的那个镜头就找不回来了,而模型版本是真的会下线的。
把成本当成创作决策的一部分。 每次生成都在烧算力。抽多少张、在什么分辨率下筛、什么时候才进放大,这些迭代策略本身就是手艺的一部分。
边界在哪
生成式 AI 最弱的地方,恰好是成片要求最严的地方:招牌上的准确文字、跨镜头的角色一致性、手和关节、物理因果,以及任何需要「为真」而不只是「像真」的内容。这些都不是把提示词写长能解决的,只能靠约束抽样,或者干脆把这部分放到后期合成里做,让模型去干它真正擅长的事:快速给出一个成立的世界。