模型与参数

GAN 是什么:对抗训练,以及它今天还赢在哪

又称 gan, gans, 生成对抗网络, esrgan, stylegan

GAN(生成对抗网络)是一对互相对打训练出来的神经网络,生成器产出候选图像,判别器判断它像不像真的。这场竞赛让单次前向推理就能出高质量结果,所以即便开放式生成已经被扩散模型接管,放大和人脸修复这类任务至今仍以 GAN 为主。

核心是一场竞赛

GAN 的训练是在两个网络之间安排一场对抗博弈。生成器把随机噪声映射成图像;判别器拿到真图和生成图混在一起的样本,必须逐张判定。判别器的训练目标是抓假,生成器的训练目标是骗过它。

谁都不可能一直赢。判别器每变敏锐一点,它回传的信号就等于告诉生成器「你哪里露馅了」,于是生成器跟着变强。理论上的均衡是:生成器的输出与训练分布无法区分,此时判别器只能靠瞎猜。

这套设计带来两个性质,足以解释今天 GAN 的全部去处:

  • 推理只有一次前向。 没有迭代去噪,也没有步数这回事。训完之后出结果几乎是瞬时的,这对交互式场景和大批量处理很关键。
  • 训练很脆。 两个网络必须以相近的速度变强。判别器太强,生成器就拿不到有用的梯度、原地卡住;生成器找到了便宜的伎俩,就停止探索。所以对抗训练一直有「难调」的名声,而扩散训练没有这个问题。

扩散模型为什么在生成上取代了它

这次交替并不是因为它在窄领域的最终画质差,StyleGAN 的人脸至今仍然惊人。真正起作用的是生产更在意的三件事:

  1. 覆盖面。 扩散模型学的是整个分布,用提示词能横跨极大范围的题材。而一个在人脸上训出来的 GAN,只会出人脸。
  2. 可干预性。 扩散是分几十步生成的,你可以在步与步之间插手:引导强度、负面提示词、蒙版、控制图、重绘幅度。单次前向的架构能插手的地方少得多。
  3. 大规模训练的稳定性。 扩散的目标函数在数十亿张图上训练表现可预测;对抗目标在这个量级上要维持平衡困难得多。
维度GAN扩散模型
推理一次前向,毫秒级多步,秒级
可控性有限
题材覆盖窄领域极广
训练不稳,需要配平可预测
现在主要用于放大、修复、增强文生图、视频

它今天仍然是正确选择的地方

如果你每天用 AI 工具,其实早就在用它了,只是没注意。这些场景的共同点是:输入到输出的映射定义清晰、要求快、并且不需要开放式提示词。

  • 放大。 Real-ESRGAN 及其后代仍是「便宜快速提分辨率」的现实默认项。
  • 人脸修复。 GFPGAN 一类模型能从低分辨率、糊掉或受损的源图里还原出人脸。
  • 人像与皮肤增强。 一个窄而可重复的变换,一次前向的速度就是它的全部意义。
  • 潜空间属性编辑。 StyleGAN 那种性质良好的潜空间,至今仍能做出平滑的年龄、表情、朝向调整,精度是扩散模型不容易干净复现的。
  • 端侧与实时。 任何必须跑在视频通话或手机相机管线里的处理。

一个实操上的警告

因为这类模型学的是「产出合理纹理」而不是「还原真实信息」,放大时它会非常自信地把不存在的东西造出来。睫毛、牙齿、布料织纹、远处的人脸、小号字母,全都会被填上一个像样的东西。两个习惯有用:接受结果之前按 100% 比例和源图对照一遍;人脸上宁可用较小倍率放两次,也别一次拉到极限,因为倍率每翻一次,编造出来的细节也跟着叠加。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Restore and upscale a soft 480p portrait to 4K, recover skin texture and eyelashes without changing identity

试一下:GAN

打开生成器,参数已经预填好。

常见问题

GAN 的原理用一句话说是什么?
两个网络对打。生成器努力产出能冒充真图的结果,判别器努力把假的挑出来。任何一方变强都会逼另一方变强,训练在「判别器再也分不出真假」时结束。推理时只保留生成器。
GAN 和扩散模型有什么区别?
GAN 一次前向就出图,快,但难以引导,而且容易输出单调;扩散模型用几十步反复精修噪声,慢,但可控性和题材覆盖都强得多。正是这份可控性让扩散模型赢下了文生图。
什么是模式崩塌?
GAN 最经典的翻车方式:生成器找到了一小撮能稳定骗过判别器的输出,就不再探索了,于是所有结果都长得差不多。这也是它在开放式提示词上吃力、而在定义清晰的窄任务上很强的重要原因。
GAN 已经过时了吗?
没有,只是换了阵地。生产环境里几乎所有的快速放大、人脸修复、人像增强都是 GAN 系的,因为这些任务目标明确而且要求毫秒级完成。它丢掉的只是「靠提示词做通用图像生成」这一块。
为什么 GAN 放大会凭空造细节?
因为它被训练的目标是产出看起来合理的高分辨率纹理,不是还原源图里本来就没有的信息。缺失的睫毛、牙齿、布料织纹会被一个足够可信的猜测填上。人脸和小字上,这件事每次都值得核对。

相关术语