AI 生成任务

超分放大详解:AI 补出来的细节从哪来

又称 upscaling, super resolution, 超分辨率, AI 放大, 图片放大

超分放大(upscaling)是把图像或视频的像素尺寸变大。传统重采样只是把已有像素撑开,越大越糊;AI 超分(super resolution)则用模型合成源文件里本来不存在的细节,所以它能比原图更锐,也正因如此它可能悄悄改掉一张脸。

同一个词,两种操作

bicubic、Lanczos 这类重采样,是在已有像素之间做插值把图撑大。没有任何东西被添加,所以放 4 倍就是软 4 倍。这是诚实的那一种:它从不编造内容,因为它根本不生产内容。

AI 超分是顶着同一个标签的另一种操作。超分模型在几百万组低分辨率与高分辨率图像对上训练过,学到的是「采样极限之下通常有些什么」:皮肤的毛孔结构、一根根头发、砖块的边、织物纹路重复的方式。给它一张小图,它就把这些细节合成出来。输出确实是锐的,而这份锐是预测,不是恢复。

超分放大所有好用的地方和所有危险的地方,都源自这一点。

它修得好什么,编得凶什么

源的问题结果
本身锐,只是尺寸小效果最好,理想场景
轻度压缩块效应顺带被清掉
失焦发虚部分改善,部分是编的
小尺寸人脸说得通,但不是同一个人
小字与 logo变成字形状的噪声,别做
运动模糊恢复不了,只是模糊的边变锐

规律很清楚:超分在「统计性肌理」上可靠,在「只有一个正确答案」的东西上不可靠。皮肤纹理没有正确答案,猜一下没关系;客户的 logo 只有一个正确答案,猜一下就是事故。

视频放大是更难的一档

拿静态图放大器逐帧跑一遍视频,结果是画面在闪。每帧都是独立放大的,于是那些被编出来的毛孔、发丝、织物纹路,每二十四分之一秒都落在不同位置。固定机位的镜头暴露得最狠,因为眼睛有一个稳定参照可以对比。

带时序约束的视频超分模型会让每一帧参考相邻帧,用一点单帧锐度换整段画面稳住。如果手里只有静图放大器,就把倍数压低,然后补一点颗粒 —— 颗粒能给闪烁提供藏身之处。

生成视频的工序顺序:先生成,再补帧,再放大,最后调色。先放大再补帧,等于让补帧算法在一堆编出来的细节上估运动;先调色再放大,等于把这版调色烘进合成出来的肌理里。

一套不容易后悔的流程

  1. 按模型的原生分辨率生成。 让模型出一个奇怪尺寸是要拿质量换的,出原生尺寸再放大不用。
  2. 先修后放。 多出来的那根手指在工作分辨率上修掉,放大只会给你一根更大的手指。
  3. 源比较软时,两次 2 倍优于一次 4 倍,中间加一点轻降噪,别让第二轮在放大第一轮的猜测。
  4. 必须准确的地方遮出来。 人脸、包装文字、字体可以保留原分辨率,最后再合回放大好的底图上。
  5. 原文件留着。 超分输出不是无损变换,而且下个月的模型在同一个源上会做得更好。

怎么验收

按 100% 看,不要缩放到窗口大小,而且要左右并排比,不要来回切换。盯三处:一块皮肤或织物看有没有蜡感、一条高反差边看有没有光晕、任何重复肌理看规律是否过于整齐。三处都过,这次放大就是你要的;任何一处不过,解法是降倍数或换模型,绝不是在失败结果上再跑一轮。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 60 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Upscale this portrait 2x, preserving skin texture and the original grain, no added sharpening on the eyes

试一下:超分放大(Upscaling)

打开生成器,参数已经预填好。

常见问题

超分放大到底是在做什么?
把图或视频的像素变多。普通重采样是把现有像素撑开,越放越软;AI 超分是预测「更高分辨率下这张图该长什么样」并画出来,所以画面依旧锐利,但里面包含相机从未记录过的细节。
超分和 upscaling 是一回事吗?
super resolution 是基于模型那一类的技术名,upscaling 是统称,也包含 bicubic、Lanczos 这类纯重采样。日常说放大基本都指前者,但需要严谨的时候这个区别很重要,因为只有一种会凭空造内容。
超分能把没拍到的细节找回来吗?
不能,它只能给出一个说得通的猜测。在肌理、草木、织物上这种猜测通常很有说服力,也没人会计较;在人脸、文字、logo 上它就是编的,而且熟悉对象的人一眼能看出不对。
为什么放大之后人脸变了?
因为模型把语义模糊的像素解释成了它认为更可能的五官,而倍数越高,模糊的部分就比有效信号更多。解法是降倍数、换针对人脸训练的模型,或者把脸单独遮出来保留原分辨率、只放大其余部分。
该在修图前放大还是修图后放大?
修完再放大。缺陷修补、局部重绘、构图裁切都在工作分辨率上做完,放大放在图像环节的最后一步。放大器会非常乐意把一个错误渲染成四倍大,而且之后每一次修改都要跟合成出来的肌理较劲。
倍数最多能拉到多少?
2 倍几乎万金油。源本身就够锐、只是尺寸小的时候,4 倍也能用。再往上就是让模型来画这张图的大部分内容了,破绽会一起出现:蜡质皮肤、硬边光晕、以及规律得不像真的肌理。

相关术语