AI 生成任务详解
一条术语对应一种生成任务:输入是什么、输出是什么、ZOOOP 上哪些模型能跑。
光流(Optical Flow)
光流(optical flow)是一张逐像素的运动图:对每个像素,它给出这块内容从这一帧移动到下一帧的二维位移向量。插帧、视频转视频、防抖、视频放大都靠这份测量来判断「哪些东西跨帧应该保持不变」,所以它是时序一致性背后的机器。
光流场 · 运动估计 · 时序一致性 · optical flow
关键帧
关键帧是你预先固定、要求模型必须经过的一帧。在 AI 视频里真正重要的是两个,首帧和尾帧,只要提供其中任意一个,一次开放式生成就变成了受约束的生成。这是对一致性影响最大的单一手段。
首帧 · 尾帧 · first frame · last frame · 首尾帧
动作迁移(Motion Transfer)
动作迁移(motion transfer)是把驱动视频里主体的运动搬到另一个角色身上,让一张静图或一个新身份做出同样的动作。管线先从驱动视频抽出姿态序列,再按目标的身材比例做重定向,最后以这条序列加上你的身份参考为条件生成每一帧,所以它也叫姿态迁移。
姿态迁移 · pose transfer · motion transfer · 驱动视频
口型同步(Lip Sync)
口型同步(lip sync)是让照片或视频里的一张脸对上给定音频的任务。模型逐帧重画嘴、下颌,通常还包括整个下半脸,让口型与声音对齐,画面其余部分保持原样。
对口型 · lip sync · lipsync · 音频驱动
图像分割
图像分割是把一张图在像素级别切成带标签的区域,产出的是一张遮罩,而不是一个方框。在生成管线里,它决定了「一次编辑允许动哪些像素」,所以抠背景、物体移除、局部重绘、单主体调色都建立在它之上。
语义分割 · 实例分割 · 抠图 · 遮罩
图生图(i2i)
图生图(image to image,常缩写为 i2i)是一种生成任务:输入图会约束输出。模型改写的是一张已有的画面,不是从纯噪声开始,所以构图、色彩、姿态会按「强度」这个参数所允许的程度被继承下来。
i2i · img2img · image to image translation · 图像转换 · 参考图
图生视频(i2v)
图生视频(image to video,常缩写为 i2v)是一种生成任务:一张静态图作为片子的起始帧,模型只需要负责编造运动。观感被你给的这张图锁定,视频生成里最大的随机来源就此被拿掉。
i2v · img2vid · image2video · 图片转视频 · 首帧动起来
声音克隆(Voice Cloning)
声音克隆(voice cloning)是用一段真人录音建出一个合成音色,再用这个音色去读新的文本。现在的零样本系统只需要几秒到几十秒音频:模型从参考片段里抽出一个说话人向量,再让语音合成以它为条件,所以每换一个音色都不需要重新训练。
音色克隆 · voice clone · voice cloning · 零样本 TTS
局部重绘(Inpainting)
局部重绘(inpainting)只重新生成你画出的遮罩范围内的像素,遮罩之外一个像素都不动。要去掉一个物体、换掉一处细节、修掉一个错误,而不想重渲整张图,用的就是它。而结果好不好,取决于遮罩的程度远大于提示词。
inpainting · ai inpainting · video inpainting · 消除笔 · 遮罩重绘
扩图(Outpainting)
扩图(outpainting)是把一张图向原有边框之外延伸:放大画布,把新增的空白区域标成待填充区域,模型依据边缘已有的像素补出画外本该有的内容。它和局部重绘用的是同一套遮罩机制,区别只在于填的是框外还是框内。
外扩 · 图像扩展 · outpainting · generative fill
文生图(T2I)
文生图(text to image,T2I)是一种生成任务:模型只读一段文字提示,不需要参考图,直接产出一张静态图。它是从学到的分布里采样,而不是去检索,所以同一段文字换一个随机种子,出来的是另一张同样成立的图。
t2i · txt2img · text to image model · 文本生成图像
文生视频(T2V)
文生视频(text to video,T2V)是一种生成任务:模型只接受一段文字提示,不需要参考图,直接产出一段视频。主体长什么样、怎么取景、怎么运动,全部由模型一次性决定,这也是它可控性最低、最适合探索的原因。
t2v · txt2vid · text to video model · 文本生成视频
深度图(Depth Map)
深度图(depth map)是一张灰度图,每个像素记录的不是颜色,而是这一点离相机有多远,惯例是近处亮、远处暗。生成管线把它当作结构控制信号:它携带了画面的空间布局和体积,却不携带风格,所以可以只换观感、不动位置。
深度估计 · 单目深度 · depth map · z-depth
视频转视频(vid2vid)
视频转视频(video to video ai,常缩写为 vid2vid)以一段现成素材为主输入,把它重新渲染一遍:换风格、换光、换掉画面里的某个物体,而原本的运动和节奏被保留下来。难点从来不是新观感,而是让这套观感在每一帧上都一模一样。
vid2vid · v2v · video to video ai · 视频风格化 · 视频重绘
补帧(Frame Interpolation)
补帧(frame interpolation)是在已有的两帧之间合成新帧,用来提高片子的帧率,或者把它拉成慢动作。现代做法会先估算每个像素在两帧之间怎么移动,再沿着这个运动方向渲染中间帧,而不是把两张图叠在一起做溶解。
frame interpolation · video frame interpolation · 插帧 · 提帧率 · 中间帧
超分放大(Upscaling)
超分放大(upscaling)是把图像或视频的像素尺寸变大。传统重采样只是把已有像素撑开,越大越糊;AI 超分(super resolution)则用模型合成源文件里本来不存在的细节,所以它能比原图更锐,也正因如此它可能悄悄改掉一张脸。
upscaling · super resolution · 超分辨率 · AI 放大 · 图片放大
逐帧抠像(Rotoscoping)
逐帧抠像(rotoscoping)是把运动主体逐帧从背景里分离出来的工序,产出的是一张可用于合成的 alpha 遮罩。它最早是把实拍胶片一帧帧投在玻璃板上描出来,如今主要由分割与抠像模型自动给出遮罩,人工只负责修。
rotoscoping · alpha matte · 抠像 · 绿幕 · 转描
风格迁移(Style Transfer)
风格迁移(style transfer)是把一张图的观感,也就是它的配色、笔触、肌理和光感,套到另一张图的内容上。早期的神经风格迁移是直接对一张输出做两路损失的优化;现在的扩散管线用风格参考图或提示词完成同一件事,更快更灵活,但对肌理的复制不再那么字面。
神经风格迁移 · 风格参考 · style transfer · 图像风格化