AI 生成任务

逐帧抠像详解:从手描到 AI 抠像

又称 rotoscoping, alpha matte, 抠像, 绿幕, 转描

逐帧抠像(rotoscoping)是把运动主体逐帧从背景里分离出来的工序,产出的是一张可用于合成的 alpha 遮罩。它最早是把实拍胶片一帧帧投在玻璃板上描出来,如今主要由分割与抠像模型自动给出遮罩,人工只负责修。

逐帧抠像最终产出的是什么

逐帧抠像的产物是一张遮罩:逐帧的灰度图,白色表示这个像素留下,黑色表示丢掉,灰色表示按比例混合。这张遮罩会成为抠出素材的 alpha 通道,所以交付物通常直接叫 alpha 遮罩。后面所有环节都依赖它,无论你是要把主体贴到新背景上、只给主体单独调色,还是换天空。

这个词来自「rotoscope」,一台把实拍胶片一帧帧投到玻璃板上、供动画师描摹的投影机。Max Fleischer 在 1917 年为它申请专利,目的是让小丑 Koko 动得像真人。机器早就没了,它创造出来的工种还在:一个抠像镜头的本质,仍然是有人逐帧决定主体的边界到底在哪。

逐帧抠像 vs 绿幕

绿幕抠像逐帧抠像
前提能控制拍摄只要有素材
依据颜色分离形状与运动
耗时几分钟数小时,或一轮 AI 加修补
头发灯光干净时不错需要软遮罩输出

只要拍摄是你控制的,绿幕永远更划算。逐帧抠像是「没人给你拍绿幕」时的解法:档案素材、纪录片素材、航拍素材,或者一段本来就不存在可分离背景的 AI 生成片子。生产环境里两者很少是二选一,通常是绿幕解决主体,roto 遮罩去补那些绿幕太暗、离主体太近、或者绿色溢到肩膀上的位置。

AI 抠像强在哪、弱在哪

AI 抠像分两步走:先由分割模型在某一帧上给出主体区域,再由跟踪器依据运动估计把这块区域向后传播,这样你不用在 240 帧上一帧帧点。有的工具接受一句文字标签,有的接受一次点击,有的接受你在第一帧画的粗遮罩。

主体反差大、全身入画、运动不算剧烈、压缩不重的素材,它表现很好。它翻车的方式也足够稳定,可以提前规划:

  • 头发、毛发、烟雾、网纱。 这些像素确实一半是主体一半是背景。二值遮罩表达不了,必须用真正的抠像输出。
  • 运动模糊。 模糊的手根本没有边可找。自动遮罩往往直接从模糊中间切开,留下一条被砍断、还在频闪的手臂。
  • 遮挡。 主体从柱子后面走过,跟踪器经常丢失身份,出来时把柱子一起带走。
  • 低反差。 深色外套配深色门洞,就是边缘开始逐帧抖动的地方。
  • 重压缩。 块效应会给模型一条画面里其实不存在的边。

边缘抖动是业余作品最容易露馅的一处。观众说不出哪里不对,但立刻会觉得「廉价」。解法几乎从来不是换一条更好的提示词,而是对遮罩做时域平滑,或者每 8 到 12 帧手修一个关键帧让跟踪器在中间插值。

抠像在 AI 流程里的新位置

过去抠像是合成前的最后一步,现在它更像是别的生成任务的前置步骤:

  • 换背景。 先抠出主体,再对身后的背景做局部重绘。
  • 只重绘画面的一部分。 把遮罩作为 mask 传给视频编辑模型,让它改环境而不动演员。
  • 保护人脸或 logo。 把遮罩当作排除区,避免放大或风格化那一轮凭空换掉一张脸。
  • 攒可复用素材。 带透明通道的抠图能丢进任何后续镜头,一张压平的帧不能。

最后一点才是即使不做合成也值得出遮罩的理由。有遮罩,「重跑这段视频」就变成了「重跑这段视频的这一部分」,这是买彩票和做剪辑的区别。

实操清单

  1. 用手里压缩最轻的源,按满分辨率工作。
  2. 先按镜头切点把片段切开。跟踪器过不了硬切。
  3. 先抠面积大、形状简单的区域,头发和模糊单独走一轮软输出。
  4. 用正常速度回看,而不是逐帧看。静帧上看不见的抖动,24fps 下一眼就能看到。
  5. 遮罩单独存文件。烘进合成里,等背景一换就得重做一遍。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 18 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Isolate the dancer from the background and output a clean alpha matte, preserving hair detail and the motion blur on the trailing arm

试一下:逐帧抠像(Rotoscoping)

打开生成器,参数已经预填好。

常见问题

逐帧抠像和绿幕抠像有什么区别?
绿幕靠颜色分离,需要你控制拍摄现场,但几分钟就能出结果;逐帧抠像靠形状和运动,任何素材都能做,代价是时间。实际项目里两者是配合关系:绿幕负责身体,roto 遮罩补绿幕撑不住的地方。
alpha 遮罩是什么?
它是逐帧的灰度图,规定抠出来的每个像素有多不透明:白色保留、黑色丢弃、灰色混合。正是这些灰色值让头发和运动模糊看起来是真的,而不是用剪刀剪出来的。
AI 抠像够专业用了吗?
固定机位、主体和背景反差大的镜头,通常够。但头发、烟雾、运动模糊、主体从物体后穿过这几种情况,它只能给你一张可用的起点遮罩,后面还得手修。把它当前 80% 而不是交付件。
遮罩边缘为什么会抖?
因为遮罩是每帧独立解的,边缘每帧落的位置都差一两个像素。做法是对遮罩做时域平滑、每 8 到 12 帧手修一个关键帧让中间插值,或者把边缘稍微羽化,让抖动落在过渡带里。
头发和运动模糊能抠干净吗?
只有输出软遮罩(带小数不透明度)的抠像模型能做。硬二值遮罩没办法表达「这个像素 40% 是头发」,所以细碎和模糊的区域要么被切掉,要么把背景色一起带出来。
逐帧抠像要花多少时间?
难镜头纯手工是「每秒素材几个小时」的量级。AI 抠像把首轮压到几分钟,于是整个镜头的成本几乎全部转移到了修补环节,而不是最初的抠出动作。

相关术语