逐帧抠像最终产出的是什么
逐帧抠像的产物是一张遮罩:逐帧的灰度图,白色表示这个像素留下,黑色表示丢掉,灰色表示按比例混合。这张遮罩会成为抠出素材的 alpha 通道,所以交付物通常直接叫 alpha 遮罩。后面所有环节都依赖它,无论你是要把主体贴到新背景上、只给主体单独调色,还是换天空。
这个词来自「rotoscope」,一台把实拍胶片一帧帧投到玻璃板上、供动画师描摹的投影机。Max Fleischer 在 1917 年为它申请专利,目的是让小丑 Koko 动得像真人。机器早就没了,它创造出来的工种还在:一个抠像镜头的本质,仍然是有人逐帧决定主体的边界到底在哪。
逐帧抠像 vs 绿幕
| 绿幕抠像 | 逐帧抠像 | |
|---|---|---|
| 前提 | 能控制拍摄 | 只要有素材 |
| 依据 | 颜色分离 | 形状与运动 |
| 耗时 | 几分钟 | 数小时,或一轮 AI 加修补 |
| 头发 | 灯光干净时不错 | 需要软遮罩输出 |
只要拍摄是你控制的,绿幕永远更划算。逐帧抠像是「没人给你拍绿幕」时的解法:档案素材、纪录片素材、航拍素材,或者一段本来就不存在可分离背景的 AI 生成片子。生产环境里两者很少是二选一,通常是绿幕解决主体,roto 遮罩去补那些绿幕太暗、离主体太近、或者绿色溢到肩膀上的位置。
AI 抠像强在哪、弱在哪
AI 抠像分两步走:先由分割模型在某一帧上给出主体区域,再由跟踪器依据运动估计把这块区域向后传播,这样你不用在 240 帧上一帧帧点。有的工具接受一句文字标签,有的接受一次点击,有的接受你在第一帧画的粗遮罩。
主体反差大、全身入画、运动不算剧烈、压缩不重的素材,它表现很好。它翻车的方式也足够稳定,可以提前规划:
- 头发、毛发、烟雾、网纱。 这些像素确实一半是主体一半是背景。二值遮罩表达不了,必须用真正的抠像输出。
- 运动模糊。 模糊的手根本没有边可找。自动遮罩往往直接从模糊中间切开,留下一条被砍断、还在频闪的手臂。
- 遮挡。 主体从柱子后面走过,跟踪器经常丢失身份,出来时把柱子一起带走。
- 低反差。 深色外套配深色门洞,就是边缘开始逐帧抖动的地方。
- 重压缩。 块效应会给模型一条画面里其实不存在的边。
边缘抖动是业余作品最容易露馅的一处。观众说不出哪里不对,但立刻会觉得「廉价」。解法几乎从来不是换一条更好的提示词,而是对遮罩做时域平滑,或者每 8 到 12 帧手修一个关键帧让跟踪器在中间插值。
抠像在 AI 流程里的新位置
过去抠像是合成前的最后一步,现在它更像是别的生成任务的前置步骤:
- 换背景。 先抠出主体,再对身后的背景做局部重绘。
- 只重绘画面的一部分。 把遮罩作为 mask 传给视频编辑模型,让它改环境而不动演员。
- 保护人脸或 logo。 把遮罩当作排除区,避免放大或风格化那一轮凭空换掉一张脸。
- 攒可复用素材。 带透明通道的抠图能丢进任何后续镜头,一张压平的帧不能。
最后一点才是即使不做合成也值得出遮罩的理由。有遮罩,「重跑这段视频」就变成了「重跑这段视频的这一部分」,这是买彩票和做剪辑的区别。
实操清单
- 用手里压缩最轻的源,按满分辨率工作。
- 先按镜头切点把片段切开。跟踪器过不了硬切。
- 先抠面积大、形状简单的区域,头发和模糊单独走一轮软输出。
- 用正常速度回看,而不是逐帧看。静帧上看不见的抖动,24fps 下一眼就能看到。
- 遮罩单独存文件。烘进合成里,等背景一换就得重做一遍。