模型到底在算什么
最粗暴的补帧是把相邻两帧做平均。结果是双重曝光:所有动过的东西都出现两个半透明副本,比它想修的卡顿更难看。
真正的补帧先解运动。模型会估出一个稠密的位移场,描述 A 帧里每个像素跑到了 B 帧的哪里,然后把两帧各沿这个位移场推进一半,再融合起来,最后把两帧都解释不了的空洞填上。所以补帧的质量几乎等同于运动估计的质量:位移场对了,中间帧看起来像拍出来的;位移场错了,就是大家一眼能认出来的那种融化、发橡皮感的画面。
三种活,同一套工具
- 提帧率。 24fps 转 60fps 让屏幕上更顺,或者 25 转 24 满足交付规格。时长不变。
- 升格慢动作。 给没有用高速摄影拍的素材做变速。时长被拉长,帧率不变。24fps 素材放慢 4 倍,意味着四帧里有三帧是模型造的。
- 关键帧插值。 两张固定的图,中间全部合成。这就是首尾帧视频模型在做的事,本质仍是补帧,只是要跨的间隔比一帧的运动量大得多。
第三种难度高一个数量级。相邻帧之间补,是在猜 40 毫秒的空隙;相隔几秒的两张图之间补,是要编造一段说得通的动作,那已经是生成,不是重建。
哪些情况一补就露馅
| 场景 | 你会看到什么 |
|---|---|
| 运动幅度超出模型追踪范围 | 扭曲、拉丝、四肢被抻长 |
| 遮挡与解遮挡 | 物体边缘出现光晕和残影 |
| 细密重复结构 | 栅栏、栏杆在抖或者弯 |
| 文字与 logo | 字形在扭动,最快被看出来的一处 |
| 片段中间有硬切 | 切点变成一段变形过渡 |
最后一条每次跑之前都值得检查。如果补帧范围里包含一个镜头切点,模型会把两张毫无关系的图当成连续帧,产出一段涂抹式转场。先按切点把时间线切开,每个镜头单独补。
补帧在 AI 视频流程里的位置
生成视频让补帧比在实拍时代更有用,原因有两个。
一是成本。很多视频模型按帧或按秒计费,先用低帧率生成再补帧是实打实的省钱。12fps 生成后补到 48fps,只花原生 48fps 的四分之一,运镜平缓的镜头几乎看不出差别。主体运动剧烈时就看得出来,所以要拿你最难的那个镜头去测,不要拿最容易的。
二是运动节奏。有些模型出来的片子即使标称 24fps,运动也有台阶感,因为它实际的时间采样比容器帧率更低。补一次 2 倍就能把节奏抹顺,内容一点没动。
工序顺序上的实用结论:先生成,再补帧,再放大,最后调色。放大之后再补帧,等于让模型在一堆凭空造出来的细节上估运动,还要为同一件事付更大的算力。
怎么验收
补帧要靠逐段拖看,不是靠正常速度看完。用四分之一速播放,盯三个地方:画面里运动最快的物体、一个物体从另一个物体前经过的那条边、任何文字。这三处稳住,其余都不会有问题。稳不住,就降倍数、按切点切开,或者干脆接受原来的节奏 —— 原始节奏几乎总比一次失败的补帧好看。