AI 生成任务

补帧详解:提帧率、升格与中间帧

又称 frame interpolation, video frame interpolation, 插帧, 提帧率, 中间帧

补帧(frame interpolation)是在已有的两帧之间合成新帧,用来提高片子的帧率,或者把它拉成慢动作。现代做法会先估算每个像素在两帧之间怎么移动,再沿着这个运动方向渲染中间帧,而不是把两张图叠在一起做溶解。

模型到底在算什么

最粗暴的补帧是把相邻两帧做平均。结果是双重曝光:所有动过的东西都出现两个半透明副本,比它想修的卡顿更难看。

真正的补帧先解运动。模型会估出一个稠密的位移场,描述 A 帧里每个像素跑到了 B 帧的哪里,然后把两帧各沿这个位移场推进一半,再融合起来,最后把两帧都解释不了的空洞填上。所以补帧的质量几乎等同于运动估计的质量:位移场对了,中间帧看起来像拍出来的;位移场错了,就是大家一眼能认出来的那种融化、发橡皮感的画面。

三种活,同一套工具

  • 提帧率。 24fps 转 60fps 让屏幕上更顺,或者 25 转 24 满足交付规格。时长不变。
  • 升格慢动作。 给没有用高速摄影拍的素材做变速。时长被拉长,帧率不变。24fps 素材放慢 4 倍,意味着四帧里有三帧是模型造的。
  • 关键帧插值。 两张固定的图,中间全部合成。这就是首尾帧视频模型在做的事,本质仍是补帧,只是要跨的间隔比一帧的运动量大得多。

第三种难度高一个数量级。相邻帧之间补,是在猜 40 毫秒的空隙;相隔几秒的两张图之间补,是要编造一段说得通的动作,那已经是生成,不是重建。

哪些情况一补就露馅

场景你会看到什么
运动幅度超出模型追踪范围扭曲、拉丝、四肢被抻长
遮挡与解遮挡物体边缘出现光晕和残影
细密重复结构栅栏、栏杆在抖或者弯
文字与 logo字形在扭动,最快被看出来的一处
片段中间有硬切切点变成一段变形过渡

最后一条每次跑之前都值得检查。如果补帧范围里包含一个镜头切点,模型会把两张毫无关系的图当成连续帧,产出一段涂抹式转场。先按切点把时间线切开,每个镜头单独补。

补帧在 AI 视频流程里的位置

生成视频让补帧比在实拍时代更有用,原因有两个。

一是成本。很多视频模型按帧或按秒计费,先用低帧率生成再补帧是实打实的省钱。12fps 生成后补到 48fps,只花原生 48fps 的四分之一,运镜平缓的镜头几乎看不出差别。主体运动剧烈时就看得出来,所以要拿你最难的那个镜头去测,不要拿最容易的。

二是运动节奏。有些模型出来的片子即使标称 24fps,运动也有台阶感,因为它实际的时间采样比容器帧率更低。补一次 2 倍就能把节奏抹顺,内容一点没动。

工序顺序上的实用结论:先生成,再补帧,再放大,最后调色。放大之后再补帧,等于让模型在一堆凭空造出来的细节上估运动,还要为同一件事付更大的算力。

怎么验收

补帧要靠逐段拖看,不是靠正常速度看完。用四分之一速播放,盯三个地方:画面里运动最快的物体、一个物体从另一个物体前经过的那条边、任何文字。这三处稳住,其余都不会有问题。稳不住,就降倍数、按切点切开,或者干脆接受原来的节奏 —— 原始节奏几乎总比一次失败的补帧好看。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

查看全部 23 个模型

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Interpolate this 12fps clip to 48fps, keeping the whip pan sharp and avoiding ghosting around the subject hands

试一下:补帧(Frame Interpolation)

打开生成器,参数已经预填好。

常见问题

补帧和升格慢动作是一回事吗?
用的是同一套机制,目的不同。提帧率是加帧但保持时长,24fps 变 60fps,片子还是两秒;升格是加帧但保持帧率,片子被拉长。两者都要造出同样的中间帧。
补帧能补出细节吗?
不能。它只是把时间维度上已有的信息重新分配。如果一只快速挥动的手在前后两帧里都是一团糊,中间造出来的每一帧也一样糊。补帧解决的是时间采样,不是清晰度或分辨率。
该补 2 倍还是 4 倍?
从 2 倍开始。每翻一倍,每张合成帧能依据的真实信息就更少,误差会累积。12fps 补到 48fps 意味着四帧里有三帧是造的,四肢和边缘的扭曲这时就很明显了。
为什么手和边缘看起来像融化的橡皮?
那是运动估计失败。当某个物体两帧之间移动的距离超过模型能追踪的范围,或者被别的物体挡住,它没有正确答案,就把两种可能混在一起。快速摆动的四肢、遮挡、栅栏这类细条纹结构是常见元凶。
关键帧插值和补帧是同一件事吗?
动画里的关键帧插值是把动画师定好的两个姿态之间补齐,操作相同,只是两端由人来定。AI 视频里给模型一张首帧和一张尾帧,本质就是这件事的放大版:你钉住两头,模型解出中间的路径。
为什么补完的片子有种电视剧感?
因为 24fps 的运动模糊本身就是电影感的一部分,帧率一高,眼睛读作「胶片」的那种频闪就消失了。这是审美问题不是技术问题。补帧用来做慢动作或真的要交付高帧率,不要用来「让 24fps 更好看」。

相关术语