一个人能不能拍一支 AI 短片?分镜、角色一致性、镜头衔接的实操答案

一个人能不能拍一支 AI 短片?分镜、角色一致性、镜头衔接的实操答案

教程发布于

能。但不是所有部分都能。

我用一个极简故事试了一遍:一个男人在旧外套口袋里摸到一张字条。8 个镜头,一个人,从一句话写到能连起来看的成片。下面把每一步的做法、卡住的地方和确切的代价都写出来。

一个人能拍完哪些部分,哪些拍不完

先说结论,免得你抱着错的期待往下读。

现在一个人能独立完成的:分镜、角色形象和角色一致性、每个镜头的画面、镜头之间的衔接、配音和口型。这些以前需要摄影、灯光、美术、演员,现在确实能一个人在桌面上做完。

现在还完成不了的:超过 5 秒的连续复杂动作、需要精确对上台词节奏的表演、画面里出现可读文字的镜头(后面会讲为什么)、以及任何需要真实场地和真人反应的内容。

所以 AI 短片目前最适合的长度是 30 秒到 2 分钟,由若干个短镜头拼起来。想一镜到底拍三分钟长镜头,现在别试 —— 这不是提示词写得不够好,是 AI 短片这条路径当下的物理上限。

怎么把一段文字变成分镜?

分镜是整支 AI 短片里最该先做、也最省钱的一步 —— 它便宜、快,而且能在你花大钱出成片之前就暴露故事的问题。

做法很直接:把故事拆成一句一个镜头,每句写清三件事 —— 景别、动作、光。然后用 AI 图像生成 出一版铅笔感的缩略图。

一支 AI 短片的 8 格分镜表,铅笔缩略图风格

我这 8 格是这么拆的:全景交代房间 → 中景取下外套 → 特写手伸进口袋 → 特写掌心里的字条 → 中景抬头看窗外 → 全景穿外套走向门 → 门推开进晨光 → 远景背影走进街道。

AI 分镜阶段有个反常识的建议:别追求画得好。这一步只验三件事 —— 故事说不说得通、景别有没有变化、有没有多余的镜头。画得越糙,你越容易舍得删。我第一版有 11 格,删到 8 格之后节奏才对。

怎么让同一个角色在每个镜头都不变脸?

角色一致性是 AI 短片最容易崩的地方,也是我花时间最多的一步。

答案是:先做一张角色卡,后面每个镜头都拿它当参考,不要靠提示词描述人脸。角色一致性靠的是同一张参考图反复使用,不是靠把描述写得更细。

AI 短片的角色卡:同一个人的正面、四分之三侧、全侧、背面四个角度

我先出一张干净的正面定妆照 —— 灰底、均匀光、素颜、不带情绪,就像试镜照。然后以它为参考补出四分之三侧、全侧和背面。这四张就是这支短片的"演员",后面每一个镜头都喂这张卡。

三条实操经验:

别用文字描述脸。「三十多岁、短黑发、有胡茬」这种描述能生成一百个不同的人。脸交给参考图,提示词只写这一镜要改的东西。

**背面和侧面要提前出。**等你拍到背影那一镜才去生成,大概率和正面不是同一个人。

**衣服写进每一条提示词。**角色一致性不只是脸,外套的颜色和款式一漂,观众照样看出接不上。这三条做到了,一支 AI 短片的角色一致性基本就稳了。

镜头之间怎么衔接才不跳?

最省力的办法是让上一镜的末帧直接当下一镜的首帧

上一镜末帧作为下一镜首帧的衔接示意:两帧构图、光线、色调完全延续

上面这两帧是同一个动作的前后半段:左边是他低头看字条,右边是他抬起头看向窗外。构图没动、光的方向没动、色调没动,只有头的角度和眼神变了 —— 剪在一起就是一个连贯的反应镜头。

首尾帧生成视频 把这两帧作为起点和终点,中间的过渡由模型补。这比让模型自己"演"一段完整动作稳得多,角色一致性也更容易保住 —— 两头都是你定好的画面,模型只负责中间。

衔接还有两个细节容易被忽略:光的方向必须一致。上一镜光从左边来,下一镜就不能从右边来,否则观众说不出哪里怪但就是觉得不对。色调要统一。我这 8 个镜头统一写了「清晨冷调」,写在每一条提示词里,不指望后期救。

怎么一次看完所有镜头,只改坏的那几个?

单张点开看会骗人 —— 每一张单独看都不错,连起来才发现第三镜的脸偏了。

我的做法是把 8 个镜头全铺在 生成式画布 上,按顺序排成一行,退远了看。角色一致性的问题在一行里最好抓 —— 哪一镜的脸飘了、哪一镜的光不对,横着一扫就出来了。不满意的单独重跑那一格,不用推倒整条。

一支 AI 短片的 8 个成片镜头,统一清晨冷调

这是我最后的 8 个镜头。第 3 镜的手重跑过两次,第 7 镜的逆光调过一次曝光。

声音怎么办?

画面到这一步就完了,但没有声音的 AI 短片撑不住 30 秒以上。

我这支是无台词的,所以只用了环境声。有台词的话顺序是:先用 AI 配音 出人声,或者用 声音克隆 复刻一个固定音色,再走 口型对齐 把嘴型贴上去。

顺序别倒过来 —— 先出画面再配音,你会发现嘴型和台词长度对不上;先定音频长度,画面按音频时长生成,返工少得多。

让画面动起来的边界在哪?

由一个镜头生成的 5 秒动态:他握着字条,眨眼,视线沿窗外移开

这 5 秒是从上面那一镜生成的:呼吸、一次眨眼、视线移开一点、眉头轻微收紧。

我试过让他"转身走向门口",连着做了三次都变形 —— 走两步之后脸就不是他了,角色一致性在动态里比在静帧里脆弱得多。所以边界很清楚:让人物在原地有细微反应,可靠;让人物完成一段位移或复杂动作,现在还不行。需要走动的镜头,我改成先出末帧,再用首尾帧过渡,而不是让模型自己演。

三处翻车,如实记录

画面里的字是假的。 我那张字条特写,放大看纸上的"字"全是乱码 —— 生成模型写不出可读文本。要么别拍清楚(虚焦、遮住一半),要么后期自己贴真字。这是目前最硬的限制之一。

手仍然要挨个查。 第 3 镜手伸进口袋那一格,第一版有一根手指的关节位置不对,重跑两次才拿到能用的。凡是手进画面的镜头都得放大看一遍。

连续动作会掉脸。 上面说过,超过两三秒的位移基本必崩,角色一致性是第一个失守的。

一份可抄的 8 镜头清单

按这个顺序做,基本不返工:

  1. 故事拆成一句一镜,每句写清景别、动作、光
  2. 出一版粗糙分镜,删到只剩必要的镜头
  3. 做角色卡锁死角色一致性:正面定妆 + 四分之三侧 + 全侧 + 背面
  4. 按分镜逐镜出图,每镜都喂角色卡,统一写死色调
  5. 需要衔接的地方,先出末帧再出首帧
  6. 全部铺在画布上横向比对,只重跑坏的
  7. 定音频长度,再让画面对齐音频
  8. 逐镜放大查手、耳朵、画面里的文字

整支 8 镜头的 AI 短片我用了约三小时,绝大部分时间在写提示词和挑片,生成本身很快。角色一致性和镜头衔接这两件事,做熟了之后每镜大概能省一半时间。

这个水平做片头、概念片、提案用的样片已经够了;要交付给客户的正片,我还是会用真实拍摄加 AI 补镜头的混合做法。想自己走一遍 AI 短片的流程,从 AI 视频生成 开始就行,起点只需要一句话。

分享