它依赖的那套语法
一个画面本身不会自动变成主观的。把机位架在厨房里的眼高位置,你得到的只是一个厨房的中景。让它归属于某个人的,是它周围的剪辑:角色在看 → 他看到的东西 → 他的反应。这个三拍结构又老又结实,观众几乎察觉不到它的存在;而漏掉第一拍,正是第一人称视角失效最常见的原因。
反应那一拍承担的活比多数人以为的多。它回溯性地把中间那一帧分配给一双眼睛,同时告诉观众该怎么理解刚看到的东西。从一个门口切到微笑,那个门口就是欢迎;切到一个瑟缩,同一个门口就是威胁。
让「主观」成立的几个线索
- 眼高,而不是三脚架高度。 成年人站立眼高大约 1.5 到 1.7 米;孩子的视点在一米上下,光是改这一项,感觉立刻就变了。
- 画面边缘要有身体。 伸进来的手、一侧肩膀、呼吸在玻璃上的雾、枪管、方向盘 —— 任何只有从这个身体内部才能看到的东西。
- 运动要不完美。 轻微摆动、转身前的一顿、头比眼睛晚到一点。完全平滑的运动读起来是无人机,不是人。
- 遮挡。 门框、头发、起雾的眼镜、挡太阳的手。真实视觉大部分时间都是被部分挡住的。
- 看的动机。 画面应该朝一个人接下来真的会去看的东西移动,而不是均匀地扫过整个房间。
什么时候值得用
恐怖片用主观镜头把观众变成共犯或猎物。动作片把它用在头盔、驾驶舱和拳头上,要的是冲击而不是清晰。剧情片用得很省,通常只放在角色意识到某件事的那一刻,因为这个手法很响,用多了立刻贬值。短视频则把第一人称当默认机位而不是手法,这也是这个词今天有两种含义的原因。
在 AI 视频里怎么写提示词
视频模型看过海量的第一人称素材,所以这个「质感」很容易拿到,「含义」很容易丢。具体有效的做法:
- 用
first-person point of view开头,不要只丢一个缩写,尤其不要写成带冒号的POV:—— 冒号那种写法是字幕惯例,会稳定地把叠加文字带进来。 - 说清是谁的眼睛、在什么高度:
camera at the eye level of a seated child、helmet-mounted view、camera at eye level walking。 - 点名你要出现在画面里的身体部位。
own hands visible at the bottom of the frame reaching for a doorknob是让主观镜头「有身体」而不只是「广角」的最有效一句。 - 加
slight natural head-motion sway, handheld制造人味,焦段用广一点(24mm、18mm),因为人的余光很宽,长焦会把这个效果压平。
要预期的失败模式:画面里冒出一个正对镜头的人,前提直接崩掉;训练数据带来的字幕或水印渗进画面;以及你要求的手指数量出错,所以最好让手部分出画或者保持运动。还有一点必须接受:模型没法替你完成「看—见—反应」的剪辑,所以这段素材只有在和一张脸对切之后才真正成为主观镜头,那张脸得单独生成一段。