关键是垂直,不是高
区分它的是镜头角度,不是高度。机位在五十米高但镜头下俯 40 度,画面里仍然有地平线、仍然看得见脸,世界仍然保留着上和下的方向感。把同一台机器转成正对地面,图像就换了类别:没有可以用来定位的地平线,没有前景后景,只剩一个表面和摆在上面的东西。
这种压平正是它读起来疏离的原因。我们从来不这样看世界,所以画面里不存在一个站在某处的观察者 —— 这也是它另一个旧称「上帝视角」的来处。
它擅长什么
- 图案与摆放关系。 车流、人群、编舞、摆好的餐桌。任何含义在布局而不在个体身上的东西。
- 无力感。 一个人独自处在大片平面上,读起来的渺小和暴露,是仰角和普通俯角都做不到的。
- 空间交代。 一个顶视画面解释房间格局的速度,比任何数量的分镜都快,所以它常出现在盗窃片和战争段落里。
- 手与流程。 做菜、手术、组装、写字。垂直视角是展示一双手在台面上工作最清楚的方式。
- 标点作用。 因为它和眼高分镜天然接不上,它更适合当开场或者句号,而不是段落中间一个普通机位。
在 AI 视频里怎么写提示词
这个构图有点特别:描述起来很容易,拿到却意外地难,因为「应该」产生它的那些词在训练数据里挂着错误的素材。标着 aerial 或 drone 的片段大多是带地平线的斜视,所以直白地要一个顶视,结果往往落在 30 到 45 度。
真正能把结果推到垂直的做法:
- 把几何关系写成数字:
camera directly above, pointing straight down at 90 degrees。这个数字是真的在起作用。 - 写出后果,不只是写机位:
no horizon visible, the ground fills the frame,或者subject's shadow directly beneath them。描述「垂直镜头意味着什么」比描述镜头本身更可靠。 - 物件类直接用
flat lay。 桌面、食物、工具、文件,这一个词比任何方位描述都强,因为产品摄影提供了海量标注正确的顶视训练数据。 - 躺着比站着好拍。 躺在地上的人从上方渲染得很干净;站着的人从正上方看是强烈的透视压缩,模型处理得很差:头会胀大、腿会消失,身体经常偷偷转回半正面。
- 给地面一点图形结构:停车线、地砖、路面标线、地毯图案。没有这些,画面缺少尺度和高度的线索,经常退化成一个含义不明的特写。
- 运动保持简单。 缓慢垂直下降,或者画面缓慢旋转,这两种都稳。一边下降一边横移还要保持向下看,通常会在画面边缘拖出糊影。
有两种失败模式值得点名。一是镜头在片段中途悄悄抬回去、地平线重新出现,这是模型退回训练数据的平均值。二是人物透视错误:从上方本该看到头顶和肩膀,模型却经常渲染出一张能认出来的脸,因为脸正是它最擅长生成的东西。把机位再抬高、让人物在画面里小一些、并且写上 tops of heads visible,都能减轻这个问题。