这个坑是怎么来的
把「人觉得舒服的程度」对「看起来有多像人」画出来,你不会得到一条直线。舒适感在风格化的脸上一路上升,穿过卡通和木偶的区间继续升,然后在快到照片级真实之前直接掉下悬崖,只有当它和真人已经无法区分时才重新回升。这段崩塌就是恐怖谷,而「谷」这个字是有实际含义的:对面确实有一道坡,而多数合成人从来没爬上去过。
通常的解释是类别混淆。大脑对归类为「物」的东西跑一套便宜的通用识别,对归类为「人」的东西跑一套专门而且苛刻的人脸与身体流程。风格化让角色留在「物」那一桶里;照片级真实把它挪进「人」那一桶,于是一套完全不同、挑剔得多的检查开始生效。图像本身没有变差,变的是它被拿去比对的标准。
真正触发它的那些线索
这些线索权重完全不平均,知道顺序能省掉大量重摇。
- 眼睛。 瞳孔不随光变化、视线没有真正汇聚在任何东西上、不眨眼或者像节拍器一样眨。这是最强的单一线索。
- 嘴和牙。 下巴在动而牙列僵着不动、唇上没有湿润感、口型比声音早一点或晚一点到。
- 皮肤。 没有毛孔、没有细小绒毛、耳朵和鼻孔边缘没有透光。皮肤读起来像上过漆的塑料。
- 运动。 转头到位后没有那一下微小的回稳、呼吸从不带动肩膀、速度过于均匀。视频里一秒之内就露馅。
- 不对称。 真人的脸都是歪的。一张完全镜像对称的脸,即使其他线索全对,也依然让人发毛。
注意这五条里有四条说的是「缺少瑕疵」,不是「多了什么」。这就是可操作的那条结论。
为什么 AI 生成的人特别容易掉进去
图像和视频模型被训练成向「见过的东西的平均值」靠拢,同时又被审美调优推着往「好看」走,这两股力都在远离那些让脸读起来像真人的具体缺陷。你拿到的是对称的五官、无瑕的皮肤、均匀的光和一个中性愉悦的表情,而这正好是谷底的正中央。模型不是在真实度上失败,是在理想化上太成功。
视频还有第二个原因。时间平滑是防止画面闪烁的手段,它同时也把真实人体运动里的微小抖动磨掉了。一张脸可以在每一帧上都完美无缺,一动起来却立刻不对,因为那段运动里没有噪声。
提示词和调度上怎么绕开
有两条路管用,而且方向相反。一个项目里只选一条,不要取中间值,因为中间就是谷底。
往风格化退。 直接要插画、赛璐璐上色、图像小说质感、木偶、可见的笔触。你放弃了照片级的可信度,换来一个观众根本不会拿去当人审查的角色。
或者追求「具体」而不是「精致」。 需要照片级输出时这才是有用的一招:把你想要的瑕疵点名写出来 —— visible skin texture and pores、slight asymmetry in the eyes、one strand of hair out of place、natural blink。再加上真实的光学语境,因为镜头和光线的措辞和训练集里那些没被理想化的照片高度相关:50mm at f/2、soft window light、documentary realism。要避开的恰恰是那些夸奖式的词:beautiful、perfect skin、flawless、8k hyperrealistic。
带对白的镜头,最快的一招往往根本不在提示词里:把景别生成得比你需要的稍微宽一点。脸之所以在特写里显得诡异,是因为那些线索大到足以被逐个检视;中景能藏掉模型在眼睛和牙齿上犯的大部分错,同时把表演保住。