AI 生成任务

什么是恐怖谷(uncanny valley)?

又称 恐怖谷效应, uncanny valley, 诡异谷

恐怖谷指的是当一个合成的人脸或人体「接近真人但又不完全是」时,观众的舒适感会突然掉下去:风格化的角色能接受,真人能接受,可两者之间那个几乎完美的版本让人不适。绝大多数 AI 生成的人,都掉在这个坑里。

这个坑是怎么来的

把「人觉得舒服的程度」对「看起来有多像人」画出来,你不会得到一条直线。舒适感在风格化的脸上一路上升,穿过卡通和木偶的区间继续升,然后在快到照片级真实之前直接掉下悬崖,只有当它和真人已经无法区分时才重新回升。这段崩塌就是恐怖谷,而「谷」这个字是有实际含义的:对面确实有一道坡,而多数合成人从来没爬上去过。

通常的解释是类别混淆。大脑对归类为「物」的东西跑一套便宜的通用识别,对归类为「人」的东西跑一套专门而且苛刻的人脸与身体流程。风格化让角色留在「物」那一桶里;照片级真实把它挪进「人」那一桶,于是一套完全不同、挑剔得多的检查开始生效。图像本身没有变差,变的是它被拿去比对的标准。

真正触发它的那些线索

这些线索权重完全不平均,知道顺序能省掉大量重摇。

  • 眼睛。 瞳孔不随光变化、视线没有真正汇聚在任何东西上、不眨眼或者像节拍器一样眨。这是最强的单一线索。
  • 嘴和牙。 下巴在动而牙列僵着不动、唇上没有湿润感、口型比声音早一点或晚一点到。
  • 皮肤。 没有毛孔、没有细小绒毛、耳朵和鼻孔边缘没有透光。皮肤读起来像上过漆的塑料。
  • 运动。 转头到位后没有那一下微小的回稳、呼吸从不带动肩膀、速度过于均匀。视频里一秒之内就露馅。
  • 不对称。 真人的脸都是歪的。一张完全镜像对称的脸,即使其他线索全对,也依然让人发毛。

注意这五条里有四条说的是「缺少瑕疵」,不是「多了什么」。这就是可操作的那条结论。

为什么 AI 生成的人特别容易掉进去

图像和视频模型被训练成向「见过的东西的平均值」靠拢,同时又被审美调优推着往「好看」走,这两股力都在远离那些让脸读起来像真人的具体缺陷。你拿到的是对称的五官、无瑕的皮肤、均匀的光和一个中性愉悦的表情,而这正好是谷底的正中央。模型不是在真实度上失败,是在理想化上太成功。

视频还有第二个原因。时间平滑是防止画面闪烁的手段,它同时也把真实人体运动里的微小抖动磨掉了。一张脸可以在每一帧上都完美无缺,一动起来却立刻不对,因为那段运动里没有噪声。

提示词和调度上怎么绕开

有两条路管用,而且方向相反。一个项目里只选一条,不要取中间值,因为中间就是谷底。

往风格化退。 直接要插画、赛璐璐上色、图像小说质感、木偶、可见的笔触。你放弃了照片级的可信度,换来一个观众根本不会拿去当人审查的角色。

或者追求「具体」而不是「精致」。 需要照片级输出时这才是有用的一招:把你想要的瑕疵点名写出来 —— visible skin texture and poresslight asymmetry in the eyesone strand of hair out of placenatural blink。再加上真实的光学语境,因为镜头和光线的措辞和训练集里那些没被理想化的照片高度相关:50mm at f/2soft window lightdocumentary realism。要避开的恰恰是那些夸奖式的词:beautifulperfect skinflawless8k hyperrealistic

带对白的镜头,最快的一招往往根本不在提示词里:把景别生成得比你需要的稍微宽一点。脸之所以在特写里显得诡异,是因为那些线索大到足以被逐个检视;中景能藏掉模型在眼睛和牙齿上犯的大部分错,同时把表演保住。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Close-up portrait of a woman speaking to camera, soft window light from frame left, visible skin texture and pores, slight asymmetry in the eyes, one strand of hair out of place, natural blink, shot on 50mm at f/2, documentary realism

试一下:恐怖谷

打开生成器,参数已经预填好。

常见问题

恐怖谷这个概念是谁提出的?
日本机器人学者森政弘 1970 年在讨论义肢和人形机器人时提出。他把舒适感对「拟人程度」画成曲线,发现在快要接近真人之前有一个陡降。英文名 uncanny valley 来自 1978 年那篇文章的英译。
为什么「几乎像人」比「明显是假的」更让人不舒服?
因为拟人程度会切换你用哪套感知系统。卡通被当成画,脸上的任何东西都不会拿去和真人比对;照片级真实会被当成人,于是你处理真实人脸和动作的那套机制被激活,而那套机制对微小误差极其敏感。
最容易触发它的线索是哪些?
先是眼睛和嘴,然后是运动。死掉的或者时机不对的眼神、从不发生的眨眼、下巴在动而牙齿一成不变、皮肤没有毛孔也没有次表面透光,都是常见元凶。视频里,「动得太顺滑」比任何一张静止图都更快暴露问题。
把真实度做得更高,能爬出恐怖谷吗?
有可能,但这是贵的那条路。爬上对面那道坡意味着所有线索必须同时正确,因为只要一个线索错了,整个镜头就会被拽回谷底。往风格化方向退反而更便宜也更稳:明确的插画感或者略带图形感的处理,本来就站在谷的安全那一侧。
声音也有恐怖谷吗?
有,机制一样。音素都对但语调平、呼吸位置不对、完全没有口腔杂音的合成语音,处在同一个坑的听觉版本里。听众的描述通常是「空」,而不是「机械」。
它是文化性的还是普遍的?
这个下跌在各类研究里都出现,但深度和位置会移动。对动画的熟悉程度、语境给出的预期、甚至角色是怎么被介绍出场的,都会改变观众的容忍度。所以不存在一条可以照着设计的固定界线,找真人试看比坐着推理更管用。

相关术语