
给静音片段补声音
AI 生成的视频没有声音,配上匹配的音效再交付。
上传一段无声视频,AI 读画面自动配上匹配的声音 —— 脚步、环境、动作声一起给,不用逐个音效去找。
模型分析视频里发生了什么,生成对应的声音 —— 不用你逐个动作描述该有什么音效。
环境底噪和动作声一起给,整段画面的声音一次到位,不用一条条音效叠。
大部分视频模型只出画面不出声音,这一页正是补这一步的。
生成的音频本来就是按这段画面做的,时间点自然对齐,不用手动挪。

AI 生成的视频没有声音,配上匹配的音效再交付。

画面显得「空」的时候,一层环境声就能让它落地。

画面里的脚步、碰撞、开关,按画面时间点配上声音。

有画面有声音才是完整的片子,这一步补上再导出。
打开 AI 视频音效生成,上传要配声音的视频。
需要的话补一句描述,说明想要什么样的声音氛围。
生成后下载,或者送进画布接着剪。
用 AI 生成视频,最容易被忽略的落差不在画质,而在声音:大部分视频模型只出画面。一段没有声音的片子,哪怕画面很好,看起来也总是"空"的 —— 缺的是让画面落地的那层环境声。
补声音的传统做法是翻音效库:找环境声、找脚步、找碰撞,再一条条对到时间轴上。声音本身不难找,难的是对齐 —— 每个动作发生在第几帧,得一个个数。
这一页把这件事反过来做:把视频交给它,模型读画面里发生了什么,生成对应的声音。时间点是从画面里读出来的,所以本来就对齐。
这是它和音效生成最大的区别。音效生成是「你说什么它做什么」,这一页是「它看到什么就做什么」。
所以你可以补一句描述引导氛围(室内还是室外、安静还是嘈杂),但主要判断来自画面。画面里没有的东西,很难靠描述让它出现 —— 想要画面之外的声音,用音效生成单独做一条更直接。
人声也是同理:这一页给的是环境和动作声。需要清晰台词的话,用文字转语音单独生成,再和这层音效一起放进画布。
把它放在流程的最后一步:画面定稿之后再配声音。因为它是读画面生成的,画面一改,声音就得重做。
一个实用的分层:先用这一页把整段的环境和动作声铺上,再用音效生成单独补几个想强调的声音,最后如果需要配乐和台词,各自生成后在画布里混到一起。这样每一层都可控,也不用为了改一个声音重跑整段。
音效生成是你描述一个声音,它给你那个声音 —— 适合要某一个具体音效的时候。这一页是反过来的:你给画面,它读画面决定该有什么声音。要给整段视频一次配齐用这一页,要某个特定的一声用音效生成。
会,因为音频本来就是按这段画面生成的,动作发生的时间点是从画面里读出来的。这也是它比自己找音效再对时间轴省事的地方。
可以补一句描述来引导氛围,比如说明是室内还是室外、安静还是嘈杂。但主要判断还是来自画面 —— 画面里没有的东西,很难靠描述让它出现。
主要是环境和动作声。需要清晰的台词用文字转语音单独生成,再和这层音效一起放进画布。要让画面里的人物口型对上台词,用口型同步。
视频音效
Video*
Sound Effect Prompt
Background Music Prompt