
給靜音片段補聲音
AI 生成的影片沒有聲音,配上匹配的音效再交付。
上傳一段無聲影片,AI 讀畫面自動配上匹配的聲音 —— 腳步、環境、動作聲一起給,不用逐個音效去找。
模型分析影片裡發生了什麼,生成對應的聲音 —— 不用你逐個動作描述該有什麼音效。
環境底噪和動作聲一起給,整段畫面的聲音一次到位,不用一條條音效疊。
大部分影片模型只出畫面不出聲音,這一頁正是補這一步的。
生成的音訊本來就是按這段畫面做的,時間點自然對齊,不用手動挪。

AI 生成的影片沒有聲音,配上匹配的音效再交付。

畫面顯得「空」的時候,一層環境聲就能讓它落地。

畫面裡的腳步、碰撞、開關,按畫面時間點配上聲音。

有畫面有聲音才是完整的片子,這一步補上再匯出。
打開 AI 影片音效生成,上傳要配聲音的影片。
需要的話補一句描述,說明想要什麼樣的聲音氛圍。
生成後下載,或者送進畫布接著剪。
用 AI 生成影片,最容易被忽略的落差不在畫質,而在聲音:大部分影片模型只出畫面。一段沒有聲音的片子,哪怕畫面很好,看起來也總是「空」的 —— 缺的是讓畫面落地的那層環境聲。
補聲音的傳統做法是翻音效庫:找環境聲、找腳步、找碰撞,再一條條對到時間軸上。聲音本身不難找,難的是對齊 —— 每個動作發生在第幾格,得一個個數。
這一頁把這件事反過來做:把影片交給它,模型讀畫面裡發生了什麼,生成對應的聲音。時間點是從畫面裡讀出來的,所以本來就對齊。
這是它和音效生成最大的區別。音效生成是「你說什麼它做什麼」,這一頁是「它看到什麼就做什麼」。
所以你可以補一句描述引導氛圍(室內還是室外、安靜還是嘈雜),但主要判斷來自畫面。畫面裡沒有的東西,很難靠描述讓它出現 —— 想要畫面之外的聲音,用音效生成單獨做一條更直接。
人聲也是同理:這一頁給的是環境和動作聲。需要清晰台詞的話,用文字轉語音單獨生成,再和這層音效一起放進畫布。
把它放在流程的最後一步:畫面定稿之後再配聲音。因為它是讀畫面生成的,畫面一改,聲音就得重做。
一個實用的分層:先用這一頁把整段的環境和動作聲鋪上,再用音效生成單獨補幾個想強調的聲音,最後如果需要配樂和台詞,各自生成後在畫布裡混到一起。這樣每一層都可控,也不用為了改一個聲音重跑整段。
音效生成是你描述一個聲音,它給你那個聲音 —— 適合要某一個具體音效的時候。這一頁是反過來的:你給畫面,它讀畫面決定該有什麼聲音。要給整段影片一次配齊用這一頁,要某個特定的一聲用音效生成。
會,因為音訊本來就是按這段畫面生成的,動作發生的時間點是從畫面裡讀出來的。這也是它比自己找音效再對時間軸省事的地方。
可以補一句描述來引導氛圍,比如說明是室內還是室外、安靜還是嘈雜。但主要判斷還是來自畫面 —— 畫面裡沒有的東西,很難靠描述讓它出現。
主要是環境和動作聲。需要清晰的台詞用文字轉語音單獨生成,再和這層音效一起放進畫布。要讓畫面裡的人物嘴型對上台詞,用嘴型同步。
視頻音效
Video*
Sound Effect Prompt
Background Music Prompt