
무음 클립에 소리 입히기
AI가 만든 영상은 오디오 없이 도착합니다 — 내보내기 전에 어울리는 소리를 더하세요.
무음 푸티지를 올리면 AI가 화면을 읽고 어울리는 오디오를 만들어 냅니다 — 발소리, 앰비언스, 충격음을 한꺼번에, 찾아다닐 것 없이.
모델이 화면에서 벌어지는 일을 분석해 그에 맞게 생성합니다. 동작마다 효과음을 직접 설명할 필요가 없습니다.
앰비언스 베드와 액션 히트가 함께 도착하므로, 효과음을 하나씩 쌓는 대신 시퀀스 전체에 한 번에 소리가 붙습니다.
대부분의 영상 모델은 소리 없는 화면을 돌려줍니다. 이 페이지가 그 빈틈을 메우는 단계입니다.
바로 이 푸티지를 위해 생성된 오디오라, 손으로 밀지 않아도 소리가 맞는 프레임에 떨어집니다.

AI가 만든 영상은 오디오 없이 도착합니다 — 내보내기 전에 어울리는 소리를 더하세요.

샷이 비어 보일 때, 그것을 땅에 붙여 주는 건 앰비언스 한 겹입니다.

화면 속 발소리, 충격, 스위치 조작음이 각각 실제 프레임에 떨어집니다.

소리가 붙어야 작품이 끝납니다 — 이 레이어를 더한 뒤 내보내세요.
AI 영상 효과음을 열고 소리를 입힐 푸티지를 업로드하세요.
필요하다면 원하는 소리의 분위기를 한 문장으로 덧붙이세요.
결과를 다운로드하거나 캔버스로 보내 편집을 이어가세요.
AI 영상에서 가장 놓치기 쉬운 빈틈은 화질이 아닙니다. 대부분의 영상 모델이 화면만 돌려준다는 점이죠. 소리 없는 클립은 잘 나왔어도 비어 보입니다. 빠진 것은 화면을 땅에 붙여 주는 앰비언스 레이어입니다.
전통적인 해법은 라이브러리 뒤지기였습니다. 룸톤을 찾고, 발소리를 찾고, 충격음을 찾아 하나씩 타임라인에 정렬합니다. 어려운 건 소리를 찾는 게 아니라 맞추는 일입니다. 동작마다 프레임을 세야 하니까요.
이 페이지는 그 순서를 뒤집습니다. 영상을 건네면 모델이 화면에서 벌어지는 일을 읽고 오디오를 생성합니다. 타이밍이 화면에서 나오므로 구조적으로 이미 맞아 있습니다.
효과음 생성기와의 핵심 차이가 여기 있습니다. 그쪽은 말하면 만들고, 여기는 보고 만듭니다.
그래서 한 문장으로 분위기를 유도할 수는 있습니다 — 실내인지 야외인지, 조용한지 북적이는지. 하지만 주된 신호는 푸티지입니다. 화면에 없는 것을 말로 불러내기는 어렵기 때문에, 화면 밖의 소리가 필요하면 효과음 도구로 따로 만드는 것이 직행 노선입니다.
목소리도 마찬가지입니다. 이 페이지가 내주는 것은 앰비언스와 액션 사운드입니다. 알아들을 수 있는 대사가 필요하면 텍스트 음성 변환으로 만들어 캔버스에서 두 레이어를 합치세요.
이 단계는 파이프라인 끝에 두세요. 화면이 확정된 다음에 소리를 붙이는 겁니다. 푸티지로부터 생성하는 구조인 만큼, 화면이 바뀌면 오디오도 다시 만들어야 하기 때문입니다.
실용적인 레이어 구성은 이렇습니다. 클립의 앰비언스와 액션 사운드는 이 페이지로 만들고, 강조하고 싶은 히트 몇 개를 효과음 생성기로 더하고, 음악과 대사는 따로 만들어 캔버스에서 전부 섞는 것. 이러면 각 레이어가 제어 가능한 상태로 남고, 소리 하나를 바꾸려고 전체를 다시 돌릴 필요도 없습니다.
그쪽은 소리를 설명하면 그 소리가 나옵니다. 특정한 효과음 하나가 필요할 때 딱 맞죠. 여기는 반대입니다. 화면을 주면 그 화면을 읽고 무엇이 들려야 하는지 판단합니다. 클립 전체에 한 번에 소리를 입힐 때는 이 페이지를, 특정한 한 방이 필요할 때는 효과음 생성기를 쓰세요.
맞습니다 — 이 푸티지를 위해 생성되었고, 각 동작의 타이밍은 화면에서 읽어 냅니다. 직접 효과음을 찾아 타임라인에 정렬하는 수고를 덜어 주는 것이 이 페이지의 핵심 이점입니다.
한 문장으로 분위기를 유도할 수는 있습니다. 실내인지 야외인지, 조용한지 북적이는지. 다만 주된 신호는 화면이라, 화면에 없는 것을 설명만으로 불러내기는 어렵습니다.
주로 앰비언스와 액션 사운드입니다. 알아들을 수 있는 대사가 필요하면 텍스트 음성 변환으로 따로 만들어 캔버스에서 두 레이어를 합치세요. 화면 속 인물이 그 대사를 말하게 하려면 립싱크를 쓰세요.
비디오 사운드 효과
Video*
Sound Effect Prompt
Background Music Prompt