
Histórias de 30 segundos em plano-sequência
Uma única geração cobre um bloco narrativo inteiro — um movimento de câmera contínuo, um anúncio completo, um percurso — em vez de três clipes para casar na edição.
O renderizador de vídeo tudo-em-um da Alibaba — 30 segundos em uma única passada, áudio nativo e um conjunto de referências que aceita imagens, clipes e voz ao mesmo tempo.
Pague uma vez por créditos e use-os em todos os modelos em ZOOOP. · Recarregue quando precisar, sem queima mensal.
Powered by Wan AI's API on ZOOOP
Uma requisição gera até 30 segundos de vídeo contínuo — o suficiente para um bloco narrativo inteiro, um percurso em plano-sequência ou um anúncio completo, sem emendar clipes depois.
Até dez imagens, cinco clipes e cinco faixas de áudio de referência entram juntos na mesma requisição. Rostos, produtos e vozes permanecem alinhados ao longo de toda a tomada, em vez de variar de take em take.
Trave o quadro de abertura e, se precisar, o de fechamento: o Wan gera o movimento que liga os dois. É o jeito mais confiável de acertar o final exato que a montagem precisa.
Diálogo, ambiência e música são gerados junto com a imagem na mesma passada e chegam como faixa estéreo no arquivo final. Desligar o áudio não custa nada a mais.

Uma única geração cobre um bloco narrativo inteiro — um movimento de câmera contínuo, um anúncio completo, um percurso — em vez de três clipes para casar na edição.

Até dez imagens de referência da mesma pessoa, do mesmo figurino ou do mesmo produto: a identidade se mantém no clipe inteiro — o mesmo rosto no segundo 2 e no segundo 28.

O áudio de referência entra na mesma requisição que as referências visuais, então a cena falada sai com a voz que você forneceu, e não com uma síntese genérica.

Comece no packshot e termine no quadro principal. O controle de início e fim trava as duas pontas para a revelação entrar limpa no corte seguinte.

O nível mais alto renderiza em 2560×1440, para o topo de páginas de destino e reprodução em tela grande, onde um máster em 720p perde nitidez de forma visível.

O Wan 3.0 Prime é o mesmo modelo em uma via prioritária — controles idênticos, geração preferencial — para a rodada em que você ainda está definindo a tomada.
O Wan 3.0 é a escolha quando a tomada precisa durar e bater com material de referência real. Troque de modelo se o trabalho pedir outra coisa.
Abra o Wan 3.0 por esta página ou selecione-o no gerador de vídeo.
Escreva o prompt e acrescente imagens, clipes ou áudio de referência se a tomada pedir.
Escolha a proporção, a resolução de até 1440p e uma duração entre 2 e 30 segundos.
Gere — o clipe final chega com a faixa de áudio já sincronizada.
O Wan 3.0 responde à pergunta que todo modelo de vídeo evita: e quando a tomada precisa durar mais do que alguns segundos? A maioria dos modelos de ponta limita uma geração a algo entre cinco e quinze segundos, então qualquer coisa parecida com uma cena acaba montada a partir de clipes que nunca casam de verdade — o rosto muda, a luz salta, o ambiente troca de forma no corte. O Wan 3.0 renderiza até trinta segundos em uma única passada, e só essa mudança reorganiza o jeito de planejar uma tomada. Um movimento de câmera contínuo atravessando um espaço, um anúncio inteiro de trinta segundos, um percurso de produto em plano-sequência: deixam de ser problema de edição e voltam a ser problema de prompt.
O segundo diferencial é a referência tudo-em-um. Sistemas de referência costumam aceitar um tipo só de entrada — alguns aceitam imagens, poucos um clipe, raríssimos uma voz. O Wan 3.0 aceita os três na mesma requisição: até dez imagens, cinco clipes e cinco faixas de áudio, com teto de quinze segundos de vídeo de referência e quinze segundos de áudio de referência. Na prática, um kit de marca inteiro ou uma ficha de personagem completa entram de uma vez, e a identidade se sustenta pelo tempo do clipe, não apenas nos primeiros segundos. Na ZOOOP o roteamento é automático: anexe qualquer referência e a requisição vai para o pipeline de referência; deixe vazio e o mesmo modelo roda text-to-video puro.
Mais duas capacidades pesam no dia a dia. O controle de quadro inicial e final trava as duas pontas do clipe e deixa o Wan gerar o movimento entre elas — é assim que se acerta um final exato que entra limpo na tomada seguinte. E o áudio nativo sincronizado — diálogo, ambiência, música — é gerado com a imagem na mesma passada e chega como faixa estéreo no arquivo, com a chave de áudio não alterando o preço em nenhuma direção.
Onde ele é mais fraco: não tem pesos abertos. O Wan 2.7 saiu sob Apache 2.0 com pesos publicados; o Wan 3.0 não — nada de pesos, apenas API. Para um fluxo que exige auto-hospedagem ou origem aberta, isso é impeditivo e a resposta continua sendo o 2.7. O nível 1440p é um upscale aprimorado, não uma renderização nativa — um arquivo real de 2560×1440, bom para tela grande, mas um modelo com passada nativa em alta resolução segura melhor os detalhes. Não existe prompt negativo, então exclusões precisam ser resolvidas descrevendo o que você quer. E no image-to-video a saída segue a proporção do quadro de entrada — esse caminho não tem controle de proporção, então recorte o arquivo de origem antes de gerar.
Um critério razoável: vá de Wan 3.0 quando a tomada for longa, ou quando bater com material de referência real for o que decide se o take serve. Para pesos abertos e edição por instrução, Wan 2.7. Para qualidade máxima em uma tomada única, Veo 3.1. Para rascunhos descartáveis da mesma família, Wan 2.6 Flash. E enquanto a tomada ainda está sendo definida, rode no nível Prime e volte ao padrão para a renderização final.
Entre 2 e 30 segundos em uma única geração. Essa é a principal diferença em relação à geração anterior: um bloco de 30 segundos que antes exigia três clipes e uma edição agora é uma requisição só.
Até dez imagens, cinco clipes e cinco faixas de áudio de referência na mesma requisição. Clipes de referência e áudio de referência têm limite de 15 segundos no total cada um. Assim que qualquer referência é anexada, a requisição vai automaticamente para o pipeline de referência; um prompt só de texto roda text-to-video.
Não. O Wan 2.7 saiu sob Apache 2.0 com pesos abertos; o Wan 3.0 é somente API, sem pesos publicados. Se auto-hospedagem ou origem aberta importam no seu fluxo, o Wan 2.7 continua sendo o modelo indicado.
Os níveis 480p, 720p e 1080p são renderizações nativas. O nível 1440p vem de um upscale aprimorado de uma renderização nativa: entrega um arquivo real de 2560×1440 e é a escolha certa para tela grande, mas não é o mesmo que um modelo com passada nativa em 1440p.
Mesmo modelo, mesmos parâmetros, mesmos limites — o Prime roda em uma via prioritária, fica pronto antes e custa mais. Use o nível padrão nas renderizações finais e o Prime quando esperar for o custo alto durante a iteração.
Não. O Wan 3.0 não recebe prompt negativo — descreva o que você quer no prompt positivo. Ser específico sobre ângulo de câmera, luz e movimento rende muito mais do que tentar excluir coisas.
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Primeiro e último quadro de vídeoTexto e referência ao vídeo
Wan 3.0
Prompt*
Imagens
Vídeos
Áudios
Proporção de Aspecto*
Resolução*
Duração*