Wan AI

Wan 3.0

O renderizador de vídeo tudo-em-um da Alibaba — 30 segundos em uma única passada, áudio nativo e um conjunto de referências que aceita imagens, clipes e voz ao mesmo tempo.

Sem assinatura
Os créditos nunca expiram
Saiba mais

Pague uma vez por créditos e use-os em todos os modelos em ZOOOP. · Recarregue quando precisar, sem queima mensal.

Powered by Wan AI's API on ZOOOP

Principais características

30 segundos em uma passada

Uma requisição gera até 30 segundos de vídeo contínuo — o suficiente para um bloco narrativo inteiro, um percurso em plano-sequência ou um anúncio completo, sem emendar clipes depois.

Referência tudo-em-um

Até dez imagens, cinco clipes e cinco faixas de áudio de referência entram juntos na mesma requisição. Rostos, produtos e vozes permanecem alinhados ao longo de toda a tomada, em vez de variar de take em take.

Controle de quadro inicial e final

Trave o quadro de abertura e, se precisar, o de fechamento: o Wan gera o movimento que liga os dois. É o jeito mais confiável de acertar o final exato que a montagem precisa.

Áudio nativo sincronizado

Diálogo, ambiência e música são gerados junto com a imagem na mesma passada e chegam como faixa estéreo no arquivo final. Desligar o áudio não custa nada a mais.

Casos de uso

Histórias de 30 segundos em plano-sequência

Histórias de 30 segundos em plano-sequência

Uma única geração cobre um bloco narrativo inteiro — um movimento de câmera contínuo, um anúncio completo, um percurso — em vez de três clipes para casar na edição.

Consistência do personagem na tomada inteira

Consistência do personagem na tomada inteira

Até dez imagens de referência da mesma pessoa, do mesmo figurino ou do mesmo produto: a identidade se mantém no clipe inteiro — o mesmo rosto no segundo 2 e no segundo 28.

Cenas de diálogo com voz de referência

Cenas de diálogo com voz de referência

O áudio de referência entra na mesma requisição que as referências visuais, então a cena falada sai com a voz que você forneceu, e não com uma síntese genérica.

Revelação de produto com final travado

Revelação de produto com final travado

Comece no packshot e termine no quadro principal. O controle de início e fim trava as duas pontas para a revelação entrar limpa no corte seguinte.

Entregáveis principais em 1440p

Entregáveis principais em 1440p

O nível mais alto renderiza em 2560×1440, para o topo de páginas de destino e reprodução em tela grande, onde um máster em 720p perde nitidez de forma visível.

Iteração rápida no nível Prime

Iteração rápida no nível Prime

O Wan 3.0 Prime é o mesmo modelo em uma via prioritária — controles idênticos, geração preferencial — para a rodada em que você ainda está definindo a tomada.

Escolha o modelo certo

O Wan 3.0 é a escolha quando a tomada precisa durar e bater com material de referência real. Troque de modelo se o trabalho pedir outra coisa.

Tomadas de 30 segundos em uma passada com referências mistasWan 3.0
Pesos abertos e edição por instruçãoWan 2.7
Referência multimodal com áudio no ritmoSeedance 2.0
Imagens, clipes e voz em uma só chamada de vídeoMiniMax H3
Qualidade de imagem máxima e entrega em 4KVeo 3.1
Rascunhos rápidos mais baratos da mesma famíliaWan 2.6 Flash

Como usar

01

Abra o Wan 3.0 por esta página ou selecione-o no gerador de vídeo.

02

Escreva o prompt e acrescente imagens, clipes ou áudio de referência se a tomada pedir.

03

Escolha a proporção, a resolução de até 1440p e uma duração entre 2 e 30 segundos.

04

Gere — o clipe final chega com a faixa de áudio já sincronizada.

Mergulho profundo

No que o Wan 3.0 é bom — e no que não é

O Wan 3.0 responde à pergunta que todo modelo de vídeo evita: e quando a tomada precisa durar mais do que alguns segundos? A maioria dos modelos de ponta limita uma geração a algo entre cinco e quinze segundos, então qualquer coisa parecida com uma cena acaba montada a partir de clipes que nunca casam de verdade — o rosto muda, a luz salta, o ambiente troca de forma no corte. O Wan 3.0 renderiza até trinta segundos em uma única passada, e só essa mudança reorganiza o jeito de planejar uma tomada. Um movimento de câmera contínuo atravessando um espaço, um anúncio inteiro de trinta segundos, um percurso de produto em plano-sequência: deixam de ser problema de edição e voltam a ser problema de prompt.

O segundo diferencial é a referência tudo-em-um. Sistemas de referência costumam aceitar um tipo só de entrada — alguns aceitam imagens, poucos um clipe, raríssimos uma voz. O Wan 3.0 aceita os três na mesma requisição: até dez imagens, cinco clipes e cinco faixas de áudio, com teto de quinze segundos de vídeo de referência e quinze segundos de áudio de referência. Na prática, um kit de marca inteiro ou uma ficha de personagem completa entram de uma vez, e a identidade se sustenta pelo tempo do clipe, não apenas nos primeiros segundos. Na ZOOOP o roteamento é automático: anexe qualquer referência e a requisição vai para o pipeline de referência; deixe vazio e o mesmo modelo roda text-to-video puro.

Mais duas capacidades pesam no dia a dia. O controle de quadro inicial e final trava as duas pontas do clipe e deixa o Wan gerar o movimento entre elas — é assim que se acerta um final exato que entra limpo na tomada seguinte. E o áudio nativo sincronizado — diálogo, ambiência, música — é gerado com a imagem na mesma passada e chega como faixa estéreo no arquivo, com a chave de áudio não alterando o preço em nenhuma direção.

Onde ele é mais fraco: não tem pesos abertos. O Wan 2.7 saiu sob Apache 2.0 com pesos publicados; o Wan 3.0 não — nada de pesos, apenas API. Para um fluxo que exige auto-hospedagem ou origem aberta, isso é impeditivo e a resposta continua sendo o 2.7. O nível 1440p é um upscale aprimorado, não uma renderização nativa — um arquivo real de 2560×1440, bom para tela grande, mas um modelo com passada nativa em alta resolução segura melhor os detalhes. Não existe prompt negativo, então exclusões precisam ser resolvidas descrevendo o que você quer. E no image-to-video a saída segue a proporção do quadro de entrada — esse caminho não tem controle de proporção, então recorte o arquivo de origem antes de gerar.

Um critério razoável: vá de Wan 3.0 quando a tomada for longa, ou quando bater com material de referência real for o que decide se o take serve. Para pesos abertos e edição por instrução, Wan 2.7. Para qualidade máxima em uma tomada única, Veo 3.1. Para rascunhos descartáveis da mesma família, Wan 2.6 Flash. E enquanto a tomada ainda está sendo definida, rode no nível Prime e volte ao padrão para a renderização final.

Perguntas frequentes

Qual a duração máxima de um clipe do Wan 3.0?+

Entre 2 e 30 segundos em uma única geração. Essa é a principal diferença em relação à geração anterior: um bloco de 30 segundos que antes exigia três clipes e uma edição agora é uma requisição só.

O que cabe no conjunto de referências?+

Até dez imagens, cinco clipes e cinco faixas de áudio de referência na mesma requisição. Clipes de referência e áudio de referência têm limite de 15 segundos no total cada um. Assim que qualquer referência é anexada, a requisição vai automaticamente para o pipeline de referência; um prompt só de texto roda text-to-video.

O Wan 3.0 é código aberto como o Wan 2.7?+

Não. O Wan 2.7 saiu sob Apache 2.0 com pesos abertos; o Wan 3.0 é somente API, sem pesos publicados. Se auto-hospedagem ou origem aberta importam no seu fluxo, o Wan 2.7 continua sendo o modelo indicado.

O 1440p é renderização nativa?+

Os níveis 480p, 720p e 1080p são renderizações nativas. O nível 1440p vem de um upscale aprimorado de uma renderização nativa: entrega um arquivo real de 2560×1440 e é a escolha certa para tela grande, mas não é o mesmo que um modelo com passada nativa em 1440p.

Qual a diferença entre Wan 3.0 e Wan 3.0 Prime?+

Mesmo modelo, mesmos parâmetros, mesmos limites — o Prime roda em uma via prioritária, fica pronto antes e custa mais. Use o nível padrão nas renderizações finais e o Prime quando esperar for o custo alto durante a iteração.

O Wan 3.0 aceita prompt negativo?+

Não. O Wan 3.0 não recebe prompt negativo — descreva o que você quer no prompt positivo. Ser específico sobre ângulo de câmera, luz e movimento rende muito mais do que tentar excluir coisas.

Mais modelos

Wan AI
Wan V2.7
Wan AI
ByteDance
Seedance V2.0
ByteDance
MiniMax
MiniMax H3
MiniMax
Google
Veo 3.1
Google
OpenAI
GPT Image 2.5
OpenAI
OpenAI
GPT Image 2.0
OpenAI
ByteDance
Seedance V2.0 Fast
ByteDance
ByteDance
Seedance V1.5 Pro
ByteDance
ByteDance
Seedance V1.0 Pro
ByteDance
ByteDance
Seedance V1.0 Pro Fast
ByteDance
ByteDance
Seedance V1.0 Lite
ByteDance
ByteDance
Seedream 5.0 Pro
ByteDance
ByteDance
Seedream 5.0 Lite
ByteDance
ByteDance
Seedream 4.5
ByteDance
ByteDance
Seedream 4
ByteDance
ByteDance
Dreamactor V2
ByteDance
MiniMax
Minimax Music V2.6
MiniMax
MiniMax
Minimax Music V2
MiniMax
MiniMax
Speech-2.8-HD
MiniMax
MiniMax
Speech-2.8-Turbo
MiniMax
Kling AI
Kling O3
Kling AI
Kling AI
Kling V3
Kling AI
Kling AI
Kling V3 Pro
Kling AI
Kling AI
Kling V2.6 Pro
Kling AI
Kling AI
Kling V2.6
Kling AI
Kling AI
Kling Lipsync
Kling AI
Kling AI
Kling Avatar V2
Kling AI
Kling AI
Kling O1
Kling AI
Midjourney
Midjourney V8.2
Midjourney
Midjourney
Midjourney V8.1
Midjourney
Midjourney
Midjourney
Midjourney
Alibaba
Happy Horse V1.1
Alibaba
Alibaba
Happy Horse
Alibaba
xAI
Grok Imagine V1.5
xAI
xAI
Grok Imagine
xAI
xAI
xAI TTS
xAI
Google
Veo 3.1 Fast
Google
Google
Veo 3
Google
Google
Nano Banana Pro
Google
Google
Nano Banana 2
Google
Google
Nano Banana
Google
Google
Lyria 3 Pro
Google
Google
Lyria 3
Google
Google
Lyria2
Google
Google
Gemini 3.1 Flash TTS
Google
Wan AI
Wan V2.2
Wan AI
Wan AI
Wan V2.2 Turbo
Wan AI
Wan AI
Wan V2.5
Wan AI
Wan AI
Wan V2.6
Wan AI
Wan AI
Wan V2.6 Flash
Wan AI
Pixverse AI
Pixverse V6
Pixverse AI
Pixverse AI
Pixverse V5.5
Pixverse AI
Pixverse AI
Pixverse V5
Pixverse AI
Pixverse AI
Pixverse Lipsync
Pixverse AI
Vidu AI
Vidu Q3 Pro
Vidu AI
Vidu AI
Vidu Q3
Vidu AI
Vidu AI
Vidu Q3 Turbo
Vidu AI
Vidu AI
Vidu Q2 Pro
Vidu AI
Vidu AI
Vidu Q2 Turbo
Vidu AI
Luma AI
Luma Ray 2
Luma AI
Luma AI
Luma Ray 2 Flash
Luma AI
Flux AI
Flux 2 Pro
Flux AI
Flux AI
Flux 2
Flux AI
Flux AI
Flux 2 Flash
Flux AI
ElevenLabs
Multilingual V3
ElevenLabs
ElevenLabs
Multilingual V2
ElevenLabs
ElevenLabs
Sound Effects V2
ElevenLabs
Hailuo AI
Hailuo 2.3
Hailuo AI
Hailuo AI
Hailuo 2.3 Fast
Hailuo AI
Hailuo AI
Hailuo 02
Hailuo AI
Lightricks
LTX-2.3 Pro
Lightricks
Lightricks
LTX-2.3 Fast
Lightricks
Lightricks
LTX-2.3
Lightricks
Pika AI
Pika V2.2
Pika AI
Qwen
Qwen3-TTS
Qwen
Inworld
Inworld TTS
Inworld
Bilibili Index
Index TTS 2
Bilibili Index
Resemble AI
Chatterbox TTS Multilingual
Resemble AI
Open Source
ACE-Step
Open Source
Open Source
LUX TTS
Open Source
CassetteAI
Music Generator
CassetteAI
Recraft
Text to Vector V4.1
Recraft
Recraft
Text to Vector V4.1 Pro
Recraft
Recraft
Image to Vector
Recraft