Wan AI

Wan 3.0

El renderizador de vídeo todo en uno de Alibaba: 30 segundos en una sola pasada, audio nativo y un conjunto de referencias que admite imágenes, clips y voz a la vez.

Sin suscripción
Los créditos nunca caducan
Aprende más

Paga una vez por los créditos: utilízalos en todos los modelos en ZOOOP. · Recarga cuando lo necesites, sin quemaduras mensuales.

Powered by Wan AI's API on ZOOOP

Características clave

30 segundos en una pasada

Una petición produce hasta 30 segundos de vídeo continuo: suficiente para un bloque narrativo completo, un recorrido en plano secuencia o un anuncio entero, sin unir clips después.

Referencia todo en uno

Hasta diez imágenes, cinco clips y cinco pistas de audio de referencia van juntos en la misma petición. Caras, productos y voces se mantienen alineados en todo el plano en vez de desviarse entre tomas.

Control de fotograma inicial y final

Fija el fotograma de apertura y, si hace falta, el de cierre: Wan genera el movimiento que los une. Es la forma más fiable de clavar el final exacto que necesita el montaje.

Audio nativo sincronizado

Diálogo, ambiente y música se generan junto con la imagen en la misma pasada y llegan como pista estéreo en el archivo final. Desactivar el audio no cuesta nada extra.

Casos de uso

Historias de 30 segundos en plano secuencia

Historias de 30 segundos en plano secuencia

Una sola generación cubre un bloque narrativo completo: un movimiento de cámara continuo, un anuncio entero, un recorrido — en lugar de tres clips que hay que cuadrar en el montaje.

Consistencia del personaje en todo el plano

Consistencia del personaje en todo el plano

Hasta diez imágenes de referencia de la misma persona, el mismo vestuario o el mismo producto: la identidad aguanta todo el clip — la misma cara en el segundo 2 y en el 28.

Escenas de diálogo con voz de referencia

Escenas de diálogo con voz de referencia

El audio de referencia entra en la misma petición que las referencias visuales, así que la escena hablada sale con la voz que aportaste y no con una síntesis genérica.

Revelados de producto con final fijado

Revelados de producto con final fijado

Empieza en el packshot y termina en el fotograma héroe. El control de inicio y final fija ambos extremos para que el revelado entre limpio en el siguiente corte.

Entregables héroe en 1440p

Entregables héroe en 1440p

El nivel superior renderiza a 2560×1440, para cabeceras de landing y reproducción en pantalla grande, donde un máster a 720p se ablanda de forma visible.

Iteración rápida con el nivel Prime

Iteración rápida con el nivel Prime

Wan 3.0 Prime es el mismo modelo en vía prioritaria — controles idénticos, generación preferente — para la pasada en la que aún estás decidiendo el plano.

Elige el modelo correcto

Wan 3.0 es la opción cuando un plano tiene que durar y encajar con material de referencia real. Cambia de modelo si el encargo pide otra cosa.

Planos de 30 segundos en una pasada con referencias mixtasWan 3.0
Pesos abiertos y edición por instruccionesWan 2.7
Referencia multimodal con audio al ritmoSeedance 2.0
Imágenes, clips y voz en una sola llamada de vídeoMiniMax H3
Máxima calidad de imagen y entrega en 4KVeo 3.1
Borradores rápidos más baratos de la misma familiaWan 2.6 Flash

Cómo usar

01

Abre Wan 3.0 desde esta página o selecciónalo en el generador de vídeo.

02

Escribe el prompt y añade imágenes, clips o audio de referencia si el plano lo necesita.

03

Elige la relación de aspecto, la resolución hasta 1440p y una duración de entre 2 y 30 segundos.

04

Genera — el clip final llega con su pista de audio ya sincronizada.

Inmersión profunda

En qué destaca Wan 3.0 — y en qué no

Wan 3.0 responde a la pregunta que todos los modelos de vídeo esquivan: ¿qué pasa cuando el plano tiene que durar más de unos segundos? La mayoría de los modelos punteros topan una generación entre cinco y quince segundos, así que cualquier cosa parecida a una escena acaba montándose a partir de clips que nunca terminan de casar — la cara se desvía, la luz salta, la habitación cambia de forma en el corte. Wan 3.0 renderiza hasta treinta segundos en una sola pasada, y ese único cambio reordena cómo se planifica un plano. Un movimiento de cámara continuo por un espacio, un anuncio completo de treinta segundos, un recorrido de producto en plano secuencia: dejan de ser problemas de montaje y vuelven a ser problemas de prompt.

Lo segundo que lo distingue es la referencia todo en uno. Los sistemas de referencia suelen aceptar un solo tipo de entrada: algunos imágenes, unos pocos un clip, muy pocos una voz. Wan 3.0 acepta los tres en la misma petición: hasta diez imágenes, cinco clips y cinco pistas de audio, con un tope de quince segundos de vídeo de referencia y quince de audio de referencia. En la práctica eso significa que un kit de marca entero o una hoja de personaje completa entran de una vez, y la identidad aguanta lo que dura el clip y no solo los primeros segundos. En ZOOOP el enrutado es automático: adjunta cualquier referencia y la petición va al pipeline de referencia; déjalas vacías y el mismo modelo ejecuta text-to-video.

Otras dos capacidades importan en el día a día. El control de fotograma inicial y final te deja fijar ambos extremos de un clip y que Wan genere el movimiento intermedio, que es como se clava un final exacto que entra limpio en el plano siguiente. Y el audio nativo sincronizado — diálogo, ambiente, música — se genera con la imagen en la misma pasada y llega como pista estéreo en el archivo, sin que el interruptor de audio cambie el precio.

Dónde flojea: no es open-weight. Wan 2.7 salió bajo Apache 2.0 con pesos publicados y Wan 3.0 no — sin pesos, solo API. Para un pipeline que necesita autoalojamiento o procedencia abierta eso es un freno absoluto y la respuesta sigue siendo 2.7. Su nivel 1440p es un escalado mejorado, no un render nativo: un archivo real de 2560×1440, bueno para pantalla grande, pero un modelo con paso nativo en alta resolución retiene mejor el detalle. No hay prompt negativo, así que las exclusiones se resuelven describiendo lo que sí quieres. Y en image-to-video la salida sigue la relación de aspecto del fotograma de entrada: esa ruta no tiene control de ratio, así que recorta la fuente antes de generar.

Un criterio razonable: recurre a Wan 3.0 cuando el plano sea largo, o cuando la coherencia con material de referencia real decida si la toma sirve. Para pesos abiertos y edición por instrucciones, Wan 2.7. Para la máxima calidad en un plano único, Veo 3.1. Para borradores desechables de la misma familia, Wan 2.6 Flash. Y mientras aún estés decidiendo el plano, trabaja en el nivel Prime y vuelve al estándar para el render final.

Preguntas frecuentes

¿Cuánto puede durar un clip de Wan 3.0?+

Entre 2 y 30 segundos en una sola generación. Esa es la diferencia principal con la generación anterior: un bloque de 30 segundos que antes requería tres clips y un montaje ahora es una única petición.

¿Qué admite el conjunto de referencias?+

Hasta diez imágenes, cinco clips y cinco pistas de audio de referencia en la misma petición. Los clips y el audio de referencia están limitados a 15 segundos en total cada uno. En cuanto añades una referencia, la petición se enruta automáticamente al pipeline de referencia; un prompt solo de texto ejecuta text-to-video.

¿Wan 3.0 es de código abierto como Wan 2.7?+

No. Wan 2.7 salió bajo Apache 2.0 con pesos abiertos; Wan 3.0 es solo API, sin pesos publicados. Si el autoalojamiento o la procedencia abierta importan en tu pipeline, Wan 2.7 sigue siendo el modelo a usar.

¿El 1440p es un render nativo?+

Los niveles 480p, 720p y 1080p son renders nativos. El nivel 1440p procede de un escalado mejorado de un render nativo: entrega un archivo real de 2560×1440 y es la opción correcta para pantalla grande, pero no equivale a un modelo con paso nativo a 1440p.

¿Qué diferencia hay entre Wan 3.0 y Wan 3.0 Prime?+

Mismo modelo, mismos parámetros y mismos límites — Prime corre por una vía prioritaria, termina antes y cuesta más. Usa el nivel estándar para los renders finales y Prime cuando esperar sea lo caro durante la iteración.

¿Admite prompts negativos?+

No. Wan 3.0 no acepta prompt negativo: describe lo que quieres en el prompt positivo. Concretar el ángulo de cámara, la luz y el movimiento rinde mucho más que intentar excluir cosas.

Más modelos

Wan AI
Wan V2.7
Wan AI
ByteDance
Seedance V2.0
ByteDance
MiniMax
MiniMax H3
MiniMax
Google
Veo 3.1
Google
OpenAI
GPT Image 2.5
OpenAI
OpenAI
GPT Image 2.0
OpenAI
ByteDance
Seedance V2.0 Fast
ByteDance
ByteDance
Seedance V1.5 Pro
ByteDance
ByteDance
Seedance V1.0 Pro
ByteDance
ByteDance
Seedance V1.0 Pro Fast
ByteDance
ByteDance
Seedance V1.0 Lite
ByteDance
ByteDance
Seedream 5.0 Pro
ByteDance
ByteDance
Seedream 5.0 Lite
ByteDance
ByteDance
Seedream 4.5
ByteDance
ByteDance
Seedream 4
ByteDance
ByteDance
Dreamactor V2
ByteDance
MiniMax
Minimax Music V2.6
MiniMax
MiniMax
Minimax Music V2
MiniMax
MiniMax
Speech-2.8-HD
MiniMax
MiniMax
Speech-2.8-Turbo
MiniMax
Kling AI
Kling O3
Kling AI
Kling AI
Kling V3
Kling AI
Kling AI
Kling V3 Pro
Kling AI
Kling AI
Kling V2.6 Pro
Kling AI
Kling AI
Kling V2.6
Kling AI
Kling AI
Kling Lipsync
Kling AI
Kling AI
Kling Avatar V2
Kling AI
Kling AI
Kling O1
Kling AI
Midjourney
Midjourney V8.2
Midjourney
Midjourney
Midjourney V8.1
Midjourney
Midjourney
Midjourney
Midjourney
Alibaba
Happy Horse V1.1
Alibaba
Alibaba
Happy Horse
Alibaba
xAI
Grok Imagine V1.5
xAI
xAI
Grok Imagine
xAI
xAI
xAI TTS
xAI
Google
Veo 3.1 Fast
Google
Google
Veo 3
Google
Google
Nano Banana Pro
Google
Google
Nano Banana 2
Google
Google
Nano Banana
Google
Google
Lyria 3 Pro
Google
Google
Lyria 3
Google
Google
Lyria2
Google
Google
Gemini 3.1 Flash TTS
Google
Wan AI
Wan V2.2
Wan AI
Wan AI
Wan V2.2 Turbo
Wan AI
Wan AI
Wan V2.5
Wan AI
Wan AI
Wan V2.6
Wan AI
Wan AI
Wan V2.6 Flash
Wan AI
Pixverse AI
Pixverse V6
Pixverse AI
Pixverse AI
Pixverse V5.5
Pixverse AI
Pixverse AI
Pixverse V5
Pixverse AI
Pixverse AI
Pixverse Lipsync
Pixverse AI
Vidu AI
Vidu Q3 Pro
Vidu AI
Vidu AI
Vidu Q3
Vidu AI
Vidu AI
Vidu Q3 Turbo
Vidu AI
Vidu AI
Vidu Q2 Pro
Vidu AI
Vidu AI
Vidu Q2 Turbo
Vidu AI
Luma AI
Luma Ray 2
Luma AI
Luma AI
Luma Ray 2 Flash
Luma AI
Flux AI
Flux 2 Pro
Flux AI
Flux AI
Flux 2
Flux AI
Flux AI
Flux 2 Flash
Flux AI
ElevenLabs
Multilingual V3
ElevenLabs
ElevenLabs
Multilingual V2
ElevenLabs
ElevenLabs
Sound Effects V2
ElevenLabs
Hailuo AI
Hailuo 2.3
Hailuo AI
Hailuo AI
Hailuo 2.3 Fast
Hailuo AI
Hailuo AI
Hailuo 02
Hailuo AI
Lightricks
LTX-2.3 Pro
Lightricks
Lightricks
LTX-2.3 Fast
Lightricks
Lightricks
LTX-2.3
Lightricks
Pika AI
Pika V2.2
Pika AI
Qwen
Qwen3-TTS
Qwen
Inworld
Inworld TTS
Inworld
Bilibili Index
Index TTS 2
Bilibili Index
Resemble AI
Chatterbox TTS Multilingual
Resemble AI
Open Source
ACE-Step
Open Source
Open Source
LUX TTS
Open Source
CassetteAI
Music Generator
CassetteAI
Recraft
Text to Vector V4.1
Recraft
Recraft
Text to Vector V4.1 Pro
Recraft
Recraft
Image to Vector
Recraft