
Historias de 30 segundos en plano secuencia
Una sola generación cubre un bloque narrativo completo: un movimiento de cámara continuo, un anuncio entero, un recorrido — en lugar de tres clips que hay que cuadrar en el montaje.
El renderizador de vídeo todo en uno de Alibaba: 30 segundos en una sola pasada, audio nativo y un conjunto de referencias que admite imágenes, clips y voz a la vez.
Paga una vez por los créditos: utilízalos en todos los modelos en ZOOOP. · Recarga cuando lo necesites, sin quemaduras mensuales.
Powered by Wan AI's API on ZOOOP
Una petición produce hasta 30 segundos de vídeo continuo: suficiente para un bloque narrativo completo, un recorrido en plano secuencia o un anuncio entero, sin unir clips después.
Hasta diez imágenes, cinco clips y cinco pistas de audio de referencia van juntos en la misma petición. Caras, productos y voces se mantienen alineados en todo el plano en vez de desviarse entre tomas.
Fija el fotograma de apertura y, si hace falta, el de cierre: Wan genera el movimiento que los une. Es la forma más fiable de clavar el final exacto que necesita el montaje.
Diálogo, ambiente y música se generan junto con la imagen en la misma pasada y llegan como pista estéreo en el archivo final. Desactivar el audio no cuesta nada extra.

Una sola generación cubre un bloque narrativo completo: un movimiento de cámara continuo, un anuncio entero, un recorrido — en lugar de tres clips que hay que cuadrar en el montaje.

Hasta diez imágenes de referencia de la misma persona, el mismo vestuario o el mismo producto: la identidad aguanta todo el clip — la misma cara en el segundo 2 y en el 28.

El audio de referencia entra en la misma petición que las referencias visuales, así que la escena hablada sale con la voz que aportaste y no con una síntesis genérica.

Empieza en el packshot y termina en el fotograma héroe. El control de inicio y final fija ambos extremos para que el revelado entre limpio en el siguiente corte.

El nivel superior renderiza a 2560×1440, para cabeceras de landing y reproducción en pantalla grande, donde un máster a 720p se ablanda de forma visible.

Wan 3.0 Prime es el mismo modelo en vía prioritaria — controles idénticos, generación preferente — para la pasada en la que aún estás decidiendo el plano.
Wan 3.0 es la opción cuando un plano tiene que durar y encajar con material de referencia real. Cambia de modelo si el encargo pide otra cosa.
Abre Wan 3.0 desde esta página o selecciónalo en el generador de vídeo.
Escribe el prompt y añade imágenes, clips o audio de referencia si el plano lo necesita.
Elige la relación de aspecto, la resolución hasta 1440p y una duración de entre 2 y 30 segundos.
Genera — el clip final llega con su pista de audio ya sincronizada.
Wan 3.0 responde a la pregunta que todos los modelos de vídeo esquivan: ¿qué pasa cuando el plano tiene que durar más de unos segundos? La mayoría de los modelos punteros topan una generación entre cinco y quince segundos, así que cualquier cosa parecida a una escena acaba montándose a partir de clips que nunca terminan de casar — la cara se desvía, la luz salta, la habitación cambia de forma en el corte. Wan 3.0 renderiza hasta treinta segundos en una sola pasada, y ese único cambio reordena cómo se planifica un plano. Un movimiento de cámara continuo por un espacio, un anuncio completo de treinta segundos, un recorrido de producto en plano secuencia: dejan de ser problemas de montaje y vuelven a ser problemas de prompt.
Lo segundo que lo distingue es la referencia todo en uno. Los sistemas de referencia suelen aceptar un solo tipo de entrada: algunos imágenes, unos pocos un clip, muy pocos una voz. Wan 3.0 acepta los tres en la misma petición: hasta diez imágenes, cinco clips y cinco pistas de audio, con un tope de quince segundos de vídeo de referencia y quince de audio de referencia. En la práctica eso significa que un kit de marca entero o una hoja de personaje completa entran de una vez, y la identidad aguanta lo que dura el clip y no solo los primeros segundos. En ZOOOP el enrutado es automático: adjunta cualquier referencia y la petición va al pipeline de referencia; déjalas vacías y el mismo modelo ejecuta text-to-video.
Otras dos capacidades importan en el día a día. El control de fotograma inicial y final te deja fijar ambos extremos de un clip y que Wan genere el movimiento intermedio, que es como se clava un final exacto que entra limpio en el plano siguiente. Y el audio nativo sincronizado — diálogo, ambiente, música — se genera con la imagen en la misma pasada y llega como pista estéreo en el archivo, sin que el interruptor de audio cambie el precio.
Dónde flojea: no es open-weight. Wan 2.7 salió bajo Apache 2.0 con pesos publicados y Wan 3.0 no — sin pesos, solo API. Para un pipeline que necesita autoalojamiento o procedencia abierta eso es un freno absoluto y la respuesta sigue siendo 2.7. Su nivel 1440p es un escalado mejorado, no un render nativo: un archivo real de 2560×1440, bueno para pantalla grande, pero un modelo con paso nativo en alta resolución retiene mejor el detalle. No hay prompt negativo, así que las exclusiones se resuelven describiendo lo que sí quieres. Y en image-to-video la salida sigue la relación de aspecto del fotograma de entrada: esa ruta no tiene control de ratio, así que recorta la fuente antes de generar.
Un criterio razonable: recurre a Wan 3.0 cuando el plano sea largo, o cuando la coherencia con material de referencia real decida si la toma sirve. Para pesos abiertos y edición por instrucciones, Wan 2.7. Para la máxima calidad en un plano único, Veo 3.1. Para borradores desechables de la misma familia, Wan 2.6 Flash. Y mientras aún estés decidiendo el plano, trabaja en el nivel Prime y vuelve al estándar para el render final.
Entre 2 y 30 segundos en una sola generación. Esa es la diferencia principal con la generación anterior: un bloque de 30 segundos que antes requería tres clips y un montaje ahora es una única petición.
Hasta diez imágenes, cinco clips y cinco pistas de audio de referencia en la misma petición. Los clips y el audio de referencia están limitados a 15 segundos en total cada uno. En cuanto añades una referencia, la petición se enruta automáticamente al pipeline de referencia; un prompt solo de texto ejecuta text-to-video.
No. Wan 2.7 salió bajo Apache 2.0 con pesos abiertos; Wan 3.0 es solo API, sin pesos publicados. Si el autoalojamiento o la procedencia abierta importan en tu pipeline, Wan 2.7 sigue siendo el modelo a usar.
Los niveles 480p, 720p y 1080p son renders nativos. El nivel 1440p procede de un escalado mejorado de un render nativo: entrega un archivo real de 2560×1440 y es la opción correcta para pantalla grande, pero no equivale a un modelo con paso nativo a 1440p.
Mismo modelo, mismos parámetros y mismos límites — Prime corre por una vía prioritaria, termina antes y cuesta más. Usa el nivel estándar para los renders finales y Prime cuando esperar sea lo caro durante la iteración.
No. Wan 3.0 no acepta prompt negativo: describe lo que quieres en el prompt positivo. Concretar el ángulo de cámara, la luz y el movimiento rinde mucho más que intentar excluir cosas.
Video del primer y último cuadroTexto y referencia al video
Video del primer y último cuadroTexto y referencia al video
Video del primer y último cuadroTexto y referencia al video
Video del primer y último cuadroTexto y referencia al video
Video del primer y último cuadroTexto y referencia al video
Video del primer y último cuadroTexto y referencia al video
Wan 3.0
Prompt*
Imágenes
Videos
Audios
Relación De Aspecto*
Resolución*
Duración*