Avatares parlantes
Un retrato más una pista de voz se convierte en un vídeo de presentador — sin tiempo ante la cámara, sin rodaje.
Dale un audio y una cara, y la persona en pantalla dice exactamente eso — con la boca alineada. La herramienta detrás de los avatares parlantes, el doblaje y las versiones por idioma.
Sin rodaje — una foto o un clip junto al audio te da metraje de esa persona diciéndolo.
El modelo se alinea con las sílabas del audio, mucho más fiable que pedirle «que hable» a un modelo de vídeo, que normalmente solo te da una boca en movimiento.
Pon una pista en otro idioma bajo el mismo metraje y la boca sigue al idioma nuevo — sin repetir rodaje para las versiones internacionales.
Unos son mejores convirtiendo una foto fija en un clip hablado, otros redoblando vídeo existente. Repite los mismos archivos en otro modelo y compara.
Un retrato más una pista de voz se convierte en un vídeo de presentador — sin tiempo ante la cámara, sin rodaje.

Coloca una pista de voz nueva bajo el vídeo existente; la boca se realinea y la imagen queda intacta.

Cuando la boca de un clip generado con IA no encaja con la frase, realinéala aquí.
Una misma persona hablando varios idiomas, para que la versión de cada mercado parezca dicha realmente por ella.
Abre Sincronización de labios con IA y sube una cara — una foto o un clip de vídeo.
Sube el audio que debe pronunciarse; puede venir de texto a voz o de clonación de voz.
Descarga el resultado o mándalo al lienzo para seguir montando.
Escribir «esta persona está hablando» en un generador de vídeo produce normalmente una boca en movimiento cuyo gesto no tiene nada que ver con tu frase. El modelo solo sabe que debe haber habla, no qué se está diciendo.
La sincronización labial toma el otro camino: se agarra a un audio real y alinea la forma de la boca sílaba a sílaba. Así la persona dice la frase que tú aportaste en vez de ejecutar un movimiento de boca genérico.
Este paso suele ser el último eslabón de una cadena — escribes el guion, generas la voz y después haces que la persona la diga.
Hace falta muy poco: una cara y una pista de audio. Pero la calidad de la cara condiciona directamente el resultado:
En el lado del audio funcionan las tres vías: texto a voz (lo más rápido — escribir y elegir voz), clonación de voz (cuando necesitas una voz concreta) o tu propia grabación.
Trátalo como el paso de montaje: primero deja el audio bien (es lo que decide la calidad percibida — una lectura torpe no se salva con una alineación de boca perfecta), después prepara la cara y por último combina.
Hay un orden que merece la pena interiorizar: cierra el audio antes de lanzar la sincronización labial. Al revés te obliga a recomponer el vídeo con cada cambio de guion, y eso cuesta mucho más que volver a generar una pista de voz.
Dos: una cara frontal y nítida (foto o vídeo) y una pista de audio. La cara debe estar de frente, con los rasgos visibles y la boca despejada — los perfiles, las mascarillas y la luz muy escasa degradan la alineación de forma notable.
Genéralo con texto a voz — escribes el guion, eliges una voz y listo. Si necesitas una voz concreta, créala antes con clonación de voz. También puedes subir audio grabado por ti. Las tres vías funcionan aquí.
Porque eso te da una boca en movimiento cuyo movimiento no tiene nada que ver con tu frase. La sincronización labial se alinea con audio real sílaba a sílaba, así que la boca encaja con palabras de verdad. Cuando la persona tiene que decir algo concreto, esta es la página.
Sí, con cierta variación de precisión según el modelo y el idioma. El inglés y el chino suelen alinearse bien. Si un resultado te decepciona, lanza los mismos archivos en otro modelo — eso suele resolverlo.
Prompt*
Imagen*
Audio*