
Fijar una voz de marca para la narración
Todos los vídeos usan la misma voz, así que a los pocos capítulos el público la reconoce — mucho más distintivo que recastear cada vez.
Sube una única muestra de audio para crear tu propia voz — y después haz que lea cualquier texto, con el timbre y el registro estables en todo lo que produzcas.
Sube una grabación limpia y el modelo aprende el timbre y el registro de esa voz, y después lee con ella cualquier texto.
Una serie de vídeos, un audiolibro entero, un curso completo — la voz no se desvía a mitad de camino, algo que una biblioteca predefinida no puede garantizar.
En los modelos que lo admiten, la misma voz habla distintos idiomas, así que las versiones localizadas no necesitan un casting nuevo por mercado.
La voz queda guardada en tu cuenta y disponible en cualquier momento — sin volver a subir la muestra en cada trabajo.

Todos los vídeos usan la misma voz, así que a los pocos capítulos el público la reconoce — mucho más distintivo que recastear cada vez.

Graba una muestra una vez y todos los guiones posteriores se leen con tu voz, sin una sesión de estudio por pieza.

Dale a un personaje recurrente su propia voz para que siga igual a lo largo de toda una serie.

La misma voz hablando varios idiomas, para que las versiones internacionales sigan sonando a la misma persona.
Abre Clonación de voz con IA y sube una muestra de audio limpia.
Escribe el texto que quieres que se lea y selecciona la voz que acabas de crear.
Descarga el audio o mándalo al lienzo para cuadrarlo con el vídeo.
Una biblioteca de voces responde a «necesito una buena voz». La clonación responde a otra pregunta: «necesito esta voz».
Dos situaciones típicas. Una es la coherencia de marca — tu serie ya acumula decenas de piezas con una voz, el público la conoce y no puedes cambiarla a mitad de camino. La otra es ser tú el que presenta — el contenido debe sonar con tu voz, pero no quieres una sesión de estudio por episodio.
Una biblioteca predefinida no sirve para ninguna de las dos, porque la voz que quieres no está en ella, o porque la voz que quieres eres tú.
La calidad del clon depende casi por completo de la muestra, y lo que importa es que sea limpia:
Un móvil en una habitación silenciosa es suficiente. Al revés, una grabación larga pero ruidosa suele rendir peor que una corta y limpia.
La voz resultante se guarda en tu cuenta y queda disponible siempre que la necesites.
Clonar es una inversión puntual con un retorno largo: grabas una muestra cuidada y limpia una sola vez, guardas la voz y la usas para todo lo que venga después.
Por eso vale la pena dedicar diez minutos extra a la muestra — busca una habitación silenciosa, lee unas cuantas frases completas a ritmo normal y haz bien ese paso. La coherencia de voz de las próximas cientos de piezas se apoya en esta única grabación.
Importa más que sea limpia que larga. Una grabación sin ruido de fondo, sin música, sin reverberación y con una sola persona hablando con normalidad gana a una muestra mucho más larga grabada en una sala ruidosa. Un móvil en una habitación silenciosa basta — no hace falta equipo profesional.
El texto a voz elige una voz ya hecha de una biblioteca predefinida. La clonación crea una voz nueva que es tuya. Usa la clonación cuando necesites una voz concreta; usa la biblioteca cuando solo necesites una buena voz, porque es más rápido y no requiere muestra.
El timbre suele quedar muy cerca. La diferencia tiende a asomar en el registro y la emoción — sobre todo en emociones que no aparecen en tu muestra. Por eso la muestra debe contener frases completas a ritmo normal, y no palabras sueltas ni gritos.
Sube únicamente audio sobre el que tengas derechos. Usar la voz de otra persona exige su consentimiento — es a la vez norma de la plataforma y requisito legal, con el detalle regulado en los términos de servicio.
Prompt*
Audio Reference*
Emotion · Happy*
Emotion · Angry*
Emotion · Sad*
Emotion · Afraid*
Emotion · Disgusted*
Emotion · Melancholic*
Emotion · Surprised*
Emotion · Calm*