← Artículos
Guía práctica

Cómo generar una voz con IA a partir de texto: guía práctica

Convierte texto escrito en voz natural: pega tu guion, elige una voz, describe el tono y el ritmo en lenguaje sencillo y exporta un archivo de audio.

Por Pipe2.ai · Actualizado July 24, 2026

Para generar una voz con IA a partir de texto en Pipe2.ai, abre Audio Generator, pega el guion que quieres que se lea, elige una voz (o déjala en Auto) y describe la interpretación —tono, acento, ritmo, emoción— en el campo Voice Instructions. El modelo lee tu texto con ese estilo y devuelve un MP3 que puedes descargar o superponer a un vídeo. No hay sesión de grabación ni actor de voz que contratar; el texto escrito y una breve nota de estilo son toda la entrada.

Comprobado con el workflow real, julio de 2026: Las entradas, el número de voces, la cobertura de idiomas, el comportamiento del control de estilo y el formato de salida que se explican a continuación se verificaron con el pipeline actual de Audio Generator. Esta guía no presupone controles que el formulario no ofrece.

Cómo generar una voz en off en cinco pasos

  1. Abre Audio Generator. Empieza desde el pipeline Audio Generator. Utiliza Gemini 2.5 TTS, con 30 voces en 73 idiomas.
  2. Pega tu texto. Introduce las palabras exactas que quieres que se lean. La puntuación importa aquí: controla las pausas (ver más abajo).
  3. Elige una voz. Déjala en Auto para que el modelo asigne una voz según tu nota de estilo, o fija una voz concreta (Zephyr, Puck, Kore y otras) cuando quieras el mismo personaje en varios clips.
  4. Describe la interpretación. En Voice Instructions, escribe cómo debe sonar: «acento británico cálido, ritmo lento con pausas dramáticas» o «alegre y animada, ágil». Es una indicación en lenguaje sencillo, no controles numéricos.
  5. Genera y escucha. La salida es un MP3. Comprueba el ritmo y cualquier nombre o número complicado, ajusta el texto o la indicación y vuelve a generar si hace falta.

Audio Generator toma un texto, una voz opcional y una indicación de estilo opcional, y devuelve un único MP3. La duración del audio depende de la longitud del texto —no hay un control de duración aparte—, así que el propio guion determina cuánto dura el clip.

Escribe un texto que el modelo lea bien

Como las palabras son el guion, pequeños cambios en el texto afectan al resultado más que ninguna otra cosa. Algunos hábitos ayudan:

  • Escribe frases cortas y claras. Marcan mejor el ritmo que las oraciones largas y cargadas de subordinadas, y dan al modelo lugares naturales para respirar.
  • Usa la puntuación para dar forma a las pausas. Un punto es una parada completa, una coma una pausa breve y unos puntos suspensivos una más larga. Añade comas donde quieras que la interpretación se ralentice.
  • Escribe las palabras difíciles tal como suenan si un nombre, sigla o número se lee mal, y vuelve a generar.
  • Mantén una voz por personaje. Fija una voz concreta para un narrador recurrente y así el sonido se mantiene constante entre clips; usa Auto cuando solo necesites una buena coincidencia para una única pieza.

Para el estilo en sí, describe el acento, la emoción y la velocidad en conjunto. Por ejemplo:

Narrador tranquilo y reconfortante. Un ritmo suave y sin prisas, con pausas claras entre frases. Acento neutro, cálido pero no demasiado brillante.

La guía de generación de voz de Gemini de Google recomienda este tipo de indicación en lenguaje natural en lugar de intentar codificar el tono como parámetros. El control de estilo es expresivo pero no exacto, así que trata la indicación como una orientación y ajústala después de escuchar.

Voces, duración y los límites que conviene conocer

Hay algunos comportamientos con los que es fácil tropezar:

  • La duración depende del texto. No hay un selector de duración; un guion más largo produce un clip más largo. Recorta o amplía las palabras para cambiar la duración.
  • Los guiones muy largos se dividen en fragmentos. El pipeline divide el texto largo, genera cada parte y las une, lo que puede dejar una leve unión en un empalme. Dividir un guion largo en párrafos naturales ayuda.
  • El estilo es orientativo, no preciso. Las indicaciones dirigen el tono y el ritmo, pero no alcanzarán una emoción o un tiempo exactos en cada ejecución; vuelve a generar en lugar de esperar un único resultado fijo.
  • Habla, no canta ni compone. Para música o una base instrumental, utiliza Music Generator; Audio Generator es solo voz.

Pon la voz en off en un vídeo

Una voz generada resulta más útil unida a la imagen. El camino habitual es Audio Generator → Video Reel: crea la narración y luego añádela mediante la entrada Narration de Video Reel, mientras la música de fondo se mantiene en su propia entrada, de modo que la voz y la música se mezclan con la voz por delante. Si además quieres una base musical bajo la narración, genera una con Music Generator y adjunta ambas.

Para la secuencia de producción completa —planificar las tomas, generar los clips, añadir narración y música, y después subtítulos y marca— sigue cómo crear vídeos con IA. Para equilibrar una banda sonora con la voz, consulta cómo añadir música a un vídeo, y para generar la música en sí, consulta cómo generar música con IA.

Conserva el guion, el MP3 generado y cualquier vídeo final como recursos independientes. Así podrás volver a poner voz a una frase o cambiar la interpretación sin rehacer el resto del proyecto.

Preguntas frecuentes

¿Cómo se genera una voz con IA a partir de texto?

Pega tu guion, elige una voz y describe la interpretación que quieres. En Pipe2.ai, abre Audio Generator, introduce el texto, elige una voz o déjala en Auto y escribe una indicación de estilo como «cálida, sin prisas, como un locutor de radio nocturna». El modelo lee el texto con ese estilo y devuelve un MP3 que puedes descargar o superponer a un vídeo.

¿Cuántas voces e idiomas hay disponibles?

Audio Generator ofrece 30 voces distintas y cubre 73 idiomas mediante Gemini 2.5 TTS. Deja la voz en Auto para que el modelo elija una que encaje con tu indicación de estilo, o fija una voz concreta cuando quieras el mismo personaje en varios clips.

¿Puedo controlar el tono, el acento y el ritmo de la voz?

Sí, a través del campo Voice Instructions, en lenguaje sencillo en lugar de parámetros numéricos. Describe el acento, la emoción y la velocidad; por ejemplo, «tranquila y reconfortante, lenta y con pausas claras». La puntuación también determina la interpretación: los puntos crean paradas completas, las comas pausas breves y los puntos suspensivos una pausa más larga.

¿Qué duración puede tener la voz generada?

La duración del audio depende de la longitud de tu texto y no de un ajuste de duración. Los guiones largos se dividen automáticamente en fragmentos que después se unen, por lo que un texto muy largo puede presentar leves uniones en los empalmes. Escribir frases cortas y claras mantiene un ritmo uniforme.

¿Puede la voz con IA cantar o hacer efectos de sonido?

No. Audio Generator está pensado para texto a voz hablado, no para canto ni interpretación musical, y tampoco para efectos de sonido. Para música de fondo o una pista instrumental, utiliza Music Generator; para una voz en off más música en un mismo vídeo, combina ambas en Video Reel.

Míralo en acción

Prueba estos pipelines

Artículos relacionados