Generador de voz IA: cómo convertir texto en habla natural
Usa Audio Generator de Pipe2.ai para convertir un guion en una voz MP3 con elección de modelo, selección de voz y control en lenguaje natural del tono, el acento y el ritmo.
Guía práctica Por Pipe2.ai Actualizado August 31, 2026
En esta página
Prueba estos pipelines
Un generador de voz IA convierte un guion escrito en audio hablado. En Pipe2.ai, Audio Generator recibe texto, una elección de modelo, una voz opcional e instrucciones de estilo opcionales, y devuelve un MP3 que puedes descargar o usar como narración en un vídeo. El flujo práctico es directo: escribe las palabras, describe cómo deben sonar, genera, escucha y ajusta.
Verificado con el seed y el workflow de Audio Generator el 2026-08-31: Este artículo refleja el formulario público actual:
textes obligatorio;model,voice,instructionsyenhance_promptson opcionales; el recurso devuelto es audio MP3. No presupone controles de duración, canto, efectos sonoros, clonación de voz ni acceso anónimo.
Genera una voz con IA en cinco pasos
- Abre Audio Generator. Empieza en el pipeline Audio Generator. Es el pipeline de Pipe2 para convertir texto en habla.
- Elige el modelo. Usa Gemini 2.5 Flash TTS como opción predeterminada más rápida y económica, Gemini 2.5 Pro TTS cuando la prosodia y el ritmo importen más, o una opción MiniMax Speech 2.8 si ese conjunto de voces encaja mejor.
- Pega el guion. Introduce las palabras exactas que quieres que se pronuncien. Para contenido multilingüe, escribe el texto en el idioma de destino; el pipeline está preparado para más de 70 idiomas e infiere el idioma a partir del guion.
- Elige voz y estilo. Deja la voz en Auto si quieres que el modelo la adapte al texto y a la instrucción, o fija una voz con nombre cuando el mismo narrador deba repetirse en varios clips. En Voice Instructions, describe la actuación con lenguaje normal: «narrador documental cálido, acento neutro, pausado y con pausas claras».
- Genera y escucha. La salida es un único MP3. Revisa ritmo, pronunciación, números y tono. Si algo no encaja, edita el texto o la instrucción y crea otra versión.
Mantén Enhance prompt activado si quieres que Pipe2 adapte la instrucción al modelo seleccionado. Desactívalo cuando necesites que tu texto se envíe sin cambios.
Qué acepta y qué devuelve Audio Generator
Audio Generator es un pipeline de texto a voz, no un editor de grabaciones. La entrada obligatoria es el texto escrito. Los controles opcionales son el modelo, la voz, las instrucciones de estilo y la mejora del prompt. La salida es audio MP3.
Eso significa que la duración de la locución depende del texto. No hay un control de duración separado. Un guion más largo produce una pista de voz más larga; uno más corto produce una pista más breve. Los textos muy largos pueden dividirse y volver a unirse en el workflow, así que las narraciones largas se manejan mejor si las separas en secciones naturales y revisas cada una antes del montaje final.
La descripción pública actual posiciona Audio Generator para narración, voz en off, guiones multilingües, lectura tipo audiolibro, intros de podcast, audio accesible y narración de vídeo. No es la herramienta adecuada para música ni efectos sonoros. Para eso usa Music Generator y conserva la voz generada como un recurso separado.
Elige el modelo y la voz adecuados
La elección del modelo afecta a velocidad, estilo y coste:
- Gemini 2.5 Flash TTS es el modelo predeterminado más rápido y económico para borradores, clips sociales cortos e iteración.
- Gemini 2.5 Pro TTS es la opción Gemini de mayor fidelidad para narración final, sobre todo cuando el ritmo de las frases y las pausas sostienen el mensaje.
- MiniMax Speech 2.8 Turbo es una opción MiniMax más rápida para borradores y clips sociales.
- MiniMax Speech 2.8 HD es la opción MiniMax más pulida para narración final.
El coste no es una cifra fija para todas las locuciones. Gemini TTS usa tramos por modelo, mientras que MiniMax Speech 2.8 se calcula por caracteres generados en el catálogo de facturación actual. Comprueba la estimación antes de ejecutar un guion largo y prueba primero un fragmento corto.
Para la voz, Auto resulta útil cuando importa más el encaje que la continuidad. Una voz con nombre es mejor cuando un narrador, personaje o voz de marca debe mantenerse constante entre varios recursos. Si falla una pronunciación, ajusta el propio guion: escribe una sigla completa, reformula un nombre fonéticamente o añade puntuación donde la frase necesite respirar.
Escribe texto que la voz pueda leer bien
El guion es el control más potente que tienes. Pequeños cambios de escritura suelen importar más que otra ejecución del modelo:
- Escribe frases cortas. Las frases largas y encadenadas pueden sonar apresuradas o planas. Las frases cortas dan pausas naturales.
- Usa la puntuación con intención. Un punto es una parada completa, una coma una pausa breve y los puntos suspensivos una pausa más larga. Añade comas donde quieras una lectura más lenta.
- Pon la dirección en la instrucción. «Calmada, tranquilizadora, lenta, con acento neutro» es más claro que «profesional».
- Previsualiza las líneas difíciles. Nombres, siglas, precios, fechas y nombres de producto merecen una prueba antes de narrar todo el texto.
- Mantén las tomas modulares. Para un vídeo largo, genera secciones por separado para poder reemplazar un párrafo sin rehacer todo el guion.
Una instrucción útil combina personaje, tono, acento y ritmo:
Narrador de producto calmado. Acento estadounidense neutro, cálido pero no entusiasmado. Lo bastante lento para un tutorial, con pausas claras después de cada frase.
Trata la instrucción como dirección de interpretación, no como un panel determinista. Si la entrega está cerca pero aún no funciona, ajusta el texto y genera otra toma.
Pon la voz en off en un vídeo
Una voz generada funciona mejor cuando se mantiene separada hasta el montaje final. Crea el MP3 en Audio Generator y añádelo a Video Reel mediante la entrada Narration. Mantén la música de fondo en su propia entrada para que la mezcla deje la voz delante. Si necesitas música, créala primero con Music Generator.
Para una producción más completa, Cómo hacer vídeos con IA explica cómo planificar tomas, generar clips, añadir narración, sumar música y terminar con subtítulos o marca. Si lo difícil es equilibrar una banda sonora con la voz, lee Cómo añadir música a un vídeo. Si todavía necesitas la pista de fondo, usa Cómo generar música con IA.
Conserva el guion, el MP3 generado y el vídeo final como recursos separados. Así, volver a grabar una frase o cambiar la interpretación será una edición pequeña, no una reconstrucción completa.
Preguntas frecuentes
¿Qué es un generador de voz IA?
Un generador de voz IA convierte texto escrito en audio hablado. En Pipe2.ai, Audio Generator recibe tu guion, una voz opcional, instrucciones de estilo opcionales y una elección de modelo, y devuelve un MP3 descargable.
¿Cómo se genera una voz con IA a partir de texto?
Abre Audio Generator, elige un modelo, pega las palabras exactas que quieres oír, selecciona una voz o deja Auto y describe la interpretación en Voice Instructions. Genera el resultado, escucha el MP3 y ajusta el guion o la instrucción si el ritmo, la pronunciación de nombres o el tono necesitan trabajo.
¿Qué modelo de Audio Generator debo elegir?
Gemini 2.5 Flash TTS es la opción predeterminada más rápida y económica para borradores y clips cortos. Gemini 2.5 Pro TTS está pensado para narración final con mejor prosodia y ritmo. MiniMax Speech 2.8 Turbo y HD también están disponibles para voz multilingüe; Turbo se orienta a borradores rápidos y HD a locuciones finales más pulidas.
¿Puedo controlar el tono, el acento y el ritmo de la voz?
Sí, mediante Voice Instructions. Describe la interpretación con lenguaje normal, por ejemplo «calmada y tranquilizadora, lenta y con pausas claras» o «brillante, ágil y enérgica». La puntuación también importa: los puntos crean pausas completas, las comas pausas breves y los puntos suspensivos pausas más largas.
¿La voz con IA puede cantar, hacer música o crear efectos sonoros?
No. Audio Generator es para texto a voz hablado. No crea canto, música, efectos sonoros, transcripciones ni clones de voz. Para música de fondo usa Music Generator; para un vídeo que combine narración y música, monta los recursos en Video Reel.