Generador de audio

Desde 0.002 créditos

Convierte texto en una locución natural. Elige entre decenas de voces y más de 70 idiomas, y da indicaciones sobre el tono, el acento y el ritmo.

Crea tu primera narración

Escribe lo que quieres decir o escucha un ejemplo.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
Completa para generar

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

Ejemplos

Conoce a Pyra: voz en off

Gemini 3.8 Flash TTS. La propia historia de Pyra, leída con una cálida voz de narrador: una voz en off lista para colocar en cualquier video.

Cómo usar Generador de audio

Una guía de decisión concisa para ubicar este pipeline en un flujo de trabajo.

Ideal para

  • Narraciones y locuciones en más de 70 idiomas
  • Texto a voz con control de estilo mediante lenguaje natural (p. ej. «habla con calidez», «susurra», «tono entusiasmado»)
  • Contenido con varias voces y decenas de timbres expresivos
  • Guiones multilingües cuyo idioma se detecta automáticamente a partir del texto

Consejos

  • Escribe la narración con frases cortas y claras para conseguir un ritmo más natural
  • Usa la puntuación para marcar las pausas: punto para una pausa completa, coma para una pausa breve y puntos suspensivos para una pausa más larga
  • Deja la voz en Auto para que la IA elija la que mejor encaje con el estilo, o selecciona una voz concreta si quieres mantener un personaje recurrente
  • Describe el estilo con naturalidad: «habla despacio y con dramatismo», «tono alegre y dinámico», «voz tranquila y reconfortante»

API de Generador de audio

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

Obtener un token de API
entradas
5
obligatorio
1
Precios
0.002 to 40.0 créditos
Idioma
Idioma
bun add @pipe2-ai/sdk
Ejecutar un pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
Ejecutar un pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Ejecutar un pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Ejecutar un pipeline
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

Referencia completa de la API Referencia de la CLI

Preguntas frecuentes

¿Qué voces están disponibles?
Hay decenas de voces expresivas, con timbres luminosos, graves, cálidos, firmes o dramáticos. Todas responden a instrucciones escritas con naturalidad para ajustar el tono y la interpretación.
¿Qué idiomas son compatibles?
Más de 70 idiomas con detección automática, desde lenguas mayoritarias como el inglés, el chino, el japonés y el español hasta otras regionales como el cebuano, el konkani y el luxemburgués.
¿Cómo funcionan las instrucciones?
Describe con tus propias palabras cómo quieres que suene la voz. Por ejemplo: «Un periodista británico de 40 años que habla despacio y hace pausas dramáticas en los puntos clave». La IA utiliza esa indicación para adaptar la interpretación vocal.
¿En qué formato de audio se genera el resultado?
En MP3, listo para descargar o usar como pista de narración en pipelines como Video Reel.
¿Qué modelo debería elegir?
Gemini 3.8 Flash-Lite TTS es la opción más rápida y económica, ideal para borradores y clips cortos. Gemini 3.8 Flash TTS ofrece narraciones con calidad de estudio en más de 130 idiomas. Eleven v4 es el más expresivo: ríe, suspira o susurra donde lo marques. MiniMax Speech 2.8 Turbo y HD son una alternativa rápida y otra de mayor fidelidad. Todos entregan un MP3 en segundos.
¿Cuántos créditos cuesta?
0.002 to 40.0 créditos, según el modelo y la longitud del texto. Los modelos Gemini cobran solo el audio que realmente generan. El audio estará listo en segundos.

Generador de texto a voz con IA

Convierte cualquier texto en una locución natural con decenas de voces y más de 70 idiomas. Describe con tus propias palabras el tono, el acento, el ritmo y la emoción, y obtén en segundos una voz lista para producción.

Lo que puedes crear

  • Narración de documentales: voces profesionales y convincentes
  • Intros, cierres y diálogos de pódcast: interpretación con varias voces
  • Locuciones multilingües: el mismo guion en más de 70 idiomas
  • Narración de audiolibros: ritmo expresivo con indicaciones dentro de cada frase
  • Accesibilidad: ofrece tus contenidos de texto también en audio

Cómo funciona

  1. Pega el texto: escribe exactamente lo que quieres que se diga
  2. Elige una voz o deja la opción en Auto: Auto busca la voz que mejor encaje con el texto y tus indicaciones
  3. Añade una indicación de estilo (opcional): describe el acento, el ritmo y la emoción, por ejemplo «acento británico cálido, ritmo pausado y pausas dramáticas»
  4. Elige un modelo: Gemini 3.8 Flash-Lite TTS para borradores rápidos y económicos, Gemini 3.8 Flash TTS para narraciones con calidad de estudio, Eleven v4 para la interpretación más expresiva, o MiniMax Speech 2.8

Consejos de estilo

  • Escribe la narración con frases cortas y claras para conseguir un ritmo más natural
  • Usa la puntuación para marcar las pausas: punto para una pausa completa, coma para una pausa breve y puntos suspensivos para una pausa más larga
  • Expresa el estilo con naturalidad: «habla despacio y con dramatismo», «tono alegre y dinámico», «voz tranquila y reconfortante»

Explorar más pipelines

Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.7
Generador de imágenes
Generador de música
2.5-22.6
Generador de música
Editor de vídeo
from 9.5
Editor de vídeo