Volver a los pipelines

Generador de audio

Convierte texto en voz natural con decenas de voces, más de 70 idiomas e indicaciones de estilo personalizadas para el tono, el acento y el ritmo.

0.7
AI
Auto
La IA elige la mejor voz según tus instrucciones y tu texto
O elige una voz específica...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Aún falta: Texto

Funciona con

API

Ejemplos

AudioGemini 2.5 Flash TTS

Conoce a Pyra: voz en off

Gemini 2.5 Flash TTS. La propia historia de Pyra, leída con una cálida voz de narrador: una voz en off lista para colocar en cualquier video.

Ideal para

  • Narración y locución en más de 70 idiomas
  • Texto a voz con control de estilo en lenguaje natural (p. ej. «habla con calidez», «susurra», «tono entusiasmado»)
  • Contenido con varias voces, con decenas de voces expresivas
  • Guiones multilingües: el idioma se detecta automáticamente a partir del texto

Consejos

  • Escribe la narración con frases cortas y claras para un mejor ritmo
  • Usa la puntuación para controlar las pausas: los puntos para pausas completas, las comas para pausas breves y los puntos suspensivos para pausas largas
  • Deja la voz en Automático y la IA elige una que encaje con las instrucciones de estilo, o fija una voz concreta si quieres un personaje recurrente
  • Usa indicaciones de estilo en lenguaje natural: «habla despacio y con dramatismo», «alegre y animado», «tranquilo y reconfortante»

Artículos sobre este pipeline

API de Generador de audio

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

4 entradas
1 obligatorio
0.7 to 1.3 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Obtener un token de API →

Parámetros

text obligatorio

Texto para convertir en voz.

string
instructions

Describe el tono, el acento, el ritmo y la emoción. La IA elabora un prompt de estilo detallado.

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts por defecto gemini-2-5-flash-tts
Ver las 4 entradas
voice

Nombre de voz entre docenas disponibles, o auto para que la IA elija.

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat por defecto auto

Úsalo desde un agente de IA

Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referencia completa de la API Configuración de MCP Referencia de la CLI

Generador de texto a voz con IA

Convierte cualquier texto en voz de sonido natural con decenas de voces y más de 70 idiomas. Controla el tono, el acento, el ritmo y la emoción mediante instrucciones en lenguaje corriente: locución lista para producción en segundos.

Lo que puedes crear

  • Narración de documentales: voces profesionales y con autoridad
  • Intros, cierres y diálogos de pódcast: interpretación con varios personajes
  • Locuciones multilingües: cubre el mismo guión en más de 70 idiomas
  • Narración de audiolibros: ritmo emotivo con indicaciones a mitad de frase
  • Accesibilidad: haz que el contenido de texto esté disponible como audio

Cómo funciona

  1. Pega tu texto: lo que quieres que se diga
  2. Elige una voz o déjala en Automático: Automático elige la mejor voz según tu texto y tus instrucciones
  3. Añade una indicación de estilo (opcional): describe el acento, el ritmo y la emoción: «acento británico cálido, ritmo lento con pausas dramáticas»
  4. Elige un modelo: Flash TTS para borradores rápidos, Pro TTS para una prosodia de calidad de estudio en la entrega final

Consejos de estilo

  • Escribe la narración con frases cortas y claras para un mejor ritmo
  • Usa la puntuación para controlar las pausas: los puntos para pausas completas, las comas para pausas breves y los puntos suspensivos para pausas largas
  • Las indicaciones de estilo admiten lenguaje corriente: «habla despacio y con dramatismo», «alegre y animado», «tranquilo y reconfortante»

Preguntas frecuentes

¿Qué voces están disponibles?
Decenas de voces expresivas que abarcan personajes brillantes, graves, cálidos, firmes y dramáticos. Cada una responde a instrucciones de estilo en lenguaje corriente para el tono y la interpretación.
¿Qué idiomas son compatibles?
Más de 70 idiomas con detección automática. Desde idiomas mayoritarios como el inglés, el chino, el japonés y el español hasta idiomas regionales como el cebuano, el konkani y el luxemburgués.
¿Cómo funcionan las instrucciones?
Describe en lenguaje corriente cómo quieres que suene la voz. Por ejemplo: «Un periodista británico de 40 años que habla despacio con pausas dramáticas en los puntos clave». La IA interpreta tu indicación y elabora la interpretación vocal.
¿En qué formato de audio se genera el resultado?
MP3, listo para descargar o encadenar en pipelines como Montaje de vídeo como pista de narración.
¿Qué modelo debería elegir?
Flash TTS es la vía más barata y rápida: ideal para borradores, clips cortos e iteración. Pro TTS usa un modelo de mayor fidelidad con mejor prosodia y ritmo: elígelo para narración de producción. Ambos se renderizan en segundos; Pro tarda un instante más.
¿Cuántos créditos cuesta?
0.7 to 1.3 créditos según el modelo: Flash TTS es la opción más barata y Pro TTS cuesta un poco más. Los resultados están listos en segundos.

Explorar más pipelines

Ver todo →
Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.4
Generador de imágenes
Generador de música
2.5-45.1
Generador de música
Editor de vídeo
13.1-29.8
Editor de vídeo