Generador de audio

Desde 0.002 créditos

Convierte texto en una locución natural. Elige entre decenas de voces y más de 70 idiomas, y da indicaciones sobre el tono, el acento y el ritmo.

AI
Auto
La IA elige la mejor voz según tus instrucciones y tu texto
O elige una voz específica...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Aún falta: Texto

Ejemplos

AudioGemini 2.5 Flash TTS

Conoce a Pyra: voz en off

Gemini 2.5 Flash TTS. La propia historia de Pyra, leída con una cálida voz de narrador: una voz en off lista para colocar en cualquier video.

Cómo usar Generador de audio

Una guía de decisión concisa para ubicar este pipeline en un flujo de trabajo.

Ideal para

  • Narraciones y locuciones en más de 70 idiomas
  • Texto a voz con control de estilo mediante lenguaje natural (p. ej. «habla con calidez», «susurra», «tono entusiasmado»)
  • Contenido con varias voces y decenas de timbres expresivos
  • Guiones multilingües cuyo idioma se detecta automáticamente a partir del texto

Consejos

  • Escribe la narración con frases cortas y claras para conseguir un ritmo más natural
  • Usa la puntuación para marcar las pausas: punto para una pausa completa, coma para una pausa breve y puntos suspensivos para una pausa más larga
  • Deja la voz en Auto para que la IA elija la que mejor encaje con el estilo, o selecciona una voz concreta si quieres mantener un personaje recurrente
  • Describe el estilo con naturalidad: «habla despacio y con dramatismo», «tono alegre y dinámico», «voz tranquila y reconfortante»

API de Generador de audio

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

Obtener un token de API
entradas
5
obligatorio
1
Precios
0.002 to 40.0 créditos
Idioma
Idioma
bun add @pipe2-ai/sdk
Ejecutar un pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});

pip install pipe2
Ejecutar un pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Ejecutar un pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Ejecutar un pipeline
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Referencia completa de la API Referencia de la CLI

Preguntas frecuentes

¿Qué voces están disponibles?
Hay decenas de voces expresivas, con timbres luminosos, graves, cálidos, firmes o dramáticos. Todas responden a instrucciones escritas con naturalidad para ajustar el tono y la interpretación.
¿Qué idiomas son compatibles?
Más de 70 idiomas con detección automática, desde lenguas mayoritarias como el inglés, el chino, el japonés y el español hasta otras regionales como el cebuano, el konkani y el luxemburgués.
¿Cómo funcionan las instrucciones?
Describe con tus propias palabras cómo quieres que suene la voz. Por ejemplo: «Un periodista británico de 40 años que habla despacio y hace pausas dramáticas en los puntos clave». La IA utiliza esa indicación para adaptar la interpretación vocal.
¿En qué formato de audio se genera el resultado?
En MP3, listo para descargar o usar como pista de narración en pipelines como Video Reel.
¿Qué modelo debería elegir?
Flash TTS es la opción más rápida y económica, ideal para borradores, clips cortos e iteraciones. Pro TTS ofrece mayor fidelidad, prosodia y control del ritmo; elígelo para narraciones listas para producción. Ambos generan el audio en segundos, aunque Pro tarda un poco más.
¿Cuántos créditos cuesta?
0.002 to 40.0 créditos, según el modelo. Flash TTS es la opción más económica y Pro TTS cuesta algo más. El audio estará listo en segundos.

Generador de texto a voz con IA

Convierte cualquier texto en una locución natural con decenas de voces y más de 70 idiomas. Describe con tus propias palabras el tono, el acento, el ritmo y la emoción, y obtén en segundos una voz lista para producción.

Lo que puedes crear

  • Narración de documentales: voces profesionales y convincentes
  • Intros, cierres y diálogos de pódcast: interpretación con varias voces
  • Locuciones multilingües: el mismo guion en más de 70 idiomas
  • Narración de audiolibros: ritmo expresivo con indicaciones dentro de cada frase
  • Accesibilidad: ofrece tus contenidos de texto también en audio

Cómo funciona

  1. Pega el texto: escribe exactamente lo que quieres que se diga
  2. Elige una voz o deja la opción en Auto: Auto busca la voz que mejor encaje con el texto y tus indicaciones
  3. Añade una indicación de estilo (opcional): describe el acento, el ritmo y la emoción, por ejemplo «acento británico cálido, ritmo pausado y pausas dramáticas»
  4. Elige un modelo: Flash TTS para borradores rápidos y Pro TTS para una prosodia con calidad de estudio en la versión final

Consejos de estilo

  • Escribe la narración con frases cortas y claras para conseguir un ritmo más natural
  • Usa la puntuación para marcar las pausas: punto para una pausa completa, coma para una pausa breve y puntos suspensivos para una pausa más larga
  • Expresa el estilo con naturalidad: «habla despacio y con dramatismo», «tono alegre y dinámico», «voz tranquila y reconfortante»

Explorar más pipelines

Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.4
Generador de imágenes
Generador de música
2.5-22.6
Generador de música
Editor de vídeo
13.1-33.3
Editor de vídeo