Voltar aos pipelines

Gerador de Áudio

Transforme texto em fala natural com dezenas de vozes, mais de 70 idiomas e direções de estilo personalizadas para tom, sotaque e ritmo.

0.7
AI
Automático
A IA escolhe a melhor voz com base nas suas instruções e no texto
Ou escolha uma voz específica...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Ainda falta: Texto

Funciona com

API

Exemplos

ÁudioGemini 2.5 Flash TTS

Conheça a Pyra: locução

Gemini 2.5 Flash TTS. A própria história da Pyra, lida com uma voz calorosa de narrador: uma locução pronta para entrar em qualquer vídeo.

Ideal para

  • Narração e locução em mais de 70 idiomas
  • Conversão de texto em fala com controle de estilo em linguagem natural (ex.: 'fale com acolhimento', 'sussurre', 'tom animado')
  • Conteúdo com várias vozes, usando dezenas de vozes expressivas
  • Roteiros multilíngues, o idioma é detectado automaticamente a partir do texto

Dicas

  • Escreva a narração em frases curtas e claras para um ritmo melhor
  • Use a pontuação para controlar as pausas: pontos finais para paradas completas, vírgulas para pausas breves, reticências para pausas longas
  • Deixe a voz em Automático e a IA escolhe uma que combine com as instruções de estilo, ou fixe uma voz específica se quiser um personagem recorrente
  • Use dicas de estilo em linguagem natural: 'fale devagar e de forma dramática', 'alegre e animado', 'calmo e tranquilizador'

Artigos sobre este pipeline

API do Gerador de Áudio

Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.

4 entradas
1 obrigatório
0.7 to 1.3 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Obter um token de API →

Parâmetros

text obrigatório

Texto a converter em fala.

string
instructions

Descreva tom, sotaque, ritmo e emoção. A IA cria um prompt de estilo detalhado.

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts predefinição gemini-2-5-flash-tts
Ver as 4 entradas
voice

Nome da voz entre dezenas disponíveis, ou auto para a IA escolher.

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat predefinição auto

Use a partir de um agente de IA

Aponte qualquer cliente MCP para o pipe2 e o seu agente ganha estas ferramentas. Ele encontra este pipeline, lê o mesmo esquema acima e executa-o.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referência completa da API Configuração de MCP Referência da CLI

Gerador de Texto para Fala com IA

Transforme qualquer texto em fala com som natural em dezenas de vozes e mais de 70 idiomas. Controle tom, sotaque, ritmo e emoção com instruções em linguagem comum, narração pronta para produção em segundos.

O que você pode criar

  • Narração de documentários: vozes profissionais e cheias de autoridade
  • Introduções, encerramentos e diálogos de podcast: interpretação com vários personagens
  • Narrações multilíngues: cubra o mesmo roteiro em mais de 70 idiomas
  • Narração de audiolivros: ritmo emocional com direção no meio da frase
  • Acessibilidade: disponibilize conteúdo de texto em áudio

Como funciona

  1. Cole o seu texto: o que você quer que seja falado
  2. Escolha uma voz ou deixe em Automático: o modo Automático escolhe a melhor voz com base no seu texto e nas instruções
  3. Adicione uma dica de estilo (opcional), descreva sotaque, ritmo, emoção: "sotaque britânico acolhedor, ritmo lento com pausas dramáticas"
  4. Escolha um modelo: Flash TTS para rascunhos rápidos, Pro TTS para prosódia de estúdio na entrega final

Dicas de estilo

  • Escreva a narração em frases curtas e claras para um ritmo melhor
  • Use a pontuação para controlar as pausas, pontos finais para paradas completas, vírgulas para pausas breves, reticências para pausas longas
  • As dicas de estilo aceitam linguagem comum: "fale devagar e de forma dramática", "alegre e animado", "calmo e tranquilizador"

Perguntas frequentes

Quais vozes estão disponíveis?
Dezenas de vozes expressivas, abrangendo personagens vibrantes, graves, acolhedores, firmes e dramáticos. Cada uma responde a instruções de estilo em linguagem comum para tom e interpretação.
Quais idiomas são suportados?
Mais de 70 idiomas com detecção automática. De idiomas principais como inglês, chinês, japonês e espanhol a idiomas regionais como cebuano, concani e luxemburguês.
Como funcionam as instruções?
Descreva em linguagem comum como você quer que a voz soe. Por exemplo: 'Um jornalista britânico de 40 anos, falando devagar com pausas dramáticas nos pontos-chave.' A IA interpreta a sua direção e cria a performance vocal.
Qual é o formato de áudio do resultado?
MP3, pronto para baixar ou encadear em pipelines como o Video Reel como faixa de narração.
Qual modelo devo escolher?
O Flash TTS é o caminho mais barato e rápido, ótimo para rascunhos, clipes curtos e iteração. O Pro TTS usa um modelo de maior fidelidade, com prosódia e ritmo mais fortes, escolha-o para narração de produção. Ambos renderizam em segundos; o Pro leva um instante a mais.
Quantos créditos custa?
0.7 to 1.3 créditos dependendo do modelo, o Flash TTS é a opção mais barata e o Pro TTS custa um pouco mais. Os resultados ficam prontos em segundos.

Explorar mais pipelines

Ver tudo →
Gerador de Vídeo
from 9.5
Gerador de Vídeo
Gerador de Imagens
0.2-6.4
Gerador de Imagens
Gerador de Música
2.5-45.1
Gerador de Música
Editor de Vídeo
13.1-29.8
Editor de Vídeo