Gerador de Voz

A partir de 0.002 créditos

Transforme textos em fala natural com 30 vozes em 73 idiomas. Defina tom, sotaque, ritmo e emoção com instruções simples.

Crie sua primeira narração

Escreva o que quer dizer ou ouça um exemplo.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
Preencha para gerar

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

Exemplos

Conheça a Pyra: locução

Gemini 3.8 Flash TTS. A própria história da Pyra, lida com uma voz calorosa de narrador: uma locução pronta para entrar em qualquer vídeo.

Como usar Gerador de Voz

Um guia de decisão conciso para posicionar este pipeline em um fluxo de trabalho.

Ideal para

  • Narração e locução em mais de 70 idiomas
  • Conversão de texto em fala com controle de estilo em linguagem natural (ex.: 'fale com acolhimento', 'sussurre', 'tom animado')
  • Conteúdo com várias vozes, usando dezenas de vozes expressivas
  • Roteiros multilíngues, o idioma é detectado automaticamente a partir do texto

Dicas

  • Escreva a narração em frases curtas e claras para um ritmo melhor
  • Use a pontuação para controlar as pausas: pontos finais para paradas completas, vírgulas para pausas breves, reticências para pausas longas
  • Deixe a voz em Automático e a IA escolhe uma que combine com as instruções de estilo, ou fixe uma voz específica se quiser um personagem recorrente
  • Use dicas de estilo em linguagem natural: 'fale devagar e de forma dramática', 'alegre e animado', 'calmo e tranquilizador'

API do Gerador de Voz

Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.

Obter um token de API
entradas
5
obrigatório
1
Preços
0.002 to 40.0 créditos
Idioma
Idioma
bun add @pipe2-ai/sdk
Executar um pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
Executar um pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Executar um pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Executar um pipeline
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

Referência completa da API Referência da CLI

Perguntas frequentes

Quais vozes estão disponíveis?
Dezenas de vozes expressivas, abrangendo personagens vibrantes, graves, acolhedores, firmes e dramáticos. Cada uma responde a instruções de estilo em linguagem comum para tom e interpretação.
Quais idiomas são suportados?
Mais de 70 idiomas com detecção automática. De idiomas principais como inglês, chinês, japonês e espanhol a idiomas regionais como cebuano, concani e luxemburguês.
Como funcionam as instruções?
Descreva em linguagem comum como você quer que a voz soe. Por exemplo: 'Um jornalista britânico de 40 anos, falando devagar com pausas dramáticas nos pontos-chave.' A IA interpreta a sua direção e cria a performance vocal.
Qual é o formato de áudio do resultado?
Um arquivo MP3, pronto para baixar ou usar como faixa de narração no Video Reel.
Qual modelo devo escolher?
O Gemini 3.8 Flash-Lite TTS é o mais rápido e barato, ideal para rascunhos e clipes curtos. O Gemini 3.8 Flash TTS oferece narração com qualidade de estúdio em mais de 130 idiomas. O Eleven v4 é o mais expressivo: ri, suspira ou sussurra onde você marcar. O MiniMax Speech 2.8 Turbo e o HD são uma alternativa rápida e outra de maior fidelidade. Todos entregam um MP3 em segundos.
Quantos créditos custa?
0.002 to 40.0 créditos, dependendo do modelo e do tamanho do texto. Os modelos Gemini cobram apenas pelo áudio realmente gerado. Os resultados ficam prontos em segundos.

Gerador de voz por IA

Converta qualquer texto em uma fala natural, escolhendo entre dezenas de vozes e mais de 70 idiomas. Descreva em linguagem simples o tom, o sotaque, o ritmo e a emoção para receber uma narração pronta para uso em poucos segundos.

O que você pode criar

  • Narração de documentários: vozes profissionais e cheias de autoridade
  • Introduções, encerramentos e diálogos de podcast: interpretação com vários personagens
  • Narrações multilíngues: produza o mesmo roteiro em mais de 70 idiomas
  • Narração de audiolivros: controle o ritmo e as nuances emocionais ao longo de cada frase
  • Acessibilidade: disponibilize conteúdo de texto em áudio

Como funciona

  1. Cole o seu texto: o que você quer que seja falado
  2. Escolha uma voz ou deixe em Automático: o modo Automático escolhe a melhor voz com base no seu texto e nas instruções
  3. Adicione uma instrução de estilo (opcional): descreva o sotaque, o ritmo e a emoção, por exemplo "sotaque britânico acolhedor, ritmo lento com pausas dramáticas"
  4. Escolha um modelo: Gemini 3.8 Flash-Lite TTS para rascunhos rápidos e baratos, Gemini 3.8 Flash TTS para narração com qualidade de estúdio, Eleven v4 para a interpretação mais expressiva, ou MiniMax Speech 2.8

Dicas de estilo

  • Escreva a narração em frases curtas e claras para um ritmo melhor
  • Use a pontuação para controlar as pausas: ponto-final para uma parada completa, vírgula para uma pausa breve e reticências para uma pausa mais longa
  • Escreva as instruções em linguagem comum: "fale devagar e de forma dramática", "alegre e animado", "calmo e tranquilizador"

Explorar mais pipelines

Gerador de Vídeo
from 9.5
Gerador de Vídeo
Gerador de Imagens
0.2-6.7
Gerador de Imagens
Gerador de Música
2.5-22.6
Gerador de Música
Editor de Vídeo
from 9.5
Editor de Vídeo