Generatore vocale

Da 0.002 crediti

Trasforma un testo in una voce naturale scegliendo tra 30 voci in 73 lingue. Definisci tono, accento, ritmo ed emozione con semplici istruzioni.

Crea la tua prima voce narrante

Scrivi quello che vuoi dire o ascolta un esempio.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
Completa per generare

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

Esempi

Ecco Pyra: voce fuori campo

Gemini 3.8 Flash TTS. La storia di Pyra, letta con una calda voce da narratore: una voce fuori campo da inserire subito in qualsiasi video.

Come usare Generatore vocale

Una guida decisionale concisa per inserire questa pipeline in un flusso di lavoro.

Ideale per

  • Narrazione e voce fuori campo in 73 lingue
  • Sintesi vocale con controllo dello stile in linguaggio naturale (es. 'parla con calore', 'sussurra', 'tono entusiasta')
  • Contenuti con più voci con decine di voci espressive
  • Copioni multilingue, la lingua viene rilevata automaticamente dal testo

Suggerimenti

  • Scrivi la narrazione in frasi brevi e chiare per un ritmo migliore
  • Usa la punteggiatura per controllare le pause: i punti per pause nette, le virgole per pause brevi, i puntini di sospensione per pause lunghe
  • Lascia la voce su Auto e l'IA ne sceglie una che corrisponde alle istruzioni di stile, oppure fissa una voce specifica se vuoi un personaggio ricorrente
  • Usa suggerimenti di stile in linguaggio naturale: 'parla lentamente e in modo drammatico', 'allegro ed energico', 'calmo e rassicurante'

API di Generatore vocale

Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.

Ottieni un token API
input
5
obbligatorio
1
Prezzi
0.002 to 40.0 crediti
Lingua
Lingua
bun add @pipe2-ai/sdk
Esegui una pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
Esegui una pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Esegui una pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Esegui una pipeline
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

Riferimento API completo Riferimento CLI

Domande frequenti

Quali voci sono disponibili?
Decine di voci espressive che spaziano tra caratteri brillanti, profondi, caldi, decisi e drammatici. Ognuna risponde a istruzioni di stile in linguaggio naturale per tono e resa.
Quali lingue sono supportate?
73 lingue con rilevamento automatico. Da lingue principali come inglese, cinese, giapponese e spagnolo a lingue regionali tra cui cebuano, konkani e lussemburghese.
Come funzionano le istruzioni?
Descrivi in linguaggio naturale come vuoi che suoni la voce. Ad esempio: 'Un giornalista britannico di 40 anni, che parla lentamente con pause drammatiche sui punti chiave.' L'IA interpreta le tue indicazioni e costruisce la performance vocale.
In quale formato viene fornito l'audio?
Un file MP3, pronto da scaricare o da usare come traccia di narrazione in Video Reel.
Quale modello dovrei scegliere?
Gemini 3.8 Flash-Lite TTS è il più veloce ed economico, ideale per bozze e clip brevi. Gemini 3.8 Flash TTS offre una narrazione di qualità da studio in oltre 130 lingue. Eleven v4 è il più espressivo: ride, sospira o sussurra dove lo indichi. MiniMax Speech 2.8 Turbo e HD sono un’alternativa veloce e una di qualità superiore. Tutti restituiscono un MP3 in pochi secondi.
Quanti crediti costa?
0.002 to 40.0 crediti a seconda del modello e della lunghezza del testo. I modelli Gemini addebitano solo l’audio effettivamente generato. I risultati sono pronti in pochi secondi.

Generatore vocale con IA

Trasforma qualsiasi testo in una voce naturale scegliendo tra 30 voci in 73 lingue. Descrivi tono, accento, ritmo ed emozione con parole semplici e ottieni una traccia pronta in pochi secondi.

Cosa puoi creare

  • Narrazione per documentari: voci autorevoli e professionali
  • Intro, outro e dialoghi per podcast: resa multi-personaggio
  • Voci fuori campo multilingue: copri lo stesso copione in 73 lingue
  • Narrazione di audiolibri: ritmo emotivo con indicazioni a metà frase
  • Accessibilità: rendi i contenuti testuali disponibili come audio

Come funziona

  1. Incolla il tuo testo: ciò che vuoi far pronunciare
  2. Scegli una voce o lascia su Auto: Auto sceglie la voce migliore in base al testo e alle istruzioni
  3. Aggiungi indicazioni sullo stile (facoltative): descrivi accento, ritmo ed emozione, per esempio "accento britannico caldo, ritmo lento con pause drammatiche"
  4. Scegli un modello: Gemini 3.8 Flash-Lite TTS per bozze rapide ed economiche, Gemini 3.8 Flash TTS per una narrazione di qualità da studio, Eleven v4 per l’interpretazione più espressiva, oppure MiniMax Speech 2.8

Consigli di stile

  • Scrivi la narrazione in frasi brevi e chiare per un ritmo migliore
  • Usa la punteggiatura per controllare le pause: punti per pause nette, virgole per pause brevi e puntini di sospensione per pause più lunghe
  • I suggerimenti di stile accettano il linguaggio naturale: "parla lentamente e in modo drammatico", "allegro ed energico", "calmo e rassicurante"

Esplora altri pipeline

Generatore video
from 9.5
Generatore video
Generatore immagini
0.2-6.7
Generatore immagini
Generatore di musica
2.5-22.6
Generatore di musica
Editor video
from 9.5
Editor video