Torna alle pipeline

Generatore audio

Trasforma il testo in voce naturale con decine di voci, oltre 70 lingue e indicazioni di stile personalizzate per tono, accento e ritmo.

0.7
AI
Auto
L'IA sceglie la voce migliore in base alle tue istruzioni e al testo
Oppure scegli una voce specifica...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Ancora necessario: Testo

Funziona con

API

Esempi

AudioGemini 2.5 Flash TTS

Ecco Pyra: voce fuori campo

Gemini 2.5 Flash TTS. La storia di Pyra, letta con una calda voce da narratore: una voce fuori campo da inserire subito in qualsiasi video.

Ideale per

  • Narrazione e voce fuori campo in oltre 70 lingue
  • Sintesi vocale con controllo dello stile in linguaggio naturale (es. 'parla con calore', 'sussurra', 'tono entusiasta')
  • Contenuti multi-voce con decine di voci espressive
  • Copioni multilingue, la lingua viene rilevata automaticamente dal testo

Suggerimenti

  • Scrivi la narrazione in frasi brevi e chiare per un ritmo migliore
  • Usa la punteggiatura per controllare le pause: i punti per gli stop completi, le virgole per pause brevi, i puntini di sospensione per pause lunghe
  • Lascia la voce su Auto e l'AI ne sceglie una che corrisponde alle istruzioni di stile, oppure fissa una voce specifica se vuoi un personaggio ricorrente
  • Usa suggerimenti di stile in linguaggio naturale: 'parla lentamente e in modo drammatico', 'allegro ed energico', 'calmo e rassicurante'

Articoli su questo pipeline

API di Generatore audio

Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.

4 input
1 obbligatorio
0.7 to 1.3 crediti
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Ottieni un token API →

Parametri

text obbligatorio

Testo da convertire in voce.

string
instructions

Descrivi tono, accento, ritmo ed emozione. L'AI crea un prompt di stile dettagliato.

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts predefinito gemini-2-5-flash-tts
Mostra tutti i 4 input
voice

Nome della voce tra le decine disponibili, oppure auto per lasciar scegliere all'AI.

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat predefinito auto

Usala da un agente IA

Punta un qualsiasi client MCP su pipe2 e il tuo agente ottiene questi strumenti. Trova questa pipeline, legge lo stesso schema qui sopra e la esegue.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Riferimento API completo Configurazione MCP Riferimento CLI

Generatore di sintesi vocale con AI

Trasforma qualsiasi testo in voce dal suono naturale con decine di voci e oltre 70 lingue. Controlla tono, accento, ritmo ed emozione tramite istruzioni in linguaggio naturale, voce fuori campo pronta per la produzione in pochi secondi.

Cosa puoi creare

  • Narrazione per documentari: voci autorevoli e professionali
  • Intro, outro e dialoghi per podcast: resa multi-personaggio
  • Voci fuori campo multilingue: copri lo stesso copione in oltre 70 lingue
  • Narrazione di audiolibri: ritmo emotivo con indicazioni a metà frase
  • Accessibilità: rendi i contenuti testuali disponibili come audio

Come funziona

  1. Incolla il tuo testo: ciò che vuoi far pronunciare
  2. Scegli una voce o lascia su Auto: Auto sceglie la voce migliore in base al testo e alle istruzioni
  3. Aggiungi un suggerimento di stile (facoltativo), descrivi accento, ritmo, emozione: "accento britannico caldo, ritmo lento con pause drammatiche"
  4. Scegli un modello: Flash TTS per bozze rapide, Pro TTS per una prosodia di qualità da studio nella consegna finale

Consigli di stile

  • Scrivi la narrazione in frasi brevi e chiare per un ritmo migliore
  • Usa la punteggiatura per controllare le pause, i punti per gli stop completi, le virgole per pause brevi, i puntini di sospensione per pause lunghe
  • I suggerimenti di stile accettano il linguaggio naturale: "parla lentamente e in modo drammatico", "allegro ed energico", "calmo e rassicurante"

Domande frequenti

Quali voci sono disponibili?
Decine di voci espressive che spaziano tra caratteri brillanti, profondi, caldi, decisi e drammatici. Ognuna risponde a istruzioni di stile in linguaggio naturale per tono e resa.
Quali lingue sono supportate?
Oltre 70 lingue con rilevamento automatico. Da lingue principali come inglese, cinese, giapponese e spagnolo a lingue regionali tra cui cebuano, konkani e lussemburghese.
Come funzionano le istruzioni?
Descrivi in linguaggio naturale come vuoi che suoni la voce. Ad esempio: 'Un giornalista britannico di 40 anni, che parla lentamente con pause drammatiche sui punti chiave.' L'AI interpreta le tue indicazioni e costruisce la performance vocale.
In quale formato audio è l'output?
MP3, pronto da scaricare o da concatenare in pipeline come Video Reel come traccia di narrazione.
Quale modello dovrei scegliere?
Flash TTS è la via più economica e veloce, ottima per bozze, clip brevi e iterazioni. Pro TTS usa un modello a maggiore fedeltà con prosodia e ritmo più marcati, sceglilo per la narrazione di produzione. Entrambi vengono generati in pochi secondi; Pro impiega un attimo in più.
Quanti crediti costa?
0.7 to 1.3 crediti a seconda del modello, Flash TTS è l'opzione più economica e Pro TTS costa un po' di più. I risultati sono pronti in pochi secondi.

Esplora altri pipeline

Vedi tutto →
Generatore video
from 9.5
Generatore video
Generatore immagini
0.2-6.4
Generatore immagini
Generatore musica
2.5-45.1
Generatore musica
Editor video
13.1-29.8
Editor video