Retour aux pipelines

Générateur audio

Transformez du texte en voix naturelle grâce à des dizaines de voix, plus de 70 langues et des directions de style personnalisées pour le ton, l'accent et le rythme.

0.7
AI
Auto
L'IA choisit la meilleure voix en fonction de vos instructions et de votre texte
Ou choisissez une voix spécifique...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Encore requis : Texte

Fonctionne avec

API

Exemples

AudioGemini 2.5 Flash TTS

Voici Pyra : voix off

Gemini 2.5 Flash TTS. L'histoire de Pyra, lue par une voix de conteur chaleureuse : une voix off à poser directement sur n'importe quelle vidéo.

Idéal pour

  • Narration et voix off en plus de 70 langues
  • Synthèse vocale avec contrôle de style en langage naturel (par ex. « parlez chaleureusement », « chuchotez », « ton excité »)
  • Contenu multi-voix avec des dizaines de voix expressives
  • Scripts multilingues, la langue est détectée automatiquement à partir du texte

Conseils

  • Rédigez la narration en phrases courtes et claires pour un meilleur rythme
  • Utilisez la ponctuation pour contrôler les pauses : les points pour les arrêts complets, les virgules pour de brèves pauses, les points de suspension pour de longues pauses
  • Laissez la voix sur Auto et l'IA en choisit une qui correspond aux instructions de style, ou fixez une voix précise si vous souhaitez un personnage récurrent
  • Utilisez des indications de style en langage naturel : « parlez lentement et de façon dramatique », « joyeux et enjoué », « calme et rassurant »

Articles sur ce pipeline

API Générateur audio

Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.

4 entrées
1 requis
0.7 to 1.3 crédits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Obtenir un jeton d'API →

Paramètres

text requis

Texte à convertir en parole.

string
instructions

Décrivez le ton, l'accent, le rythme, l'émotion. L'IA élabore une consigne de style détaillée.

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts par défaut gemini-2-5-flash-tts
Afficher les 4 entrées
voice

Nom de voix parmi des dizaines disponibles, ou auto pour laisser l'IA choisir.

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat par défaut auto

Utilisez-le depuis un agent IA

Pointez n'importe quel client MCP vers pipe2 et votre agent obtient ces outils. Il trouve ce pipeline, lit le même schéma ci-dessus, puis l'exécute.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Référence complète de l'API Configuration MCP Référence de la CLI

Générateur de synthèse vocale par IA

Transformez n'importe quel texte en voix au son naturel avec des dizaines de voix et plus de 70 langues. Contrôlez le ton, l'accent, le rythme et l'émotion grâce à des instructions en langage clair, une voix off prête à la production en quelques secondes.

Ce que vous pouvez créer

  • Narration de documentaire: des voix professionnelles et affirmées
  • Intros, outros et dialogues de podcast: interprétation à plusieurs personnages
  • Voix off multilingues: couvrez le même script en plus de 70 langues
  • Narration de livre audio: un rythme émotionnel avec des directions en milieu de phrase
  • Accessibilité: rendez le contenu textuel disponible en audio

Comment ça marche

  1. Collez votre texte: ce que vous voulez faire dire
  2. Choisissez une voix ou laissez sur Auto: Auto sélectionne la meilleure voix selon votre texte et vos instructions
  3. Ajoutez une indication de style (facultatif), décrivez l'accent, le rythme, l'émotion : « accent britannique chaleureux, rythme lent avec des pauses dramatiques »
  4. Choisissez un modèle: Flash TTS pour des brouillons rapides, Pro TTS pour une prosodie de qualité studio sur le rendu final

Conseils de style

  • Rédigez la narration en phrases courtes et claires pour un meilleur rythme
  • Utilisez la ponctuation pour contrôler les pauses, les points pour les arrêts complets, les virgules pour de brèves pauses, les points de suspension pour de longues pauses
  • Les indications de style s'écrivent en langage clair : « parlez lentement et de façon dramatique », « joyeux et enjoué », « calme et rassurant »

Foire aux questions

Quelles voix sont disponibles ?
Des dizaines de voix expressives couvrant des personnalités éclatantes, profondes, chaleureuses, fermes et dramatiques. Chacune répond à des instructions de style en langage clair pour le ton et l'interprétation.
Quelles langues sont prises en charge ?
Plus de 70 langues avec détection automatique. Des langues majeures comme l'anglais, le chinois, le japonais et l'espagnol aux langues régionales telles que le cebuano, le konkani et le luxembourgeois.
Comment fonctionnent les instructions ?
Décrivez le rendu souhaité de la voix en langage clair. Par exemple : « Un journaliste britannique de 40 ans, parlant lentement avec des pauses dramatiques sur les points clés. » L'IA interprète votre direction et façonne la performance vocale.
Quel est le format audio de sortie ?
MP3, prêt à télécharger ou à enchaîner dans des pipelines comme Video Reel en tant que piste de narration.
Quel modèle dois-je choisir ?
Flash TTS est la voie la moins chère et la plus rapide, idéale pour les brouillons, les clips courts et l'itération. Pro TTS utilise un modèle plus fidèle avec une prosodie et un rythme renforcés, choisissez-le pour la narration de production. Les deux se rendent en quelques secondes ; Pro prend un instant de plus.
Combien de crédits cela coûte-t-il ?
0.7 to 1.3 crédits selon le modèle, Flash TTS est l'option la moins chère et Pro TTS coûte un peu plus. Les résultats sont prêts en quelques secondes.

Découvrir plus de pipelines

Voir tout →
Générateur de vidéos
from 9.5
Générateur de vidéos
Générateur d'images
0.2-6.4
Générateur d'images
Générateur de musique
2.5-45.1
Générateur de musique
Éditeur vidéo
13.1-29.8
Éditeur vidéo