Générateur de voix

À partir de 0.002 crédits

Transformez un texte en voix naturelle avec 30 voix disponibles dans 73 langues. Décrivez simplement le ton, l’accent, le rythme et l’émotion.

Créez votre première voix off

Écrivez ce que vous souhaitez dire ou écoutez un exemple.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
À compléter pour générer

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

Exemples

Voici Pyra : voix off

Gemini 3.8 Flash TTS. L'histoire de Pyra, lue par une voix de conteur chaleureuse : une voix off à poser directement sur n'importe quelle vidéo.

Comment utiliser Générateur de voix

Un guide de décision concis pour placer ce pipeline dans un workflow.

Idéal pour

  • Narrations et voix off dans plus de 70 langues
  • Synthèse vocale pilotée en langage naturel, par exemple « voix chaleureuse », « chuchoté » ou « ton enthousiaste »
  • Dialogues à plusieurs voix parmi des dizaines de timbres expressifs
  • Scripts multilingues avec détection automatique de la langue

Conseils

  • Écrivez des phrases courtes et claires pour obtenir un débit naturel
  • Utilisez la ponctuation pour placer les pauses : le point marque un arrêt, la virgule une pause brève et les points de suspension une pause plus longue
  • Gardez Auto pour laisser l'IA choisir une voix adaptée, ou sélectionnez une voix précise pour conserver le même personnage d'un clip à l'autre
  • Décrivez le style en langage naturel : « lent et théâtral », « joyeux et dynamique », « calme et rassurant »

API Générateur de voix

Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.

Obtenir un jeton d'API
entrées
5
requis
1
Tarifs
0.002 to 40.0 crédits
Langue
Langue
bun add @pipe2-ai/sdk
Exécuter un pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
Exécuter un pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Exécuter un pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Exécuter un pipeline
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

Référence complète de l'API Référence de la CLI

Foire aux questions

Quelles voix sont disponibles ?
Vous disposez de dizaines de voix expressives : claires, graves, chaleureuses, assurées ou théâtrales. Toutes suivent des consignes rédigées en langage naturel pour ajuster le ton et l'interprétation.
Quelles langues sont prises en charge ?
Plus de 70 langues sont prises en charge et détectées automatiquement, des plus courantes comme l'anglais, le chinois, le japonais ou l'espagnol aux langues régionales telles que le cebuano, le konkani et le luxembourgeois.
Comment fonctionnent les instructions ?
Décrivez simplement la voix souhaitée. Par exemple : « Un journaliste britannique de 40 ans qui parle lentement et marque une pause sur les points clés. » L'IA s'appuie sur ces indications pour interpréter le texte.
Quel est le format audio de sortie ?
Un fichier MP3, prêt à télécharger ou à utiliser comme piste de narration dans Video Reel.
Quel modèle dois-je choisir ?
Gemini 3.8 Flash-Lite TTS est le plus rapide et le moins cher, idéal pour les brouillons et les clips courts. Gemini 3.8 Flash TTS offre une narration de qualité studio dans plus de 130 langues. Eleven v4 est le plus expressif : il rit, soupire ou chuchote là où vous l’indiquez. MiniMax Speech 2.8 Turbo et HD offrent une alternative rapide et une autre plus fidèle. Tous produisent un MP3 en quelques secondes.
Combien de crédits cela coûte-t-il ?
0.002 to 40.0 crédits selon le modèle et la longueur du texte. Les modèles Gemini ne facturent que l’audio réellement produit. Le résultat est prêt en quelques secondes.

Générateur de voix par IA

Donnez vie à n'importe quel texte grâce à des dizaines de voix naturelles disponibles dans plus de 70 langues. Décrivez le ton, l'accent, le rythme et l'émotion en toutes lettres : vous obtenez une voix off exploitable en quelques secondes.

Ce que vous pouvez créer

  • Narration de documentaire : des voix professionnelles qui inspirent confiance
  • Génériques et dialogues de podcast : faites intervenir plusieurs personnages
  • Voix off multilingues : adaptez un même script dans plus de 70 langues
  • Livres audio : modulez le rythme et l'émotion au fil du texte
  • Accessibilité : proposez une version audio de vos contenus écrits

Comment ça marche

  1. Collez votre texte : saisissez exactement les mots à prononcer
  2. Choisissez une voix ou gardez Auto : en mode Auto, la voix est choisie en fonction du texte et de vos consignes
  3. Ajoutez une indication de style (facultatif) : décrivez l'accent, le débit et l'émotion, par exemple « accent britannique chaleureux, débit lent avec des pauses théâtrales »
  4. Choisissez un modèle : Gemini 3.8 Flash-Lite TTS pour des essais rapides et économiques, Gemini 3.8 Flash TTS pour une narration de qualité studio, Eleven v4 pour l’interprétation la plus expressive, ou MiniMax Speech 2.8

Conseils de style

  • Privilégiez des phrases courtes et claires pour obtenir un débit naturel
  • Servez-vous de la ponctuation pour placer les pauses : le point marque un arrêt, la virgule une pause brève et les points de suspension une pause plus longue
  • Rédigez vos indications comme vous parleriez à un comédien : « lent et théâtral », « joyeux et dynamique », « calme et rassurant »

Découvrir plus de pipelines

Générateur de vidéos
from 9.5
Générateur de vidéos
Générateur d'images
0.2-6.7
Générateur d'images
Générateur de musique
2.5-22.6
Générateur de musique
Éditeur vidéo
from 9.5
Éditeur vidéo