← Articles
Tutoriel

Comment générer une voix IA à partir d’un texte : guide pratique

Transformez un texte écrit en parole naturelle : collez votre script, choisissez une voix, décrivez le ton et le rythme en langage courant, puis exportez un fichier audio.

Par Pipe2.ai · Mis à jour July 24, 2026

Pour générer une voix IA à partir d’un texte dans Pipe2.ai, ouvrez Audio Generator, collez le script que vous voulez faire lire, choisissez une voix (ou laissez-la sur Auto) et décrivez le rendu — ton, accent, rythme, émotion — dans le champ Voice Instructions. Le modèle lit votre texte dans ce style et renvoie un MP3 que vous pouvez télécharger ou superposer à une vidéo. Aucune séance d’enregistrement, aucun comédien de voix à réserver ; le texte écrit et une brève note de style constituent la totalité de l’entrée.

Vérifié dans le workflow en production — juillet 2026 : Les entrées, le nombre de voix, la couverture linguistique, le comportement du contrôle de style et le format de sortie décrits ci-dessous ont été vérifiés dans le pipeline Audio Generator actuel. Ce guide ne suppose pas l’existence de réglages que le formulaire ne propose pas.

Comment générer une voix off en cinq étapes

  1. Ouvrez Audio Generator. Partez du pipeline Audio Generator. Il utilise Gemini 2.5 TTS, avec 30 voix réparties sur 73 langues.
  2. Collez votre texte. Saisissez les mots exacts que vous voulez faire lire. La ponctuation compte ici — elle contrôle les pauses (voir plus bas).
  3. Choisissez une voix. Laissez-la sur Auto pour que le modèle associe une voix à votre note de style, ou fixez une voix nommée (Zephyr, Puck, Kore et d’autres) lorsque vous voulez conserver le même personnage sur plusieurs clips.
  4. Décrivez le rendu. Dans Voice Instructions, écrivez comment cela doit sonner : « accent britannique chaleureux, rythme lent avec des pauses dramatiques » ou « enjoué et dynamique, vif ». Il s’agit d’une direction en langage courant, pas de curseurs numériques.
  5. Générez et écoutez. La sortie est un MP3. Contrôlez le rythme ainsi que les noms ou chiffres délicats, ajustez le texte ou la consigne, et relancez la génération si nécessaire.

Audio Generator prend un texte, une voix facultative et une consigne de style facultative, et renvoie un unique MP3. La durée de l’audio suit celle du texte — il n’y a pas de contrôle de durée séparé — c’est donc le script lui-même qui fixe la longueur du clip.

Rédigez un texte que le modèle lit bien

Comme les mots constituent le script, de petites modifications du texte changent le résultat plus que tout le reste. Quelques habitudes aident :

  • Écrivez des phrases courtes et claires. Elles se rythment mieux que les phrases longues et chargées en propositions, et offrent au modèle des endroits naturels pour respirer.
  • Utilisez la ponctuation pour façonner les pauses. Un point est un arrêt complet, une virgule une brève pause et les points de suspension une pause plus longue. Ajoutez des virgules là où vous voulez ralentir le débit.
  • Écrivez les mots délicats tels qu’ils se prononcent si un nom, un acronyme ou un chiffre est mal lu, puis relancez la génération.
  • Gardez une voix par personnage. Fixez une voix nommée pour un narrateur récurrent afin que le son reste cohérent d’un clip à l’autre ; utilisez Auto lorsqu’il vous faut simplement une bonne correspondance pour un seul extrait.

Pour le style lui-même, décrivez ensemble l’accent, l’émotion et la vitesse. Par exemple :

Narrateur calme et rassurant. Un rythme doux et posé, avec des pauses nettes entre les phrases. Accent neutre, chaleureux mais pas trop clair.

Le guide de génération vocale Gemini de Google recommande ce type de direction en langage naturel plutôt que d’essayer d’encoder le ton sous forme de paramètres. Le contrôle du style est expressif mais pas exact : traitez la consigne comme une orientation et affinez-la après écoute.

Voix, durée et limites à connaître

Quelques comportements sont faciles à mal anticiper :

  • La durée suit le texte. Il n’y a pas de molette de durée ; un script plus long produit un clip plus long. Réduisez ou allongez les mots pour changer la durée.
  • Les scripts très longs sont découpés. Le pipeline segmente le texte long, génère chaque partie et les assemble, ce qui peut laisser un léger raccord à une jonction. Découper un long script en paragraphes naturels aide.
  • Le style est directionnel, pas précis. Les consignes orientent le ton et le rythme mais ne reproduiront pas une émotion ou un minutage exacts à chaque exécution ; relancez la génération plutôt que d’attendre un résultat unique et figé.
  • Il parle, il ne chante pas et ne compose pas. Pour de la musique ou un lit instrumental, utilisez Music Generator ; Audio Generator ne fait que de la parole.

Intégrez la voix off dans une vidéo

Une voix générée est surtout utile lorsqu’elle est associée à l’image. Le parcours courant est Audio Generator → Video Reel : créez la narration, puis ajoutez-la via l’entrée Narration de Video Reel pendant que la musique de fond reste sur sa propre entrée, afin que la parole et la musique soient mixées en gardant la voix au premier plan. Si vous voulez aussi un lit musical sous la narration, générez-en un avec Music Generator et joignez les deux.

Pour la séquence de production complète — planifier les plans, générer les clips, ajouter la narration et la musique, puis les sous-titres et l’identité visuelle — suivez comment créer des vidéos avec l’IA. Pour équilibrer une bande-son face à la parole, consultez comment ajouter de la musique à une vidéo, et pour générer la musique elle-même, consultez comment générer de la musique avec l’IA.

Conservez le script, le MP3 généré et toute vidéo finale comme des ressources séparées. Vous pourrez ainsi refaire la voix d’une réplique ou changer le rendu sans reconstruire le reste du projet.

Questions fréquentes

Comment générer une voix IA à partir d’un texte ?

Collez votre script, choisissez une voix et décrivez le rendu souhaité. Dans Pipe2.ai, ouvrez Audio Generator, saisissez le texte, choisissez une voix ou laissez-la sur Auto, et rédigez une consigne de style telle que « chaleureux, posé, comme un animateur de radio de fin de soirée ». Le modèle lit le texte dans ce style et renvoie un MP3 que vous pouvez télécharger ou superposer à une vidéo.

Combien de voix et de langues sont disponibles ?

Audio Generator propose 30 voix distinctes et couvre 73 langues grâce à Gemini 2.5 TTS. Laissez la voix sur Auto pour que le modèle en associe une à votre consigne de style, ou fixez une voix nommée lorsque vous voulez conserver le même personnage sur plusieurs clips.

Puis-je contrôler le ton, l’accent et le rythme de la voix ?

Oui, grâce au champ Voice Instructions, en langage courant plutôt qu’avec des paramètres numériques. Décrivez l’accent, l’émotion et la vitesse — par exemple « calme et rassurant, lent avec des pauses nettes ». La ponctuation influence aussi le rendu : les points créent des arrêts complets, les virgules de brèves pauses et les points de suspension une pause plus longue.

Quelle peut être la durée de la voix générée ?

La durée de l’audio suit celle de votre texte plutôt qu’un réglage de durée. Les scripts longs sont automatiquement découpés en segments puis réassemblés, si bien qu’un texte très long peut présenter de légers raccords aux jonctions. Rédiger des phrases courtes et claires maintient un rythme régulier.

La voix IA peut-elle chanter ou produire des effets sonores ?

Non. Audio Generator est conçu pour la synthèse vocale de texte parlé, pas pour le chant ni la performance musicale, ni pour les effets sonores. Pour une musique de fond ou une piste instrumentale, utilisez plutôt Music Generator ; pour une voix off et de la musique dans une même vidéo, assemblez les deux dans Video Reel.

Voir en action

Essayez ces pipelines

Articles associés