Générateur de transcription vidéo : obtenir un TXT et un SRT
Transformez une vidéo en transcription TXT modifiable et en SRT horodaté, avec détection de langue, identification des locuteurs et corrections réutilisables.
Tutoriel Par Pipe2.ai Mis à jour September 2, 2026
Dans cet article
Essayez ces pipelines
Un générateur de transcription vidéo convertit les paroles d’une vidéo en texte modifiable. Avec Transcription de Pipe2.ai, importez un fichier vidéo ou audio pour recevoir un TXT continu et un SRT horodaté ; vous pouvez aussi détecter la langue, identifier les locuteurs et corriger les mots systématiquement mal reconnus.
Générer une transcription vidéo en cinq étapes
- Choisissez une vidéo dont la piste audio est claire. Transcription a besoin de paroles audibles. Une vidéo muette ne peut pas fournir de transcription.
- Importez le fichier. Ouvrez Transcription et joignez la vidéo ou l’audio à convertir.
- Réglez la langue et les locuteurs. Conservez Auto en cas de doute. Pour un entretien ou une table ronde, activez la détection des locuteurs et indiquez éventuellement leur nombre.
- Ajoutez les corrections récurrentes. Si un nom, un sigle ou un produit est toujours mal reconnu de la même façon, associez la forme reconnue à la bonne orthographe. Les corrections respectent la casse et portent sur des mots entiers.
- Lancez le traitement et relisez les deux fichiers. Le TXT sert à lire et à modifier ; le SRT sert lorsque le minutage compte ou lorsque le texte doit devenir des sous-titres.
La pipeline actuelle utilise ElevenLabs Scribe v2. Son formulaire public accepte un seul média vidéo ou audio importé, le mode Auto et dix langues nommément proposées, la détection facultative des locuteurs, une indication facultative de 0 à 20 locuteurs et des corrections de mots. Elle renvoie deux ressources distinctes, SRT et TXT.
Choisir TXT ou SRT pour la suite
Les deux formats reprennent les mêmes propos, mais les structurent différemment.
| Sortie | Contenu | Usages adaptés |
|---|---|---|
| TXT | Texte continu sans blocs de sous-titres horodatés | Notes, citations, recherche, résumés, brouillons et relecture éditoriale |
| SRT | Blocs numérotés avec heures de début et de fin | Sous-titres, découpe sur les phrases et traitements qui doivent rester synchronisés avec la vidéo |
Conservez les deux. Le TXT se lit plus vite, tandis que le SRT garde le minutage nécessaire à la production. Pour afficher les paroles dans l’image, relisez le SRT puis suivez le guide consacré à l’ajout de sous-titres.
Améliorer la conversion de la voix en texte
La qualité commence dès l’enregistrement. Rapprochez le micro, réduisez la musique de fond et la réverbération, et évitez que plusieurs personnes parlent simultanément. Augmenter le volume après coup ne restitue pas des mots qui n’ont jamais été captés clairement.
Choisissez la langue lorsque vous la connaissez ; sinon, Auto constitue un bon départ. La détection des locuteurs est utile pour attribuer les propos, mais ses étiquettes doivent être relues. Des voix proches, des interruptions ou plusieurs sources d’enregistrement peuvent perturber le modèle.
Utilisez Corrections pour des erreurs constantes et prévisibles, pas pour réécrire le discours. Si une marque est toujours remplacée par un mot courant qui lui ressemble, une correction portant sur le mot entier peut réparer les deux sorties. Elle ne reconstitue pas une phrase inaudible et ne devine pas l’intention de la personne.
Relire la transcription avant publication
Une transcription par IA reste un document de travail. Lisez-la en écoutant la source et vérifiez en priorité :
- Les noms, organisations, termes techniques et sigles
- Les nombres, prix, dates et mesures
- Les changements de locuteur dans les entretiens et discussions
- Les noms propres qu’un correcteur orthographique pourrait modifier à tort
- Les passages avec bruit, musique, accent marqué ou voix superposées
- Les blocs SRT qui commencent trop tôt, finissent trop tard ou contiennent trop de texte
Avant de citer une personne, comparez la citation à l’enregistrement. Avant de créer des sous-titres, corrigez le texte et le minutage pour ne pas figer les erreurs dans la vidéo.
Transformer la transcription en sous-titres ou en clips
Transcription n’inscrit pas les mots dans l’image. Elle produit des fichiers réutilisables que vous pouvez contrôler avant de créer un autre média.
Pour des sous-titres visibles, joignez le SRT relu et la vidéo source à Captions. Pour produire des formats courts, une seule transcription peut alimenter tout le processus : trouver les bons passages, couper aux limites des phrases et sous-titrer les clips. Le guide pour transformer une longue vidéo en shorts décrit cet enchaînement, tandis que celui sur la découpe vidéo guidée par les phrases approfondit les points de coupe.
Cette séparation est pratique : corrigez un seul SRT, réutilisez-le avec plusieurs styles de sous-titres et gardez le TXT pour les descriptions, les notes ou le montage papier, sans transcrire à nouveau la source.
Ce que le générateur ne fait pas
Un générateur de transcription convertit la parole en texte. Il ne résume pas automatiquement l’enregistrement, ne choisit pas les meilleurs passages, ne traduit pas la transcription et ne crée pas une vidéo déjà sous-titrée. Il s’agit d’étapes éditoriales ou de production distinctes.
Une piste audio est également indispensable. Le texte affiché silencieusement à l’écran n’est pas de la parole et n’apparaîtra pas dans la transcription. Si des diapositives, libellés ou textes d’interface sont importants, examinez-les séparément et ajoutez-les à vos notes.
Commencez par un enregistrement représentatif plutôt que par toute votre archive. Contrôlez le traitement de vos voix, de votre vocabulaire et de vos conditions sonores, ajoutez les corrections récurrentes, puis appliquez la même liste de vérification au reste du lot.
Questions fréquentes
Comment générer la transcription d’une vidéo ?
Importez une vidéo comportant une piste audio dans la pipeline Transcription, laissez la langue sur Auto ou choisissez la langue parlée, activez la détection des locuteurs si nécessaire, puis lancez le traitement. Vous obtenez un TXT modifiable et un SRT horodaté.
Quelle différence y a-t-il entre les sorties TXT et SRT ?
Le TXT présente le texte lisible sans blocs de sous-titres et convient à la correction, aux citations, aux notes et à la recherche. Le SRT découpe les paroles en blocs dotés d’heures de début et de fin, afin de les synchroniser avec la vidéo.
Un générateur de transcription peut-il distinguer plusieurs personnes ?
Oui. Activez la détection des locuteurs pour les entretiens, podcasts et tables rondes. Si vous connaissez leur nombre, indiquez une valeur de 1 à 20 ; sinon, conservez 0 pour la détection automatique. Vérifiez toujours les étiquettes lorsque l’attribution est importante.
La transcription ajoute-t-elle des sous-titres visibles à la vidéo ?
Non. Transcription crée des fichiers SRT et TXT séparés sans inscrire les mots dans l’image. Pour obtenir des sous-titres visibles, relisez le SRT puis utilisez-le avec la vidéo source dans la pipeline Captions.
Comment vérifier une transcription vidéo produite par l’IA ?
Écoutez l’enregistrement en lisant le texte et contrôlez les noms, sigles, nombres, changements de locuteur ainsi que les passages bruités ou comportant des voix superposées. Corrigez les erreurs récurrentes, puis vérifiez le minutage du SRT avant publication.