Transcription

À partir de 0.8 crédits

Transcrivez un fichier vidéo ou audio, avec horodatage, identification facultative des intervenants et prise en charge de 99 langues.

0 – 20

Ajoutez, si nécessaire, des remplacements qui seront appliqués aux fichiers SRT et TXT. Cette option est utile lorsqu'un nom, un acronyme ou un terme spécialisé est systématiquement mal retranscrit. Chaque clé correspond au mot obtenu ; sa valeur indique l'orthographe attendue. La casse est prise en compte et seules les correspondances de mots entiers sont remplacées. Laissez ce champ vide pour conserver la transcription telle quelle.

Encore requis : Fichier vidéo ou audio

Fonctionne avec

1 modèles

API Transcription

Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.

Obtenir un jeton d'API
entrées
5
requis
1
Tarifs
from 0.8 crédits
Langue
Langue
bun add @pipe2-ai/sdk
Exécuter un pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
Exécuter un pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
Exécuter un pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Exécuter un pipeline
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Référence complète de l'API Référence de la CLI

Foire aux questions

Quels formats de fichiers sont pris en charge ?
Les formats vidéo et audio courants sont acceptés, notamment MP4, MOV, AVI, MP3, WAV, M4A et FLAC. Pour une vidéo, la piste audio est récupérée automatiquement.
Quelle est la précision de la transcription ?
Avec un enregistrement clair dans l'une des principales langues, le taux d'erreur sur les mots peut rester inférieur à 5 %. La précision varie selon la qualité sonore, le bruit de fond et l'élocution.
En quoi consiste l'identification des intervenants ?
Une fois cette option activée, chaque segment porte l'identifiant de la personne qui parle, par exemple [speaker_0] ou [speaker_1]. Si vous connaissez le nombre d'intervenants, indiquez-le pour améliorer le résultat.
Quelles langues sont prises en charge ?
Plus de 99 langues sont prises en charge, avec détection automatique. Lorsque vous connaissez la langue du fichier, indiquez-la pour obtenir la meilleure précision possible.
Combien de temps faut-il prévoir ?
Comptez généralement entre 10 et 30 % de la durée de l'enregistrement. Une séquence de 10 minutes demande donc environ 1 à 3 minutes.

Transcription vidéo par IA

Importez une vidéo ou un fichier audio pour obtenir une transcription précise, horodatée mot à mot. L'identification des intervenants est facultative. Exportez le résultat au format SRT ou en texte brut, prêt à servir au sous-titrage, au montage ou à la réutilisation du contenu.

Ce que vous pouvez en faire

  • Sous-titrer des vidéos : créez un fichier SRT, puis incrustez-le ou ajoutez-le à vos contenus pour les réseaux sociaux
  • Décliner un contenu long : utilisez la transcription dans un assistant IA pour produire des résumés, trouver des idées d'extraits et rédiger des publications
  • Transcrire des interviews et des podcasts : distinguez automatiquement les différents intervenants
  • Améliorer l'accessibilité : rendez les contenus parlés lisibles et consultables
  • Préparer une traduction : partez d'un texte propre pour créer des voix off dans d'autres langues

Comment ça marche

  1. Importez le fichier : vidéo ou audio dans un format courant, comme MP4, MOV, MP3, WAV, M4A ou FLAC
  2. Indiquez la langue : ou laissez la détection automatique s'en charger
  3. Activez l'identification des intervenants : chaque segment est attribué à la bonne personne
  4. Téléchargez le résultat : un SRT horodaté et une transcription en texte brut

Formats de sortie

  • SRT : sous-titres horodatés à la milliseconde, directement utilisables dans un logiciel de montage
  • Texte brut : transcription claire et lisible pour le montage, le résumé ou la traduction

Découvrir plus de pipelines

Générateur de vidéos
from 9.5
Générateur de vidéos
Générateur d'images
0.2-6.4
Générateur d'images
Générateur de voix
0.002-40.0
Générateur de voix
Générateur de musique
2.5-22.6
Générateur de musique