Retour aux pipelines

Transcription

Transcrivez n'importe quel fichier vidéo ou audio en texte. Horodatages, détection des locuteurs et prise en charge de plus de 99 langues.

ModèleElevenLabs Scribe v2
0.8

0 – 20

Substitutions facultatives sur les limites de mots appliquées aux fichiers SRT et TXT générés, utiles lorsque le système de reconnaissance entend mal un mot précis (un nom, un acronyme, un terme de domaine) et l'écrit toujours de la même façon erronée. Chaque clé est le mot tel que transcrit ; la valeur est l'orthographe correcte. Sensible à la casse ; les correspondances doivent porter sur des mots entiers. Laissez vide pour livrer la transcription exactement telle que le système l'a écrite.

Encore requis : Fichier vidéo ou audio

Fonctionne avec

API

Recettes utilisant ce pipeline

Articles sur ce pipeline

API Transcription

Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.

5 entrées
1 requis
from 0.8 crédits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Obtenir un jeton d'API →

Paramètres

source_asset_id requis

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Substitutions facultatives sur les limites de mots appliquées aux fichiers SRT et TXT générés, utiles lorsque le système de reconnaissance entend mal un mot précis (un nom, un acronyme, un terme de domaine) et l'écrit toujours de la même façon erronée. Chaque clé est le mot tel que transcrit ; la valeur est l'orthographe correcte. Sensible à la casse ; les correspondances doivent porter sur des mots entiers. Laissez vide pour livrer la transcription exactement telle que le système l'a écrite.

object par défaut [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean par défaut false
Afficher les 5 entrées
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh par défaut auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer par défaut 0

Utilisez-le depuis un agent IA

Pointez n'importe quel client MCP vers pipe2 et votre agent obtient ces outils. Il trouve ce pipeline, lit le même schéma ci-dessus, puis l'exécute.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Référence complète de l'API Configuration MCP Référence de la CLI

Transcription vidéo par IA

Importez n'importe quel fichier vidéo ou audio et recevez une transcription précise avec des horodatages au niveau des mots. Détection des locuteurs en option. Exportez sous forme de sous-titres SRT ou de texte brut, prêt pour le sous-titrage, le montage ou la réutilisation.

Ce que vous pouvez en faire

  • Sous-titrer des vidéos: générez le fichier SRT, puis incrustez-le ou superposez-le pour les réseaux sociaux
  • Réutiliser du contenu long: alimentez n'importe quel LLM avec les transcriptions pour obtenir des résumés, des idées de clips et des textes pour les réseaux sociaux
  • Transcrire des interviews et des podcasts: enregistrements multi-locuteurs avec diarisation
  • Accessibilité: rendez le contenu parlé lisible et consultable
  • Préparation à la traduction: une transcription propre comme source pour les voix off traduites

Comment ça marche

  1. Importez: vidéo ou audio, tout format courant (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Choisissez une langue: ou laissez la détection automatique
  3. Activez la détection des locuteurs: étiquette chaque segment avec le locuteur
  4. Téléchargez: SRT avec horodatages + transcription en texte brut

Formats de sortie

  • SRT: fichier de sous-titres avec des horodatages précis à la milliseconde, s'intègre directement dans les logiciels de montage vidéo
  • Texte brut: transcription propre et lisible pour le montage, le résumé ou la traduction

Foire aux questions

Quels formats de fichiers sont pris en charge ?
N'importe quel fichier vidéo ou audio, MP4, MOV, AVI, MP3, WAV, M4A, FLAC, et bien d'autres. Le pipeline extrait automatiquement la piste audio des fichiers vidéo.
Quelle est la précision de la transcription ?
Des taux d'erreur sur les mots inférieurs à 5 % pour un audio clair dans les principales langues. La précision dépend de la qualité audio, du bruit de fond et de la clarté du locuteur.
Qu'est-ce que la détection des locuteurs ?
Lorsqu'elle est activée, la transcription étiquette chaque segment avec le locuteur qui l'a prononcé ([speaker_0], [speaker_1], etc.). Utilisez l'indication Nombre de locuteurs pour améliorer la précision lorsque vous savez combien de personnes figurent dans l'enregistrement.
Quelles langues sont prises en charge ?
99 langues avec détection automatique. Définissez une langue spécifique pour une précision optimale lorsque vous connaissez la langue source.
Combien de temps cela prend-il ?
Généralement 10 à 30 % de la durée de l'audio. Un enregistrement de 10 minutes prend 1 à 3 minutes à transcrire.

Découvrir plus de pipelines

Voir tout →
Générateur de vidéos
from 9.5
Générateur de vidéos
Générateur d'images
0.2-6.4
Générateur d'images
Générateur audio
0.7-1.3
Générateur audio
Générateur de musique
2.5-45.1
Générateur de musique