Transcription
Transcrivez n'importe quel fichier vidéo ou audio en texte. Horodatages, détection des locuteurs et prise en charge de plus de 99 langues.
0 – 20
Substitutions facultatives sur les limites de mots appliquées aux fichiers SRT et TXT générés, utiles lorsque le système de reconnaissance entend mal un mot précis (un nom, un acronyme, un terme de domaine) et l'écrit toujours de la même façon erronée. Chaque clé est le mot tel que transcrit ; la valeur est l'orthographe correcte. Sensible à la casse ; les correspondances doivent porter sur des mots entiers. Laissez vide pour livrer la transcription exactement telle que le système l'a écrite.
Encore requis : Fichier vidéo ou audio
Fonctionne avec
APIRecettes utilisant ce pipeline
Articles sur ce pipeline
-
Comment couper une vidéo en un clip net qui ne coupe jamais au milieu d'une phrase
-
Créer des shorts : découper une vidéo longue en clips
-
Qu'est-ce que l'IA générative ? Fonctionnement et usages
-
Ajouter des sous-titres à une vidéo avec un fichier SRT
-
Comment créer des vidéos avec l’IA : du prompt à la vidéo finale
API Transcription
Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitParamètres
-
source_asset_idrequis -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Substitutions facultatives sur les limites de mots appliquées aux fichiers SRT et TXT générés, utiles lorsque le système de reconnaissance entend mal un mot précis (un nom, un acronyme, un terme de domaine) et l'écrit toujours de la même façon erronée. Chaque clé est le mot tel que transcrit ; la valeur est l'orthographe correcte. Sensible à la casse ; les correspondances doivent porter sur des mots entiers. Laissez vide pour livrer la transcription exactement telle que le système l'a écrite.
objectpar défaut[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanpar défautfalse
Afficher les 5 entrées
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhpar défautauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerpar défaut0
Utilisez-le depuis un agent IA
Pointez n'importe quel client MCP vers pipe2 et votre agent obtient ces outils. Il trouve ce pipeline, lit le même schéma ci-dessus, puis l'exécute.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Référence complète de l'API Configuration MCP Référence de la CLI
Transcription vidéo par IA
Importez n'importe quel fichier vidéo ou audio et recevez une transcription précise avec des horodatages au niveau des mots. Détection des locuteurs en option. Exportez sous forme de sous-titres SRT ou de texte brut, prêt pour le sous-titrage, le montage ou la réutilisation.
Ce que vous pouvez en faire
- Sous-titrer des vidéos: générez le fichier SRT, puis incrustez-le ou superposez-le pour les réseaux sociaux
- Réutiliser du contenu long: alimentez n'importe quel LLM avec les transcriptions pour obtenir des résumés, des idées de clips et des textes pour les réseaux sociaux
- Transcrire des interviews et des podcasts: enregistrements multi-locuteurs avec diarisation
- Accessibilité: rendez le contenu parlé lisible et consultable
- Préparation à la traduction: une transcription propre comme source pour les voix off traduites
Comment ça marche
- Importez: vidéo ou audio, tout format courant (MP4, MOV, MP3, WAV, M4A, FLAC)
- Choisissez une langue: ou laissez la détection automatique
- Activez la détection des locuteurs: étiquette chaque segment avec le locuteur
- Téléchargez: SRT avec horodatages + transcription en texte brut
Formats de sortie
- SRT: fichier de sous-titres avec des horodatages précis à la milliseconde, s'intègre directement dans les logiciels de montage vidéo
- Texte brut: transcription propre et lisible pour le montage, le résumé ou la traduction
Foire aux questions
Quels formats de fichiers sont pris en charge ?
Quelle est la précision de la transcription ?
Qu'est-ce que la détection des locuteurs ?
Quelles langues sont prises en charge ?
Combien de temps cela prend-il ?
Découvrir plus de pipelines
Voir tout →Générez des vidéos par IA à partir d'une invite textuelle, d'une image ou d'un clip de référence. Plans cinématographiques, présentations de produits, publicités lifestyle, avec un audio synchronisé et un mouvement naturel.
Générez des images par IA à partir de texte ou de photos de référence. Photos de produits, illustrations de personnages, affiches avec texte lisible, portraits photoréalistes, haute résolution en quelques secondes.
Transformez du texte en voix naturelle grâce à des dizaines de voix, plus de 70 langues et des directions de style personnalisées pour le ton, l'accent et le rythme.
Générez une musique de fond originale qui correspond à n'importe quelle ambiance, genre et durée que vous décrivez. Libre de droits, prête en quelques secondes.