Transkription
Wandeln Sie Video- oder Audiodateien in Text um – mit Zeitstempeln, optionaler Sprechererkennung und Unterstützung für 99 Sprachen.
0 – 20
Optionale Ersetzungen, die auf ganze Wörter im erzeugten SRT- und TXT-Transkript angewendet werden. Das ist hilfreich, wenn ein Name, Akronym oder Fachbegriff wiederholt gleich falsch erkannt wird. Verwenden Sie als Schlüssel die transkribierte Form und als Wert die korrekte Schreibweise. Groß- und Kleinschreibung werden berücksichtigt. Leer lassen, um den erkannten Wortlaut unverändert auszugeben.
Läuft mit
-
ElevenLabs
Transkription API
Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.
API-Token holen- Eingaben
- 5
- erforderlich
- 1
- Preise
- from 0.8 Credits
| Eingabe | Typ | Standard | Beschreibung |
|---|---|---|---|
source_asset_id | string | Standard— | Audio- oder Videodatei, die transkribiert werden soll. Verwenden Sie die Asset-ID, die Sie nach dem Upload erhalten. Hinweise zum Upload finden Sie unter /docs/api/. |
corrections | object | Standard{} | Optionale Ersetzungen, die auf ganze Wörter im erzeugten SRT- und TXT-Transkript angewendet werden. Das ist hilfreich, wenn ein Name, Akronym oder Fachbegriff wiederholt gleich falsch erkannt wird. Verwenden Sie als Schlüssel die transkribierte Form und als Wert die korrekte Schreibweise. Groß- und Kleinschreibung werden berücksichtigt. Leer lassen, um den erkannten Wortlaut unverändert auszugeben. |
diarize | boolean | Standardfalse | Kennzeichnet, wer jeweils spricht. Aktivieren Sie diese Option für Interviews und Aufnahmen mit mehreren Personen. |
language_code | enum | Standardauto | Gesprochene Sprache. Lassen Sie das Feld leer, um sie automatisch aus der Audiospur zu erkennen.auto · en · es +8autoenesptfrdehiarjakozh |
num_speakers | integer | Standard0 | Erwartete Anzahl der Sprecher. Lassen Sie das Feld leer, um sie automatisch ermitteln zu lassen. |
Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Rezepte mit dieser Pipeline
Alle Rezepte ansehen-
Langes Video → mehrere untertitelte Clips mit einem Befehl
Zerlege ein langes Video in N kürzere Clips mit Untertiteln. Transkribiere die Aufnahme einmal, lass die KI geeignete Momente auswählen, schneide alle Clips parallel und füge die Untertitel hinzu. Auf Wunsch kannst du ins Hochformat (9:16) für TikTok, Reels oder Shorts, ins Quadrat (1:1) für Instagram oder ins Porträtformat (4:5) wechseln; die Position der Untertitel passt sich automatisch an.
-
Publikumsfrage → animierte visuelle Antwort
Erstelle aus deiner geprüften Antwort und Bildfolge ein vertikales Erklärvideo mit Sprecherstimme, Stockvideos, zeitlich abgestimmten Diagrammen und synchronen Untertiteln.
Häufig gestellte Fragen
Welche Dateiformate werden unterstützt?
Wie genau ist die Transkription?
Wie funktioniert die Sprechererkennung?
Welche Sprachen werden unterstützt?
Wie lange dauert die Transkription?
KI-Transkription für Video und Audio
Lade eine Video- oder Audiodatei hoch und erhalte ein präzises Transkript mit Zeitstempeln auf Wortebene. Die Sprechererkennung ist optional. Ausgegeben werden SRT-Untertitel und Klartext zum Untertiteln, Bearbeiten oder Weiterverwenden.
Was du damit machen kannst
- Videos untertiteln: Erzeuge eine SRT-Datei und brenne die Untertitel anschließend ein oder füge sie auf der Plattform hinzu
- Lange Inhalte weiterverwerten: Nutze Transkripte für Zusammenfassungen, Clip-Ideen und Social-Media-Texte
- Interviews und Podcasts transkribieren: Erkenne mehrere Sprecher und kennzeichne ihre Beiträge
- Barrierefreiheit: mache gesprochene Inhalte lesbar und durchsuchbar
- Übersetzungen vorbereiten: Nutze ein sauberes Transkript als Grundlage für übersetzte Voice-overs
So funktioniert es
- Hochladen: Video oder Audio, jedes gängige Format (MP4, MOV, MP3, WAV, M4A, FLAC)
- Sprache auswählen: Alternativ lässt du sie automatisch erkennen
- Sprechererkennung aktivieren: Jeder Abschnitt wird der erkannten Person zugeordnet
- Ergebnis herunterladen: SRT-Datei mit Zeitstempeln und ein Klartext-Transkript
Ausgabeformate
- SRT: Untertiteldatei mit millisekundengenauen Zeitstempeln, direkt in Videoeditoren einsetzbar
- Klartext: sauberes lesbares Transkript zum Bearbeiten, Zusammenfassen oder Übersetzen