Transkription
Transkribiere jede Video- oder Audiodatei in Text. Zeitstempel, Sprechererkennung und Unterstützung für mehr als 99 Sprachen.
0 – 20
Optionale Ersetzungen an Wortgrenzen, die auf das erzeugte SRT und TXT angewendet werden, nützlich, wenn der Erkenner ein bestimmtes Wort (einen Namen, ein Akronym, einen Fachbegriff) falsch versteht und es jedes Mal gleich falsch schreibt. Jeder Schlüssel ist das Wort wie transkribiert; der Wert ist die korrekte Schreibweise. Groß-/Kleinschreibung wird beachtet; Treffer müssen ganze Wörter umfassen. Leer lassen, um das Transkript genau so auszugeben, wie der Erkenner es geschrieben hat.
Noch erforderlich: Video- oder Audiodatei
Läuft mit
APIRezepte mit dieser Pipeline
Artikel zu dieser Pipeline
Transkription API
Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitParameter
-
source_asset_iderforderlich -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Optionale Ersetzungen an Wortgrenzen, die auf das erzeugte SRT und TXT angewendet werden, nützlich, wenn der Erkenner ein bestimmtes Wort (einen Namen, ein Akronym, einen Fachbegriff) falsch versteht und es jedes Mal gleich falsch schreibt. Jeder Schlüssel ist das Wort wie transkribiert; der Wert ist die korrekte Schreibweise. Groß-/Kleinschreibung wird beachtet; Treffer müssen ganze Wörter umfassen. Leer lassen, um das Transkript genau so auszugeben, wie der Erkenner es geschrieben hat.
objectStandard[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanStandardfalse
Alle 5 Eingaben anzeigen
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhStandardauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerStandard0
Aus einem KI-Agenten heraus nutzen
Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}KI-Videotranskription
Lade eine beliebige Video- oder Audiodatei hoch und erhalte ein präzises Transkript mit Zeitstempeln auf Wortebene zurück. Sprechererkennung optional. Ausgabe als SRT-Untertitel oder Klartext, bereit zum Untertiteln, Bearbeiten oder Wiederverwerten.
Was du damit machen kannst
- Videos untertiteln: erzeuge die SRT und brenne sie dann ein oder lege sie für Social Media darüber
- Lange Inhalte wiederverwerten: speise Transkripte in ein beliebiges LLM für Zusammenfassungen, Clip-Ideen und Social-Texte ein
- Interviews + Podcasts transkribieren: Aufnahmen mit mehreren Sprechern samt Diarisierung
- Barrierefreiheit: mache gesprochene Inhalte lesbar und durchsuchbar
- Übersetzungsvorbereitung: sauberes Transkript als Quelle für übersetzte Voiceover
So funktioniert es
- Hochladen: Video oder Audio, jedes gängige Format (MP4, MOV, MP3, WAV, M4A, FLAC)
- Wähle eine Sprache: oder belasse es auf automatischer Erkennung
- Sprechererkennung umschalten: kennzeichnet jedes Segment mit dem Sprecher
- Herunterladen: SRT mit Zeitstempeln + Klartext-Transkript
Ausgabeformate
- SRT: Untertiteldatei mit millisekundengenauen Zeitstempeln, direkt in Videoeditoren einsetzbar
- Klartext: sauberes lesbares Transkript zum Bearbeiten, Zusammenfassen oder Übersetzen
Häufig gestellte Fragen
Welche Dateiformate werden unterstützt?
Wie genau ist die Transkription?
Was ist Sprechererkennung?
Welche Sprachen werden unterstützt?
Wie lange dauert es?
Weitere Pipelines entdecken
Alle ansehen →Erzeuge KI-Videos aus einem Text-Prompt, Bild oder Referenzclip. Filmische Aufnahmen, Produktenthüllungen, Lifestyle-Werbung, mit synchronisiertem Audio und natürlicher Bewegung.
Erzeuge KI-Bilder aus Text oder Referenzfotos. Produktaufnahmen, Charakter-Artworks, Poster mit lesbarem Text, fotorealistische Porträts, hochauflösend in Sekunden.
Verwandle Text in natürliche Sprache mit Dutzenden Stimmen, mehr als 70 Sprachen und individuellen Stilvorgaben für Tonfall, Akzent und Sprechtempo.
Erzeuge originale Hintergrundmusik, die zu jeder Stimmung, jedem Genre und jeder Länge passt, die du beschreibst. Lizenzfrei, in Sekunden fertig.