Zurück zu den Pipelines

Transkription

Transkribiere jede Video- oder Audiodatei in Text. Zeitstempel, Sprechererkennung und Unterstützung für mehr als 99 Sprachen.

ModellElevenLabs Scribe v2
0.8

0 – 20

Optionale Ersetzungen an Wortgrenzen, die auf das erzeugte SRT und TXT angewendet werden, nützlich, wenn der Erkenner ein bestimmtes Wort (einen Namen, ein Akronym, einen Fachbegriff) falsch versteht und es jedes Mal gleich falsch schreibt. Jeder Schlüssel ist das Wort wie transkribiert; der Wert ist die korrekte Schreibweise. Groß-/Kleinschreibung wird beachtet; Treffer müssen ganze Wörter umfassen. Leer lassen, um das Transkript genau so auszugeben, wie der Erkenner es geschrieben hat.

Noch erforderlich: Video- oder Audiodatei

Läuft mit

API

Rezepte mit dieser Pipeline

Artikel zu dieser Pipeline

Transkription API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

5 Eingaben
1 erforderlich
from 0.8 Credits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

API-Token holen →

Parameter

source_asset_id erforderlich

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Optionale Ersetzungen an Wortgrenzen, die auf das erzeugte SRT und TXT angewendet werden, nützlich, wenn der Erkenner ein bestimmtes Wort (einen Namen, ein Akronym, einen Fachbegriff) falsch versteht und es jedes Mal gleich falsch schreibt. Jeder Schlüssel ist das Wort wie transkribiert; der Wert ist die korrekte Schreibweise. Groß-/Kleinschreibung wird beachtet; Treffer müssen ganze Wörter umfassen. Leer lassen, um das Transkript genau so auszugeben, wie der Erkenner es geschrieben hat.

object Standard [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean Standard false
Alle 5 Eingaben anzeigen
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh Standard auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer Standard 0

Aus einem KI-Agenten heraus nutzen

Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Vollständige API-Referenz MCP-Einrichtung CLI-Referenz

KI-Videotranskription

Lade eine beliebige Video- oder Audiodatei hoch und erhalte ein präzises Transkript mit Zeitstempeln auf Wortebene zurück. Sprechererkennung optional. Ausgabe als SRT-Untertitel oder Klartext, bereit zum Untertiteln, Bearbeiten oder Wiederverwerten.

Was du damit machen kannst

  • Videos untertiteln: erzeuge die SRT und brenne sie dann ein oder lege sie für Social Media darüber
  • Lange Inhalte wiederverwerten: speise Transkripte in ein beliebiges LLM für Zusammenfassungen, Clip-Ideen und Social-Texte ein
  • Interviews + Podcasts transkribieren: Aufnahmen mit mehreren Sprechern samt Diarisierung
  • Barrierefreiheit: mache gesprochene Inhalte lesbar und durchsuchbar
  • Übersetzungsvorbereitung: sauberes Transkript als Quelle für übersetzte Voiceover

So funktioniert es

  1. Hochladen: Video oder Audio, jedes gängige Format (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Wähle eine Sprache: oder belasse es auf automatischer Erkennung
  3. Sprechererkennung umschalten: kennzeichnet jedes Segment mit dem Sprecher
  4. Herunterladen: SRT mit Zeitstempeln + Klartext-Transkript

Ausgabeformate

  • SRT: Untertiteldatei mit millisekundengenauen Zeitstempeln, direkt in Videoeditoren einsetzbar
  • Klartext: sauberes lesbares Transkript zum Bearbeiten, Zusammenfassen oder Übersetzen

Häufig gestellte Fragen

Welche Dateiformate werden unterstützt?
Jede Video- oder Audiodatei, MP4, MOV, AVI, MP3, WAV, M4A, FLAC und mehr. Die Pipeline extrahiert die Audiospur automatisch aus Videodateien.
Wie genau ist die Transkription?
Wortfehlerraten unter 5 % bei klarem Audio in den großen Sprachen. Die Genauigkeit hängt von der Audioqualität, Hintergrundgeräuschen und der Deutlichkeit der Sprecher ab.
Was ist Sprechererkennung?
Wenn aktiviert, kennzeichnet das Transkript jedes Segment mit dem Sprecher, der es gesagt hat ([speaker_0], [speaker_1], usw.). Nutze den Hinweis „Anzahl der Sprecher“, um die Genauigkeit zu verbessern, wenn du weißt, wie viele Personen in der Aufnahme sind.
Welche Sprachen werden unterstützt?
99 Sprachen mit automatischer Erkennung. Lege eine bestimmte Sprache für beste Genauigkeit fest, wenn du die Ausgangssprache kennst.
Wie lange dauert es?
Typischerweise 10–30 % der Audiodauer. Eine 10-minütige Aufnahme dauert 1–3 Minuten zum Transkribieren.

Weitere Pipelines entdecken

Alle ansehen →
Video-Generator
from 9.5
Video-Generator
Bild-Generator
0.2-6.4
Bild-Generator
Audio-Generator
0.7-1.3
Audio-Generator
Musik-Generator
2.5-45.1
Musik-Generator