Transkription

Ab 0.8 Credits

Wandeln Sie Video- oder Audiodateien in Text um – mit Zeitstempeln, optionaler Sprechererkennung und Unterstützung für 99 Sprachen.

0 – 20

Optionale Ersetzungen, die auf ganze Wörter im erzeugten SRT- und TXT-Transkript angewendet werden. Das ist hilfreich, wenn ein Name, Akronym oder Fachbegriff wiederholt gleich falsch erkannt wird. Verwenden Sie als Schlüssel die transkribierte Form und als Wert die korrekte Schreibweise. Groß- und Kleinschreibung werden berücksichtigt. Leer lassen, um den erkannten Wortlaut unverändert auszugeben.

Noch erforderlich: Video- oder Audiodatei

Läuft mit

1 modelle

Transkription API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

API-Token holen
Eingaben
5
erforderlich
1
Preise
from 0.8 Credits
Sprache
Sprache
bun add @pipe2-ai/sdk
Pipeline ausführen
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
Pipeline ausführen
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
Pipeline ausführen
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Pipeline ausführen
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Vollständige API-Referenz CLI-Referenz

Häufig gestellte Fragen

Welche Dateiformate werden unterstützt?
Unterstützt werden gängige Video- und Audioformate wie MP4, MOV, AVI, MP3, WAV, M4A und FLAC. Bei Videos wird die Tonspur automatisch verarbeitet.
Wie genau ist die Transkription?
Bei klaren Aufnahmen in verbreiteten Sprachen liegt die Wortfehlerrate unter 5 %. Die tatsächliche Genauigkeit hängt von Tonqualität, Hintergrundgeräuschen und Aussprache ab.
Wie funktioniert die Sprechererkennung?
Ist die Funktion aktiviert, wird jeder Abschnitt mit der erkannten Person gekennzeichnet, etwa [speaker_0] oder [speaker_1]. Wenn du die Zahl der Beteiligten kennst, kannst du sie angeben und damit die Zuordnung verbessern.
Welche Sprachen werden unterstützt?
Unterstützt werden 99 Sprachen mit automatischer Erkennung. Wenn du die Ausgangssprache kennst, solltest du sie für die bestmögliche Genauigkeit festlegen.
Wie lange dauert die Transkription?
Meist dauert die Verarbeitung 10–30 % der Aufnahmelänge. Eine 10-minütige Aufnahme ist typischerweise nach 1–3 Minuten transkribiert.

KI-Transkription für Video und Audio

Lade eine Video- oder Audiodatei hoch und erhalte ein präzises Transkript mit Zeitstempeln auf Wortebene. Die Sprechererkennung ist optional. Ausgegeben werden SRT-Untertitel und Klartext zum Untertiteln, Bearbeiten oder Weiterverwenden.

Was du damit machen kannst

  • Videos untertiteln: Erzeuge eine SRT-Datei und brenne die Untertitel anschließend ein oder füge sie auf der Plattform hinzu
  • Lange Inhalte weiterverwerten: Nutze Transkripte für Zusammenfassungen, Clip-Ideen und Social-Media-Texte
  • Interviews und Podcasts transkribieren: Erkenne mehrere Sprecher und kennzeichne ihre Beiträge
  • Barrierefreiheit: mache gesprochene Inhalte lesbar und durchsuchbar
  • Übersetzungen vorbereiten: Nutze ein sauberes Transkript als Grundlage für übersetzte Voice-overs

So funktioniert es

  1. Hochladen: Video oder Audio, jedes gängige Format (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Sprache auswählen: Alternativ lässt du sie automatisch erkennen
  3. Sprechererkennung aktivieren: Jeder Abschnitt wird der erkannten Person zugeordnet
  4. Ergebnis herunterladen: SRT-Datei mit Zeitstempeln und ein Klartext-Transkript

Ausgabeformate

  • SRT: Untertiteldatei mit millisekundengenauen Zeitstempeln, direkt in Videoeditoren einsetzbar
  • Klartext: sauberes lesbares Transkript zum Bearbeiten, Zusammenfassen oder Übersetzen

Weitere Pipelines entdecken

Videogenerator
from 9.5
Videogenerator
Bildgenerator
0.2-6.4
Bildgenerator
Sprachgenerator
0.002-40.0
Sprachgenerator
Musikgenerator
2.5-22.6
Musikgenerator