ElevenLabs · Text

ElevenLabs Scribe v2

Präzise Sprache-zu-Text mit Sprecherkennzeichnung.

Auch bekannt als: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2

In Transkription ausführen

Was ElevenLabs Scribe v2 kann

  • Sprache zu Text

Preise auf Pipe2

Transkription →
Pro Lauf 3.6 Credits

Credit-Preise ansehen →

Pipelines mit ElevenLabs Scribe v2

Transkription
from 0.8
Transkription

Über ElevenLabs Scribe v2

Was es macht

ElevenLabs Scribe v2 nimmt Audio auf und erzeugt Text. Sie geben ihm eine Video- oder Audiodatei, und es liefert ein Transkript mit Zeitstempeln und Sprecherkennzeichnungen, sodass jede Textzeile an eine Stelle der Aufnahme und an die jeweils sprechende Person gebunden ist. Die Pipeline Transkription, die es antreibt, deckt über 99 Sprachen ab. Es erzeugt kein Audio, keine Bilder und kein Video. Die einzige Ausgabe ist das Transkript samt zugehöriger Zeit- und Sprecher-Metadaten.

Wann zu verwenden

  • Die Pipeline Transkription auf ein aufgezeichnetes Interview oder einen Podcast anwenden, wenn Sie wissen müssen, wer welche Zeile gesagt hat, nicht nur was gesagt wurde.
  • Eine Videodatei in Text verwandeln, den Sie durchsuchen, zitieren oder bearbeiten können. Die Zeitstempel führen jeden Satz zurück auf den Moment im Original.
  • Nicht-englische oder mehrsprachig gemischte Aufnahmen transkribieren, da die Pipeline über 99 Sprachen abdeckt.
  • Ein zeitcodiertes, sprecherbeschriftetes Transkript erzeugen, das Sie an den nächsten Schritt Ihres eigenen Workflows übergeben können.
  • Jede Aufgabe, deren Ergebnis aus Sprache abgeleiteter Text ist, statt etwas, das neu vertont oder neu gerendert werden muss.

Was Sie vor dem Start wissen sollten

Die Kosten skalieren mit der Länge des Audios. Die Großhandelseinheiten sind pro Minute, mit 30- und 60-Minuten-Stufen, eine lange Aufnahme kostet also proportional mehr als eine kurze. Auf den tatsächlich benötigten Abschnitt zu kürzen ist Ihr wichtigster Hebel. Es gibt keine Qualitäts- oder Auflösungseinstellung abzuwägen und kein Referenzbild oder zusätzliche Eingabe: Sie laden eine Mediendatei hoch und bekommen ein Transkript zurück. Sprecherkennzeichnungen kommen vom Modell selbst und nicht aus einer Einstellung, die Sie konfigurieren — dort gibt es also nichts zu justieren. Gleichen Sie die Kennzeichnungen mit Ihrer Aufnahme ab, wenn die Sprecherzuordnung für das Ergebnis zählt. Für dieses Modell sind noch keine Beispiele veröffentlicht.

Auch bekannt als

Sie sehen dieses Modell möglicherweise als ElevenLabs Scribe, Scribe v2 (Batch) oder unter der Kennung scribe_v2. Alle bezeichnen dasselbe Modell auf Pipe2.