ElevenLabs Scribe v2
Präzise Sprache-zu-Text mit Sprecherkennzeichnung.
Auch bekannt als: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2
In Transkription ausführenWas ElevenLabs Scribe v2 kann
- Sprache zu Text
Preise auf Pipe2
| Pro Lauf | 3.6 Credits |
Pipelines mit ElevenLabs Scribe v2
Über ElevenLabs Scribe v2
Was es macht
ElevenLabs Scribe v2 nimmt Audio auf und erzeugt Text. Sie geben ihm eine Video- oder Audiodatei, und es liefert ein Transkript mit Zeitstempeln und Sprecherkennzeichnungen, sodass jede Textzeile an eine Stelle der Aufnahme und an die jeweils sprechende Person gebunden ist. Die Pipeline Transkription, die es antreibt, deckt über 99 Sprachen ab. Es erzeugt kein Audio, keine Bilder und kein Video. Die einzige Ausgabe ist das Transkript samt zugehöriger Zeit- und Sprecher-Metadaten.
Wann zu verwenden
- Die Pipeline Transkription auf ein aufgezeichnetes Interview oder einen Podcast anwenden, wenn Sie wissen müssen, wer welche Zeile gesagt hat, nicht nur was gesagt wurde.
- Eine Videodatei in Text verwandeln, den Sie durchsuchen, zitieren oder bearbeiten können. Die Zeitstempel führen jeden Satz zurück auf den Moment im Original.
- Nicht-englische oder mehrsprachig gemischte Aufnahmen transkribieren, da die Pipeline über 99 Sprachen abdeckt.
- Ein zeitcodiertes, sprecherbeschriftetes Transkript erzeugen, das Sie an den nächsten Schritt Ihres eigenen Workflows übergeben können.
- Jede Aufgabe, deren Ergebnis aus Sprache abgeleiteter Text ist, statt etwas, das neu vertont oder neu gerendert werden muss.
Was Sie vor dem Start wissen sollten
Die Kosten skalieren mit der Länge des Audios. Die Großhandelseinheiten sind pro Minute, mit 30- und 60-Minuten-Stufen, eine lange Aufnahme kostet also proportional mehr als eine kurze. Auf den tatsächlich benötigten Abschnitt zu kürzen ist Ihr wichtigster Hebel. Es gibt keine Qualitäts- oder Auflösungseinstellung abzuwägen und kein Referenzbild oder zusätzliche Eingabe: Sie laden eine Mediendatei hoch und bekommen ein Transkript zurück. Sprecherkennzeichnungen kommen vom Modell selbst und nicht aus einer Einstellung, die Sie konfigurieren — dort gibt es also nichts zu justieren. Gleichen Sie die Kennzeichnungen mit Ihrer Aufnahme ab, wenn die Sprecherzuordnung für das Ergebnis zählt. Für dieses Modell sind noch keine Beispiele veröffentlicht.
Auch bekannt als
Sie sehen dieses Modell möglicherweise als ElevenLabs Scribe, Scribe v2 (Batch) oder unter der Kennung scribe_v2. Alle bezeichnen dasselbe Modell auf Pipe2.