ElevenLabs · 文本

ElevenLabs Scribe v2

精准语音转文字,带说话人标注。

又名: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2

在 转录 中运行

ElevenLabs Scribe v2 能做什么

  • 语音转文本

Pipe2 上的价格

转录 →
每次运行 3.6 积分

查看积分价格 →

使用 ElevenLabs Scribe v2 的流水线

转录
from 0.8
转录

关于 ElevenLabs Scribe v2

功能说明

ElevenLabs Scribe v2 接收音频并输出文本。你给它一个视频或音频文件,它返回带时间戳和说话人标注的转录稿,因此每一行文字都对应到录音中的某个位置以及当时的说话人。它所驱动的转录流水线覆盖 99 种以上语言。它不生成音频、图像或视频,唯一的输出就是转录稿及其相关的时间与说话人元数据。

使用时机

  • 对录制好的访谈或播客运行转录流水线,且你需要知道每句话由谁说出,而不只是说了什么。
  • 把视频文件转成可检索、可引用、可编辑的文本。时间戳让你能把任意句子对回源文件中的时刻。
  • 转录非英语或多语言混合的录音,因为该流水线覆盖 99 种以上语言。
  • 产出带时间与说话人标注的转录稿,交给你自己工作流中的下一个环节。
  • 任何交付物是由语音得来的文本、而非需要重新配音或重新渲染的工作。

运行前须知

成本随音频时长增长。批发单位按分钟计,设有 30 分钟和 60 分钟档位,因此长录音的花费按比例高于短录音。裁剪到你真正需要的片段,是你手上的主要杠杆。这里没有画质或分辨率的取舍设置,也没有参考图或额外输入:你上传一个媒体文件,得到一份转录稿。说话人标注来自模型本身,而不是你配置的某项设置,因此那里没有可调之处。如果说话人归属对交付物很重要,请把标注与录音核对一遍。该模型目前还没有发布示例。

又名

你可能会看到该模型被称为 ElevenLabs Scribe、Scribe v2 (Batch),或使用标识 scribe_v2。它们都指向 Pipe2 上的同一模型。