ElevenLabs · 文本
ElevenLabs Scribe v2
精准语音转文字,带说话人标注。
又名: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2
在 转录 中运行ElevenLabs Scribe v2 能做什么
- 语音转文本
Pipe2 上的价格
| 每次运行 | 3.6 积分 |
使用 ElevenLabs Scribe v2 的流水线
关于 ElevenLabs Scribe v2
功能说明
ElevenLabs Scribe v2 接收音频并输出文本。你给它一个视频或音频文件,它返回带时间戳和说话人标注的转录稿,因此每一行文字都对应到录音中的某个位置以及当时的说话人。它所驱动的转录流水线覆盖 99 种以上语言。它不生成音频、图像或视频,唯一的输出就是转录稿及其相关的时间与说话人元数据。
使用时机
- 对录制好的访谈或播客运行转录流水线,且你需要知道每句话由谁说出,而不只是说了什么。
- 把视频文件转成可检索、可引用、可编辑的文本。时间戳让你能把任意句子对回源文件中的时刻。
- 转录非英语或多语言混合的录音,因为该流水线覆盖 99 种以上语言。
- 产出带时间与说话人标注的转录稿,交给你自己工作流中的下一个环节。
- 任何交付物是由语音得来的文本、而非需要重新配音或重新渲染的工作。
运行前须知
成本随音频时长增长。批发单位按分钟计,设有 30 分钟和 60 分钟档位,因此长录音的花费按比例高于短录音。裁剪到你真正需要的片段,是你手上的主要杠杆。这里没有画质或分辨率的取舍设置,也没有参考图或额外输入:你上传一个媒体文件,得到一份转录稿。说话人标注来自模型本身,而不是你配置的某项设置,因此那里没有可调之处。如果说话人归属对交付物很重要,请把标注与录音核对一遍。该模型目前还没有发布示例。
又名
你可能会看到该模型被称为 ElevenLabs Scribe、Scribe v2 (Batch),或使用标识 scribe_v2。它们都指向 Pipe2 上的同一模型。