音视频转录
0.8 积分起
将任意视频或音频文件转成文字,支持时间戳、说话人识别和 99+ 种语言。
0 – 20
可选的按词替换,应用于生成的 SRT 和 TXT,当识别器把某个特定词(人名、缩写、专业术语)总是听错并写成同样的错误拼写时很有用。每个键是转录出来的词,值是正确的拼写。区分大小写;须匹配完整词。留空则原样输出识别器写出的文稿。
使用的模型
-
ElevenLabs
- 个输入
- 5
- 必填
- 1
- 定价
- from 0.8 积分
| 输入 | 类型 | 默认 | 说明 |
|---|---|---|---|
source_asset_id | string | 默认— | 要转录的音频或视频。填写上传后返回的素材 ID;上传流程请参阅 /docs/api/。 |
corrections | object | 默认{} | 可选的按词替换,应用于生成的 SRT 和 TXT,当识别器把某个特定词(人名、缩写、专业术语)总是听错并写成同样的错误拼写时很有用。每个键是转录出来的词,值是正确的拼写。区分大小写;须匹配完整词。留空则原样输出识别器写出的文稿。 |
diarize | boolean | 默认false | 标记每段话由谁说出。访谈和多人录音建议开启。 |
language_code | enum | 默认auto | 音频中的语言。留空时自动识别。auto · en · es +8autoenesptfrdehiarjakozh |
num_speakers | integer | 默认0 | 预计的说话人数。留空时自动识别。 |
将任意 MCP 客户端指向 pipe2,你的智能体就能获得这些工具。它会找到这条流水线,读取上方相同的 schema,然后运行它。
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}使用此流水线的配方
查看所有配方常见问题
支持哪些文件格式?
任意视频或音频文件,MP4、MOV、AVI、MP3、WAV、M4A、FLAC 等。流水线会自动从视频文件中提取音轨。
转录有多准确?
对于主要语言的清晰音频,词错误率低于 5%。准确度取决于音频质量、背景噪声和说话清晰度。
什么是说话人检测?
启用后,转录文本会为每个片段标注说话人([speaker_0]、[speaker_1] 等)。当你知道录音中有多少人时,可使用'说话人数量'提示来提高准确度。
支持哪些语言?
99 种语言并支持自动检测。当你知道源语言时,指定具体语言可获得最佳准确度。
它需要多长时间?
通常为音频时长的 10-30%。10 分钟的录音需 1-3 分钟完成转录。
AI 音视频转录
上传任意视频或音频文件,即可得到带词级时间戳的准确转录文本。说话人检测可选。输出为 SRT 字幕或纯文本,可直接用于加字幕、编辑或二次利用。
你可以用它做什么
- 为视频加字幕:生成 SRT,然后为社媒烧录或叠加
- 重新利用长内容:将转录文本交给任意 LLM,用于生成摘要、短片创意和社交文案
- 转录访谈 + 播客:带说话人分离的多人录音
- 无障碍:让口语内容可读、可搜索
- 翻译准备:干净的转录文本作为翻译配音的源文本
工作原理
- 上传:视频或音频,任意常见格式(MP4、MOV、MP3、WAV、M4A、FLAC)
- 选择语言:或保持自动检测
- 切换说话人检测:为每个片段标注说话人
- 下载:带时间戳的 SRT + 纯文本转录
输出格式
- SRT:带毫秒级精确时间戳的字幕文件,可直接放入视频编辑器
- 纯文本:干净可读的转录文本,用于编辑、摘要或翻译