视频转文字:生成可编辑 TXT 和字幕 SRT
把视频转换为可编辑的 TXT 文稿和带时间码的 SRT,并可检测语言、区分说话人和复用词语修正。
操作指南 作者 Pipe2.ai 更新于 September 2, 2026
试用这些流水线
视频转文字工具会识别视频音轨中的语音,并生成可编辑的文本。使用 Pipe2.ai 的 Transcription,上传视频或音频后可同时获得纯文本 TXT 和带时间码的 SRT;还可以检测语言、标记说话人,并修正反复识别错误的词。
五步生成视频文字稿
- 选择音轨清晰的视频。 Transcription 需要可辨识的语音。静音视频无法生成文字稿。
- 上传文件。 打开 Transcription,附上要转换的视频或音频。
- 设置语言和说话人。 不确定语言时保留 Auto。处理访谈或多人讨论时开启说话人检测,并可填写预计人数。
- 添加重复词语修正。 如果姓名、缩写或产品名总是以同一种错误形式出现,可把识别出的拼写映射到正确拼写。修正区分大小写,并且只匹配完整单词。
- 运行并检查两种文件。 阅读和编辑使用 TXT;需要时间同步或制作字幕时使用 SRT。
当前流水线使用 ElevenLabs Scribe v2。公开表单接收一个已上传的视频或音频资源,可选择 Auto 或十种列出的语言,并提供可选的说话人检测、0 到 20 人的可选人数提示以及可选词语修正。输出为独立的 SRT 和 TXT 资源。
根据下一步工作选择 TXT 或 SRT
两种输出包含相同的发言内容,但组织方式不同。
| 输出 | 包含内容 | 适合用途 |
|---|---|---|
| TXT | 不含字幕时间块的连续易读文本 | 笔记、引用、搜索、摘要、草稿和编辑审核 |
| SRT | 带开始与结束时间的编号文本块 | 字幕、按句子边界剪辑,以及必须与视频同步的工作流 |
建议两者都保留。TXT 更便于快速阅读,SRT 则保留视频制作所需的时间信息。下一步若要制作可见字幕,请先检查 SRT,再参考给视频添加字幕的指南。
提高语音转文字的质量
识别质量从录音开始。让麦克风靠近说话人,降低背景音乐和房间混响,并尽量避免多人同时说话。事后把音量调大,无法恢复一开始就没有录清的词。
知道语言时应明确选择;不确定时可从 Auto 开始。需要判断谁说了什么时,说话人检测很有用,但标签仍需人工复核。声音相似、相互打断或来自不同录音源,都可能增加区分难度。
Corrections 适合处理稳定、可预测的错误,不适合重写整段内容。例如品牌名总被识别成发音相近的常用词时,完整单词修正可同时修复两种输出。它不能还原模糊句子,也不会猜测说话人的本意。
发布前审核文字稿
AI 文字稿是工作文档,并不保证每个词都准确。请一边听原始录音一边阅读,重点检查:
- 姓名、机构、专业术语和缩写
- 数字、价格、日期和计量单位
- 访谈和多人讨论中的说话人切换
- 可能被普通拼写检查错误修改的专有名词
- 带噪声、音乐、口音或重叠发言的片段
- 开始过早、结束过晚或文字过多的 SRT 块
引用某人的话之前,应与录音核对。制作字幕时,应在文字成为最终视频的一部分之前修正文句和时间。
把文字稿用于字幕或短视频
Transcription 不会把文字烧录到画面中,而是创建可复用的文件,方便在生成下一项素材前检查。
若要显示字幕,把审核后的 SRT 和原视频附到 Captions。制作短视频时,一份文字稿可贯穿全部步骤:找到合适片段、沿句子边界剪切,再给成片加字幕。把长视频变成 Shorts介绍完整顺序,按句子剪辑视频则详细说明如何找到自然切点。
分开处理很实用:只需修正一份 SRT,便可在多种字幕样式中复用;TXT 还能用于简介、笔记或文字剪辑,无需再次转写原视频。
这个工具不会完成什么
文字稿生成器负责把语音变成文本,不会自动总结录音、挑选精彩片段、翻译文字稿或生成已经带字幕的视频。这些属于独立的编辑或制作步骤。
它还需要音轨。只在画面中出现、没有被念出的文字并不是语音,因此不会进入文字稿。如果录制内容中有重要幻灯片、标签或屏幕文字,请单独检查,并在必要时加入笔记。
先用一段有代表性的录制内容测试,不要一开始就处理整个素材库。检查工具如何处理你的说话人、专业词汇和录音环境,补充重复修正,再把相同的审核清单用于其余文件。
常见问题
怎样从视频生成文字稿?
把带音轨的视频上传到 Transcription 流水线,将语言保留为 Auto 或选择实际语言,需要时开启说话人检测,然后运行。结果包含可编辑的 TXT 文字稿和带时间码的 SRT 字幕文件。
TXT 和 SRT 输出有什么区别?
TXT 是不含字幕时间块的连续文本,适合编辑、引用、笔记和搜索。SRT 会把语音分成带开始与结束时间的文本块,视频播放器和字幕工具可据此与原视频同步。
视频转写工具能区分不同说话人吗?
可以。访谈、播客和多人讨论可开启说话人检测。若知道人数,可输入 1 到 20;否则保留 0 自动检测。只要发言归属很重要,就应人工复核标签。
生成文字稿会把字幕直接加到视频里吗?
不会。Transcription 会分别创建 SRT 和 TXT 文件,不会把文字渲染进视频画面。若要制作可见字幕,请先检查 SRT,再把它与原视频一起交给 Captions 流水线。
怎样检查 AI 生成的视频文字稿?
一边听录音一边阅读,核对姓名、缩写、数字、说话人切换,以及有噪声或多人重叠发言的片段。对重复错词使用词语修正,并在发布字幕或引用前检查 SRT 时间。