音视频转录

0.8 积分起

将任意视频或音频文件转成文字,支持时间戳、说话人识别和 99+ 种语言。

0 – 20

可选的按词替换,应用于生成的 SRT 和 TXT,当识别器把某个特定词(人名、缩写、专业术语)总是听错并写成同样的错误拼写时很有用。每个键是转录出来的词,值是正确的拼写。区分大小写;须匹配完整词。留空则原样输出识别器写出的文稿。

还需填写:视频或音频文件

使用的模型

1 模型

音视频转录 API

从你自己的代码调用此流水线。一次请求即可发起运行;模型是一个输入字段,而不是独立的接口。

获取 API 令牌
个输入
5
必填
1
定价
from 0.8 积分
语言
语言
bun add @pipe2-ai/sdk
运行流水线
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
运行流水线
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
运行流水线
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
运行流水线
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

完整 API 参考 CLI 参考

常见问题

支持哪些文件格式?
任意视频或音频文件,MP4、MOV、AVI、MP3、WAV、M4A、FLAC 等。流水线会自动从视频文件中提取音轨。
转录有多准确?
对于主要语言的清晰音频,词错误率低于 5%。准确度取决于音频质量、背景噪声和说话清晰度。
什么是说话人检测?
启用后,转录文本会为每个片段标注说话人([speaker_0]、[speaker_1] 等)。当你知道录音中有多少人时,可使用'说话人数量'提示来提高准确度。
支持哪些语言?
99 种语言并支持自动检测。当你知道源语言时,指定具体语言可获得最佳准确度。
它需要多长时间?
通常为音频时长的 10-30%。10 分钟的录音需 1-3 分钟完成转录。

AI 音视频转录

上传任意视频或音频文件,即可得到带词级时间戳的准确转录文本。说话人检测可选。输出为 SRT 字幕或纯文本,可直接用于加字幕、编辑或二次利用。

你可以用它做什么

  • 为视频加字幕:生成 SRT,然后为社媒烧录或叠加
  • 重新利用长内容:将转录文本交给任意 LLM,用于生成摘要、短片创意和社交文案
  • 转录访谈 + 播客:带说话人分离的多人录音
  • 无障碍:让口语内容可读、可搜索
  • 翻译准备:干净的转录文本作为翻译配音的源文本

工作原理

  1. 上传:视频或音频,任意常见格式(MP4、MOV、MP3、WAV、M4A、FLAC)
  2. 选择语言:或保持自动检测
  3. 切换说话人检测:为每个片段标注说话人
  4. 下载:带时间戳的 SRT + 纯文本转录

输出格式

  • SRT:带毫秒级精确时间戳的字幕文件,可直接放入视频编辑器
  • 纯文本:干净可读的转录文本,用于编辑、摘要或翻译

探索更多流水线

AI 视频生成
from 9.5
AI 视频生成
图像生成器
0.2-6.4
图像生成器
AI 配音生成
0.002-40.0
AI 配音生成
音乐生成器
2.5-22.6
音乐生成器