AI 配音生成
0.002 积分起
将文字转换为自然语音。提供数十种音色、支持 70+ 种语言,并可自定义语气、口音和语速。
补充后即可生成
Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.
使用的模型
-
Google
-
MiniMax
-
ElevenLabs
示例
如何使用 AI 配音生成
一份简明的决策指南,帮助确定此流水线在工作流中的位置。
最适合
- 制作 70+ 种语言的旁白和配音
- 用自然语言控制语气的文本转语音,例如“温暖地说”“耳语”或“兴奋的语气”
- 使用数十种不同音色制作多角色内容
- 自动识别文字语言的多语言脚本
提示
- 旁白尽量使用简短、清晰的句子,让节奏更自然
- 用标点控制停顿:句号表示完整停顿,逗号表示短暂停顿,省略号表示较长停顿
- 使用自动音色时,AI 会选择与风格要求匹配的声音;如果同一角色会反复出现,可以固定使用某个音色
- 可直接描述演绎方式,例如“缓慢而富有戏剧性”“轻快有活力”或“平静、让人安心”
- 个输入
- 5
- 必填
- 1
- 定价
- 0.002 to 40.0 积分
| 输入 | 类型 | 默认 | 说明 |
|---|---|---|---|
text | string | 默认— | 需要转换成语音的文字。 |
enhance_prompt | boolean | 默认true | 生成前针对所选模型优化提示词。关闭后将原样发送提示词。 |
instructions | string | 默认— | 描述所需的语气、口音、节奏和情绪。 |
model | enum | 默认gemini-3-8-flash-tts | 选择要使用的语音模型。保留 Auto,Pipe2 会根据你的要求选择最合适的可用模型。gemini-3-8-flash-tts · gemini-3-8-flash-lite-tts · eleven-v4 +2gemini-3-8-flash-ttsgemini-3-8-flash-lite-ttseleven-v4minimax-speech-2-8-turbominimax-speech-2-8-hd |
voice | string | 默认auto | 从数十种音色中选择,或选择 auto 让 AI 自动挑选。 |
将任意 MCP 客户端指向 pipe2,你的智能体就能获得这些工具。它会找到这条流水线,读取上方相同的 schema,然后运行它。
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}常见问题
有哪些音色可用?
提供数十种富有表现力的音色,包括明亮、低沉、温暖、坚定和戏剧化等不同声音气质;每种音色都能根据自然语言指令调整语气与演绎方式。
支持哪些语言?
支持 70+ 种语言并可自动识别,包括英语、中文、日语、西班牙语等主要语言,以及宿务语、孔卡尼语和卢森堡语等地区语言。
如何使用语音指令?
直接用自然语言描述想要的声音,例如:“一位 40 岁的英国记者,语速缓慢,在关键处带有戏剧性停顿。”AI 会按照要求调整演绎。
输出是什么音频格式?
输出为 MP3,可直接下载,也可作为旁白音轨用于 Video Reel 等流程。
应该选择哪个模型?
Gemini 3.8 Flash-Lite TTS 速度最快、价格最低,适合草稿和短片段。Gemini 3.8 Flash TTS 可用 130 多种语言生成录音棚品质的旁白。Eleven v4 表现力最强,会在你标记的位置笑、叹气或低语。MiniMax Speech 2.8 的 Turbo 和 HD 分别是更快和更高保真的选择。所有模型都能在数秒内返回 MP3。
需要多少积分?
每次生成 0.002 to 40.0 积分,具体取决于模型和文本长度。Gemini 模型只按实际生成的音频计费。通常数秒即可完成。
AI 文本转语音生成器
用数十种音色和 70+ 种语言,将任意文本转换为听感自然的语音。通过自然语言指令控制语气、口音、节奏和情感,数秒即得可直接用于制作的配音。
你可以制作什么
- 纪录片旁白:沉稳、专业的声音
- 播客片头、片尾与对话:支持多角色演绎
- 多语言配音:用 70+ 种语言演绎同一份脚本
- 有声书旁白:用自然停顿与情绪变化讲好故事
- 无障碍音频:把文字内容转换成语音
工作原理
- 粘贴文字:输入需要朗读的内容
- 选择音色或使用自动模式:系统会根据文字和指令挑选合适的音色
- 添加风格要求(可选):描述口音、语速和情绪,例如“温暖的英式口音,语速缓慢并带有戏剧性停顿”
- 选择模型:Gemini 3.8 Flash-Lite TTS 适合快速、低成本的草稿,Gemini 3.8 Flash TTS 适合录音棚品质的旁白,Eleven v4 表现力最强,也可选择 MiniMax Speech 2.8
风格技巧
- 用简短、清晰的句子撰写旁白,以获得更好的节奏
- 用标点控制停顿,句号表示完全停顿,逗号表示短暂停顿,省略号表示较长停顿
- 用自然语言描述风格,例如:“语速放慢,带一点戏剧感”“轻快有活力”“平静、让人安心”



