← 文章

AI 语音生成器:把文字变成自然语音

使用 Pipe2.ai 的 Audio Generator,把脚本生成 MP3 语音;可选择模型、音色,并用自然语言控制语气、口音和节奏。

操作指南 作者 Pipe2.ai 更新于 August 31, 2026

AI 语音生成器:把文字变成自然语音

AI 语音生成器会把书面脚本转换成口语音频。在 Pipe2.ai 中,Audio Generator接收文字、模型选择、可选音色和可选风格指令,然后返回一个可下载或用作视频旁白的 MP3。实用流程很直接:写好文字,说明它应该怎样被朗读,生成,试听,再调整。

已在 2026-08-31 对照 Audio Generator 的 seed 和 workflow 核查: 本文反映当前公开流水线表单:text 必填;modelvoiceinstructionsenhance_prompt 可选;返回素材为 MP3 音频。本文不假设存在时长控制、歌唱、音效、声音克隆或匿名访问。

五步生成 AI 语音

  1. 打开 Audio Generator。Audio Generator 流水线开始。它是 Pipe2 用来把文字转换成语音的流水线。
  2. 选择模型。 更快、更经济的默认路径可用 Gemini 2.5 Flash TTS;如果更看重韵律和节奏,可选 Gemini 2.5 Pro TTS;如果 MiniMax Speech 2.8 的音色更适合任务,也可以选择对应选项。
  3. 粘贴脚本。 输入需要朗读的准确文字。多语言内容请直接用目标语言写脚本;该流水线面向 70 多种语言,并从脚本中推断语言。
  4. 选择音色和风格。 如果希望模型根据文字和指令匹配音色,就保持 Auto。如果同一位旁白要在多个片段中反复出现,就固定某个命名音色。在 Voice Instructions 中用普通语言描述表演方式:“温暖的纪录片旁白,中性口音,不急不慢,并有清晰停顿。”
  5. 生成并试听。 输出是一个 MP3。检查节奏、发音、数字和语气。如果不理想,修改文字或指令,再生成另一个版本。

当你希望 Pipe2 根据所选模型调整指令时,保持 Enhance prompt 开启。只有在需要原样发送自己写的提示时,才关闭它。

Audio Generator 接收什么、返回什么

Audio Generator 是文本转语音流水线,不是现有录音编辑器。必填输入是书面文字。可选控制项包括模型、音色、风格指令和提示增强。输出是 MP3 音频。

这意味着旁白长度取决于文字。没有单独的时长滑块。脚本越长,语音轨越长;脚本越短,语音轨越短。非常长的文字可能会在 workflow 中被拆分再拼接。因此,长篇旁白最好按自然段落拆开,并在最终合成音频前逐段检查。

当前公开流水线说明将 Audio Generator 定位于旁白、配音、多语言脚本、有声书式朗读、播客片头、无障碍音频和视频旁白。它不适合生成音乐或音效。背景音乐请使用 Music Generator,并把生成的人声作为独立素材保留。

选择合适的模型和音色

模型选择会影响速度、风格和成本:

  • Gemini 2.5 Flash TTS 是更快、更经济的默认模型,适合草稿、短社媒片段和反复试听。
  • Gemini 2.5 Pro TTS 是更高保真的 Gemini 选项,适合成品旁白,尤其适合句子节奏和停顿承担表达重点的内容。
  • MiniMax Speech 2.8 Turbo 是更快的 MiniMax 语音选项,适合草稿和社媒片段。
  • MiniMax Speech 2.8 HD 是更精修的 MiniMax 选项,适合最终旁白。

并不是每段配音都有同一个固定成本。当前计费目录中,Gemini TTS 使用模型档位,而 MiniMax Speech 2.8 按生成字符计费。运行长脚本前先查看估算,并先用短片段测试。

音色方面,如果更关心匹配度而不是连续性,Auto 很有用。如果旁白、角色或品牌声音需要在多个素材中保持一致,就选择命名音色。发音不对时,优先调整脚本本身:把缩写写完整,按发音重写名字,或在句子需要换气的位置加入标点。

写出容易朗读的文字

脚本是最强的控制方式。很多时候,小的文字修改比再次运行模型更有效:

  • 写短句。 长而嵌套的句子容易显得仓促或平淡。短句会产生自然停顿。
  • 有意使用标点。 句号是完整停顿,逗号是短暂停顿,省略号表示更长停顿。想让语速放慢的地方可以加逗号。
  • 把方向写进指令。 “平静、令人安心、缓慢、中性口音”比“专业”更清楚。
  • 先试听难读的行。 名字、缩写、价格、日期和产品名称,值得在整段旁白前单独测试。
  • 保持片段模块化。 长视频可以分段生成,这样只需要替换某一段,而不必重做全部脚本。

一条有用的指令会同时包含人物、语气、口音和节奏:

平静的产品旁白。中性的美式口音,温暖但不过度兴奋。语速适合教程,每句话后都有清晰停顿。

把指令当作表演方向,而不是确定性的控制面板。如果听起来接近但还不够好,调整文字,再生成一次。

把旁白放进视频

生成的人声在最终组装前最好保持独立。先在 Audio Generator 中创建 MP3,再通过 Video ReelNarration 输入添加它。背景音乐放在自己的输入中,这样混音时可以让人声保持在前。需要音乐时,先用 Music Generator生成。

更完整的制作流程可以看如何制作 AI 视频:规划镜头、生成片段、添加旁白、添加音乐,并用字幕或品牌元素收尾。如果难点是让配乐不盖住人声,请读如何给视频添加音乐。如果还需要背景音乐本身,请用如何用 AI 生成音乐

把脚本、生成的 MP3 和最终视频作为独立素材保存。这样重配一句台词或改变表达方式就是一次小修改,而不是重做整个项目。

常见问题

什么是 AI 语音生成器?

AI 语音生成器会把书面文字转换成口语音频。在 Pipe2.ai 中,Audio Generator 接收你的脚本、可选音色、可选风格指令和模型选择,然后返回可下载的 MP3。

怎样从文字生成 AI 语音?

打开 Audio Generator,选择模型,粘贴需要朗读的准确文字,选择音色或保持 Auto,并在 Voice Instructions 中描述表达方式。生成后试听 MP3;如果节奏、名字发音或语气还需要调整,就修改脚本或指令再生成。

应该选择哪个 Audio Generator 模型?

Gemini 2.5 Flash TTS 是默认的更快、更经济选项,适合草稿和短片段。Gemini 2.5 Pro TTS 面向更重视韵律和节奏的成品旁白。MiniMax Speech 2.8 Turbo 和 HD 也可用于多语言语音;Turbo 适合快速草稿,HD 适合更精修的最终配音。

可以控制语音的语气、口音和节奏吗?

可以,通过 Voice Instructions 实现。用日常语言描述表演方式,例如“平静、令人安心,语速慢,并有清晰停顿”或“明亮、轻快、有活力”。标点也很重要:句号形成完整停顿,逗号形成短暂停顿,省略号形成更长停顿。

AI 语音可以唱歌、制作音乐或生成音效吗?

不能。Audio Generator 用于口语文本转语音。它不生成歌唱、音乐、音效、转录稿或声音克隆。背景音乐请使用 Music Generator;需要同时包含旁白和音乐的视频,请在 Video Reel 中组装素材。

实际效果

1 / 5

相关文章

3