如何用 AI 把文字转成语音:实用指南
把书面文字转成自然语音:粘贴脚本,选择音色,用大白话描述语气和节奏,再导出音频文件。
作者 Pipe2.ai · 更新于 July 24, 2026
要在 Pipe2.ai 中把文字转成 AI 语音,请打开 Audio Generator,粘贴你想朗读的脚本,选择一个音色(或保持 Auto),并在 Voice Instructions 字段中描述表达方式——语气、口音、节奏、情绪。模型会以这种风格朗读你的文字,并返回一个可下载或叠加到视频上的 MP3。这里没有录音棚,也不必约配音演员;书面文字加一条简短的风格说明就是全部输入。
工作流核查 — 2026 年 7 月: 下文所述的输入项、音色数量、语言覆盖、风格控制行为和输出格式,已根据当前的 Audio Generator 管线进行验证。本指南不会假设表单并不提供的控制项。
五步生成旁白
- 打开 Audio Generator。 从 Audio Generator 管线开始。它使用 Gemini 2.5 TTS,提供 30 种音色,覆盖 73 种语言。
- 粘贴文字。 输入你想朗读的确切内容。标点在这里很重要——它控制着停顿(见下文)。
- 选择音色。 保持 Auto 让模型根据你的风格说明匹配音色,或在需要多个片段保持同一角色时,固定选用某个命名音色(Zephyr、Puck、Kore 等)。
- 描述表达方式。 在 Voice Instructions 中写明它应该听起来如何:“温暖的英式口音,语速缓慢并带有戏剧性停顿”,或“欢快、积极,节奏轻快”。这是大白话的指导,而不是数字滑块。
- 生成并试听。 输出是一个 MP3。检查节奏以及任何棘手的名称或数字,必要时调整文字或说明并重新生成。
Audio Generator 接收文字、一个可选音色和一条可选风格说明,返回单个 MP3。音频长度取决于文字的长度——没有独立的时长控制——因此脚本本身决定了片段的时长。
写出模型好读的文字
因为文字就是脚本,对文字做小改动比其他任何调整都更能改变结果。几个习惯会有帮助:
- 用简短、清晰的句子书写。 它们比冗长、从句繁多的句子节奏更好,也给模型留出自然的换气之处。
- 用标点塑造停顿。 句号是完整停顿,逗号是短暂停顿,省略号是更长的停顿。想让表达放慢的地方,就加上逗号。
- 把棘手的词按发音拼写,如果某个名称、缩写或数字被读错,就这样改写后重新生成。
- 每个角色保持一个音色。 为固定的旁白者固定选用某个命名音色,让声音在多个片段间保持一致;只需为单个片段找一个合适匹配时,就使用 Auto。
至于风格本身,把口音、情绪和语速放在一起描述。例如:
平静、令人安心的旁白者。语速轻柔从容,句与句之间留有清晰停顿。中性口音,温暖但不过于明亮。
Google 的 Gemini 语音生成指南建议采用这种自然语言的指导方式,而不是试图把语气编码为参数。风格控制富有表现力但并不精确,因此把说明当作指引,在试听后再加以打磨。
值得了解的音色、时长和限制
有几个行为容易踩坑:
- 长度取决于文字。 没有时长旋钮;脚本越长,片段越长。想改变时长就删减或扩充文字。
- 非常长的脚本会被切分。 管线会切分长文字,分别生成,再拼接起来,这可能在接缝处留下轻微接痕。把长脚本按自然段落拆分会有帮助。
- 风格是方向性的,而非精确的。 说明会引导语气和节奏,但不会每次都命中精确的情绪或时间;应该重新生成,而不是期待单次就得到固定结果。
- 它会说话,但不会唱歌或配乐。 若需要音乐或器乐铺底,请使用 Music Generator;Audio Generator 只做语音。
把旁白放进视频
生成的语音在附到画面上时最有用。常见路径是 Audio Generator → Video Reel:先制作旁白,再通过 Video Reel 的 Narration 输入添加,同时背景音乐留在自己的输入上,这样语音和音乐会被混合,并让人声保持在前。如果你还想在旁白下铺一层背景音乐,可以用 Music Generator生成一段,然后把两者一起附加。
关于完整的制作流程——规划镜头、生成片段、添加旁白和音乐,再到字幕和品牌元素——请参阅如何制作 AI 视频。要在配乐和语音之间做平衡,请参阅如何给视频添加音乐;要生成音乐本身,请参阅如何用 AI 生成音乐。
把脚本、生成的 MP3 和任何最终视频作为独立素材保存。这样你就能重新配音某一句,或替换表达方式,而不必重做项目的其余部分。
常见问题
怎样用 AI 把文字转成语音?
粘贴脚本,选择音色,并描述你想要的表达方式。在 Pipe2.ai 中打开 Audio Generator,输入文字,选定音色或保持 Auto,然后写一条风格说明,例如“温暖、从容,像深夜电台主持人”。模型会以这种风格朗读文字,并返回一个可下载或叠加到视频上的 MP3。
有多少种音色和语言可选?
Audio Generator 通过 Gemini 2.5 TTS 提供 30 种不同音色,覆盖 73 种语言。保持 Auto 让模型根据你的风格说明匹配音色,或在需要多个片段保持同一角色时,固定选用某个命名音色。
可以控制语音的语气、口音和节奏吗?
可以,通过 Voice Instructions 字段,用大白话而不是数字参数。描述口音、情绪和语速,例如“平静、令人安心,语速缓慢并留有清晰停顿”。标点也会影响表达:句号形成完整停顿,逗号是短暂停顿,省略号则是更长的停顿。
生成的语音最长可以多长?
音频长度取决于文字的长度,而不是某个时长设置。长脚本会被自动切分成片段再拼接,因此非常长的文字在拼接处可能会有轻微接缝。用简短、清晰的句子书写可以让节奏更均匀。
AI 语音可以唱歌或制作音效吗?
不能。Audio Generator 专为口语文本转语音而设计,不做歌唱或音乐演奏,也不做音效。若需要背景音乐或纯器乐音轨,请改用 Music Generator;若要在同一个视频里同时包含旁白和音乐,请在 Video Reel 中把两者组合起来。