Google · 音频
Gemini 2.5 Pro TTS
录音棚级的韵律与节奏。适合成品旁白。
又名: Gemini 2.5 Pro Text-to-Speech, Gemini 2.5 Pro Preview TTS, gemini-2.5-pro-preview-tts, Gemini-TTS
在 音频生成器 中运行Gemini 2.5 Pro TTS 能做什么
- 文本转语音
Pipe2 上的价格
| 每次运行 | 1.3 积分 |
使用 Gemini 2.5 Pro TTS 的流水线
关于 Gemini 2.5 Pro TTS
功能说明
Gemini 2.5 Pro TTS 接收书面文本并返回语音音频。它在 Pipe2 上的唯一能力是文本转语音:接受脚本并生成人声音轨。它不接收音频输入,不做转录,也不生成音乐。它被描述为在韵律和节奏上达到录音棚级,因此更适合成品旁白,而非简短的功能性提示音。你通过音频生成器流水线使用它。
使用时机
- 对旁白脚本(视频配音、课程模块、解说片)运行音频生成器,且句子节奏与停顿与词句本身同样重要。
- 你需要特定的演绎方式:音频生成器接受自定义的语气、口音和节奏风格指令,而该模型在这两方面都被描述为录音棚级。
- 你以非英语进行制作;音频生成器覆盖 70 多种语言。
- 你想试听同一脚本的多种朗读,因为该流水线在单一文本输入背后提供了数十种声音。
- 如果只需要一句简短的系统提示或通知语,就跳过它。节奏控制用在一个短句上是浪费。
运行前须知
该模型的批发单位以输出 token 计价(每单位约 1500 个),所以单位衡量的是模型生成的语音量。本页的实时价格表会显示该流水线当前的费率。你通过音频生成器为语气、口音和节奏提供的文本风格指令来引导朗读,因此请预留几轮试听来达到想要的演绎。该模型目前在 Pipe2 上还没有公开示例,所以在投入完整脚本前先试听一小段。
又名
你可能会看到它写作 Gemini 2.5 Pro Text-to-Speech、Gemini 2.5 Pro Preview TTS、Gemini-TTS,或使用预览标识 gemini-2.5-pro-preview-tts。这些都指向此处列为 Gemini 2.5 Pro TTS 的同一模型。