返回流水线

音频生成器

将文本转换为自然语音,提供数十种音色、70+ 种语言,并可自定义语气、口音和节奏的风格指令。

0.7
AI
自动
AI 根据你的指令和文本自动挑选最合适的声音
或选择特定的声音...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

还需填写:文本

使用的模型

API

示例

音频Gemini 2.5 Flash TTS

认识 Pyra:配音

Gemini 2.5 Flash TTS。Pyra 自己的故事,用温暖的讲述者嗓音读出:一段可以直接放进任何视频的配音。

复现

最适合

  • 70+ 种语言的旁白和配音
  • 带自然语言风格控制的文本转语音(例如 '温暖地说'、'耳语'、'兴奋的语气')
  • 使用数十种富有表现力音色的多音色内容
  • 多语言脚本,语言会根据文本自动检测

提示

  • 用简短、清晰的句子撰写旁白,以获得更好的节奏
  • 用标点控制停顿:句号表示完全停顿,逗号表示短暂停顿,省略号表示较长停顿
  • 将音色保持为自动,AI 会选择与风格指令相匹配的音色;如果需要一个反复出现的角色,可固定指定某个音色
  • 使用自然语言风格提示:'缓慢而富有戏剧性地说'、'欢快而振奋'、'平静而令人安心'

关于此流水线的文章

音频生成器 API

从你自己的代码调用此流水线。一次请求即可发起运行;模型是一个输入字段,而不是独立的接口。

4 个输入
1 必填
0.7 to 1.3 积分
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

获取 API 令牌 →

参数

text 必填

要转换为语音的文本。

string
instructions

描述语气、口音、节奏、情绪,AI 会生成丰富的风格提示词。

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts 默认 gemini-2-5-flash-tts
显示全部 4 个输入
voice

从数十种可用音色中选择,或选择 auto 让 AI 自动挑选。

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat 默认 auto

在 AI 智能体中使用

将任意 MCP 客户端指向 pipe2,你的智能体就能获得这些工具。它会找到这条流水线,读取上方相同的 schema,然后运行它。

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

完整 API 参考 MCP 设置 CLI 参考

AI 文本转语音生成器

用数十种音色和 70+ 种语言,将任意文本转换为听感自然的语音。通过自然语言指令控制语气、口音、节奏和情感,数秒即得可直接用于制作的配音。

你可以制作什么

  • 纪录片旁白: 权威、专业的音色
  • 播客片头、片尾、对话: 多角色演绎
  • 多语言配音: 用 70+ 种语言演绎同一份脚本
  • 有声书旁白: 带句中指令的情感化节奏
  • 无障碍: 将文本内容转为音频

工作原理

  1. 粘贴你的文本: 你想要朗读的内容
  2. 选择音色或保持自动: 自动模式会根据你的文本和指令选择最合适的音色
  3. 添加风格提示(可选), 描述口音、语速、情感:"温暖的英式口音,语速缓慢并带有戏剧性停顿"
  4. 选择模型: Flash TTS 适合快速草稿,Pro TTS 为最终交付提供录音棚级韵律

风格技巧

  • 用简短、清晰的句子撰写旁白,以获得更好的节奏
  • 用标点控制停顿,句号表示完全停顿,逗号表示短暂停顿,省略号表示较长停顿
  • 风格提示使用自然语言:"缓慢而富有戏剧性地说""欢快而振奋""平静而令人安心"

常见问题

有哪些音色可用?
数十种富有表现力的音色,涵盖明亮、低沉、温暖、坚定和戏剧化等多种性格。每一种都能响应关于语气和演绎的自然语言风格指令。
支持哪些语言?
70+ 种语言并支持自动检测。从英语、中文、日语、西班牙语等主要语言,到宿务语、孔卡尼语和卢森堡语等区域性语言。
指令如何工作?
用自然语言描述你想要的声音效果。例如:'一位 40 岁的英国记者,语速缓慢,在关键处带有戏剧性停顿。' AI 会理解你的指令并塑造出相应的声音表演。
输出是什么音频格式?
MP3,可直接下载,或作为旁白轨道接入 Video Reel 等流水线。
我该选择哪个模型?
Flash TTS 更便宜、更快,非常适合草稿、短片段和迭代。Pro TTS 使用更高保真的模型,韵律和节奏更强,适合用于正式制作的旁白。两者都能在数秒内生成;Pro 会稍慢一点。
需要多少积分?
根据模型不同为 0.7 to 1.3 积分,Flash TTS 更便宜,Pro TTS 稍贵一些。结果数秒内即可完成。

探索更多流水线

查看全部 →
视频生成器
from 9.5
视频生成器
图像生成器
0.2-6.4
图像生成器
音乐生成器
2.5-45.1
音乐生成器
视频编辑器
13.1-29.8
视频编辑器