← 返回流水线
音频生成器
将文本转换为自然语音,提供数十种音色、70+ 种语言,并可自定义语气、口音和节奏的风格指令。
0.7
AI
自动
AI 根据你的指令和文本自动挑选最合适的声音
或选择特定的声音...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic
还需填写:文本
使用的模型
API示例
最适合
- •70+ 种语言的旁白和配音
- •带自然语言风格控制的文本转语音(例如 '温暖地说'、'耳语'、'兴奋的语气')
- •使用数十种富有表现力音色的多音色内容
- •多语言脚本,语言会根据文本自动检测
提示
- ✓用简短、清晰的句子撰写旁白,以获得更好的节奏
- ✓用标点控制停顿:句号表示完全停顿,逗号表示短暂停顿,省略号表示较长停顿
- ✓将音色保持为自动,AI 会选择与风格指令相匹配的音色;如果需要一个反复出现的角色,可固定指定某个音色
- ✓使用自然语言风格提示:'缓慢而富有戏剧性地说'、'欢快而振奋'、'平静而令人安心'
关于此流水线的文章
音频生成器 API
从你自己的代码调用此流水线。一次请求即可发起运行;模型是一个输入字段,而不是独立的接口。
4 个输入
1 必填
0.7 to 1.3 积分
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "audio-generator",
input: {
text: "Welcome back to the show. Today we're talking about something a little strange.",
model: "gemini-2-5-flash-tts",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="audio-generator",
input={
"text": "Welcome back to the show. Today we're talking about something a little strange.",
"model": "gemini-2-5-flash-tts",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"text": "Welcome back to the show. Today we're talking about something a little strange.",
"model": "gemini-2-5-flash-tts"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline audio-generator \
--input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
--wait参数
-
text必填 -
要转换为语音的文本。
string -
instructions -
描述语气、口音、节奏、情绪,AI 会生成丰富的风格提示词。
string -
model -
Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.
gemini-2-5-flash-ttsgemini-2-5-pro-tts默认gemini-2-5-flash-tts
显示全部 4 个输入
-
voice -
从数十种可用音色中选择,或选择 auto 让 AI 自动挑选。
autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat默认auto
在 AI 智能体中使用
将任意 MCP 客户端指向 pipe2,你的智能体就能获得这些工具。它会找到这条流水线,读取上方相同的 schema,然后运行它。
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}AI 文本转语音生成器
用数十种音色和 70+ 种语言,将任意文本转换为听感自然的语音。通过自然语言指令控制语气、口音、节奏和情感,数秒即得可直接用于制作的配音。
你可以制作什么
- 纪录片旁白: 权威、专业的音色
- 播客片头、片尾、对话: 多角色演绎
- 多语言配音: 用 70+ 种语言演绎同一份脚本
- 有声书旁白: 带句中指令的情感化节奏
- 无障碍: 将文本内容转为音频
工作原理
- 粘贴你的文本: 你想要朗读的内容
- 选择音色或保持自动: 自动模式会根据你的文本和指令选择最合适的音色
- 添加风格提示(可选), 描述口音、语速、情感:"温暖的英式口音,语速缓慢并带有戏剧性停顿"
- 选择模型: Flash TTS 适合快速草稿,Pro TTS 为最终交付提供录音棚级韵律
风格技巧
- 用简短、清晰的句子撰写旁白,以获得更好的节奏
- 用标点控制停顿,句号表示完全停顿,逗号表示短暂停顿,省略号表示较长停顿
- 风格提示使用自然语言:"缓慢而富有戏剧性地说""欢快而振奋""平静而令人安心"
常见问题
有哪些音色可用?
数十种富有表现力的音色,涵盖明亮、低沉、温暖、坚定和戏剧化等多种性格。每一种都能响应关于语气和演绎的自然语言风格指令。
支持哪些语言?
70+ 种语言并支持自动检测。从英语、中文、日语、西班牙语等主要语言,到宿务语、孔卡尼语和卢森堡语等区域性语言。
指令如何工作?
用自然语言描述你想要的声音效果。例如:'一位 40 岁的英国记者,语速缓慢,在关键处带有戏剧性停顿。' AI 会理解你的指令并塑造出相应的声音表演。
输出是什么音频格式?
MP3,可直接下载,或作为旁白轨道接入 Video Reel 等流水线。
我该选择哪个模型?
Flash TTS 更便宜、更快,非常适合草稿、短片段和迭代。Pro TTS 使用更高保真的模型,韵律和节奏更强,适合用于正式制作的旁白。两者都能在数秒内生成;Pro 会稍慢一点。
需要多少积分?
根据模型不同为 0.7 to 1.3 积分,Flash TTS 更便宜,Pro TTS 稍贵一些。结果数秒内即可完成。
探索更多流水线
查看全部 → from 9.5
视频生成器 →
根据文本提示、图像或参考片段生成 AI 视频。电影感镜头、产品揭晓、生活方式广告,配以同步音频和自然运动。
Veo 3.1 Seedance 2.0
0.2-6.4
图像生成器 →
根据文本或参考照片生成 AI 图像。产品图、角色美术、带可读文字的海报、照片级人像,数秒即得高分辨率成品。
Nano Banana 2 Nano Banana Pro GPT Image 2
2.5-45.1
音乐生成器 →
生成原创背景音乐,匹配你描述的任意情绪、风格和时长。免版税,数秒即得。
Eleven Music v1 Lyria 3 Pro
13.1-29.8
视频编辑器 →
用 AI 编辑现有视频。更改风格、添加特效、修改场景,或彻底改变整体观感。
Gemini Omni Flash Grok Imagine Video