音声生成
0.002クレジットから
テキストを自然な音声に変換します。30種類の声と73言語に対応し、トーン、アクセント、話す速さを自然な言葉で指定できます。
生成に必要な入力
Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.
使用モデル
-
Google
-
MiniMax
-
ElevenLabs
例
Pyraのご紹介:ナレーション
Gemini 3.8 Flash TTS。Pyra自身の物語を、あたたかな語り部の声で。どんな動画にもそのまま重ねられるナレーションです。
音声生成 の使い方
このパイプラインをワークフローのどこで使うか判断するための簡潔なガイドです。
最適な用途
- 70以上の言語でのナレーション・ボイスオーバー
- 自然言語によるスタイル制御付きのテキスト読み上げ(例:「温かく話す」「ささやく」「興奮したトーン」)
- 数十種類の表現力豊かな声を使ったマルチボイスコンテンツ
- 多言語台本、言語はテキストから自動検出されます
ヒント
- テンポを整えるため、ナレーションは短く明確な文で書く
- 句読点で間をコントロール:ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
- 声を自動のままにすればAIがスタイル指示に合うものを選び、繰り返し登場するキャラクターが欲しい場合は特定の声を固定できます
- 自然言語のスタイルヒントを使う:「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」
- 個の入力
- 5
- 必須
- 1
- 料金
- 0.002 to 40.0 クレジット
| 入力 | 型 | 既定値 | 説明 |
|---|---|---|---|
text | string | 既定値— | 音声に変換するテキスト。 |
enhance_prompt | boolean | 既定値true | 生成前に選択したモデル向けにプロンプトを改善します。プロンプトを変更せず送信するにはオフにします。 |
instructions | string | 既定値— | トーン、アクセント、テンポ、感情を記述してください。AI が詳細なスタイルプロンプトを生成します。 |
model | enum | 既定値gemini-3-8-flash-tts | 使用する音声モデルです。未指定の場合は、指示内容に合う利用可能な音声をPipe2が選びます。gemini-3-8-flash-tts · gemini-3-8-flash-lite-tts · eleven-v4 +2gemini-3-8-flash-ttsgemini-3-8-flash-lite-ttseleven-v4minimax-speech-2-8-turbominimax-speech-2-8-hd |
voice | string | 既定値auto | 数十種類から選べる音声名。auto にすると AI が自動で選択します。 |
任意の MCP クライアントを pipe2 に接続すると、エージェントがこれらのツールを使えるようになります。このパイプラインを見つけ、上と同じスキーマを読み取って実行します。
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}このパイプラインを使うレシピ
すべてのレシピを見るよくある質問
どんな声が利用できますか?
明るい、深い、温かい、しっかりした、ドラマチックなキャラクターにわたる数十種類の表現力豊かな声。それぞれがトーンや話し方の平易な言葉によるスタイル指示に応答します。
どの言語に対応していますか?
自動検出付きで70以上の言語に対応。英語、中国語、日本語、スペイン語などの主要言語から、セブアノ語、コンカニ語、ルクセンブルク語といった地域言語まで。
指示はどのように機能しますか?
声にどう聞こえてほしいかを平易な言葉で記述します。例えば:「40歳のイギリス人ジャーナリスト、重要な点ではドラマチックな間を置いてゆっくり話す」。AIがあなたの指示を解釈し、声の演技を作り上げます。
出力の音声フォーマットは何ですか?
MP3形式で、ダウンロードしてすぐに使えるほか、動画リールなどのパイプラインにナレーショントラックとして連結できます。
どのモデルを選べばいいですか?
Gemini 3.8 Flash-Lite TTS は最も速く安価で、下書きや短いクリップに向いています。Gemini 3.8 Flash TTS は130以上の言語でスタジオ品質のナレーションを生成します。Eleven v4 は最も表現力が高く、指定した箇所で笑ったり、ため息をついたり、ささやいたりします。MiniMax Speech 2.8 の Turbo と HD は、速さ重視と品質重視の選択肢です。どれも数秒で MP3 を返します。
何クレジットかかりますか?
モデルとテキストの長さに応じて 0.002 to 40.0 クレジットです。Gemini のモデルは、実際に生成された音声の分だけ課金されます。結果は数秒で用意できます。
AIテキスト読み上げジェネレーター
あらゆるテキストを、数十種類の声と70以上の言語で自然な音声に変換します。トーン、アクセント、テンポ、感情を平易な言葉の指示でコントロール、数秒でそのまま使える品質のナレーションが完成します。
作成できるもの
- ドキュメンタリーのナレーション: 説得力のあるプロフェッショナルな声
- ポッドキャストのイントロ・アウトロ・対話: 複数キャラクターの掛け合い
- 多言語ナレーション: 同じ台本を70以上の言語でカバー
- オーディオブックのナレーション: 文の途中でも指示できる感情的なテンポ
- アクセシビリティ: テキストコンテンツを音声で利用可能に
使い方
- テキストを貼り付け: 読み上げたい内容を入力
- 声を選ぶ、または自動のまま: 自動ならテキストと指示に基づいて最適な声を選択
- スタイルのヒントを追加(任意),アクセント、テンポ、感情を記述: 「温かみのあるイギリス英語のアクセント、ゆっくりとしたテンポでドラマチックな間を置いて」
- モデルを選ぶ: 速く安価な下書きには Gemini 3.8 Flash-Lite TTS、スタジオ品質のナレーションには Gemini 3.8 Flash TTS、最も表現豊かな演技には Eleven v4、または MiniMax Speech 2.8
スタイルのコツ
- テンポを整えるため、ナレーションは短く明確な文で書く
- 句読点で間をコントロール、ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
- スタイルのヒントは平易な言葉でOK: 「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」



