音声生成

0.002クレジットから

テキストを自然な音声に変換します。30種類の声と73言語に対応し、トーン、アクセント、話す速さを自然な言葉で指定できます。

最初のナレーションを作成

読み上げる文章を入力するか、サンプルを聴いてみましょう。

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
生成に必要な入力

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

例

オーディオGemini 3.8 Flash TTS

Pyraのご紹介:ナレーション

Gemini 3.8 Flash TTS。Pyra自身の物語を、あたたかな語り部の声で。どんな動画にもそのまま重ねられるナレーションです。

音声生成 の使い方

このパイプラインをワークフローのどこで使うか判断するための簡潔なガイドです。

最適な用途

  • 70以上の言語でのナレーション・ボイスオーバー
  • 自然言語によるスタイル制御付きのテキスト読み上げ(例:「温かく話す」「ささやく」「興奮したトーン」)
  • 数十種類の表現力豊かな声を使ったマルチボイスコンテンツ
  • 多言語台本、言語はテキストから自動検出されます

ヒント

  • テンポを整えるため、ナレーションは短く明確な文で書く
  • 句読点で間をコントロール:ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
  • 声を自動のままにすればAIがスタイル指示に合うものを選び、繰り返し登場するキャラクターが欲しい場合は特定の声を固定できます
  • 自然言語のスタイルヒントを使う:「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」

音声生成 API

このパイプラインをご自身のコードから呼び出せます。1回のリクエストで実行が始まり、モデルは独立したエンドポイントではなく入力フィールドです。

APIトークンを取得
個の入力
5
必須
1
料金
0.002 to 40.0 クレジット
言語
言語
bun add @pipe2-ai/sdk
パイプラインを実行
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
パイプラインを実行
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
パイプラインを実行
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
パイプラインを実行
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

APIリファレンス全文 CLIリファレンス

よくある質問

どんな声が利用できますか?
明るい、深い、温かい、しっかりした、ドラマチックなキャラクターにわたる数十種類の表現力豊かな声。それぞれがトーンや話し方の平易な言葉によるスタイル指示に応答します。
どの言語に対応していますか?
自動検出付きで70以上の言語に対応。英語、中国語、日本語、スペイン語などの主要言語から、セブアノ語、コンカニ語、ルクセンブルク語といった地域言語まで。
指示はどのように機能しますか?
声にどう聞こえてほしいかを平易な言葉で記述します。例えば:「40歳のイギリス人ジャーナリスト、重要な点ではドラマチックな間を置いてゆっくり話す」。AIがあなたの指示を解釈し、声の演技を作り上げます。
出力の音声フォーマットは何ですか?
MP3形式で、ダウンロードしてすぐに使えるほか、動画リールなどのパイプラインにナレーショントラックとして連結できます。
どのモデルを選べばいいですか?
Gemini 3.8 Flash-Lite TTS は最も速く安価で、下書きや短いクリップに向いています。Gemini 3.8 Flash TTS は130以上の言語でスタジオ品質のナレーションを生成します。Eleven v4 は最も表現力が高く、指定した箇所で笑ったり、ため息をついたり、ささやいたりします。MiniMax Speech 2.8 の Turbo と HD は、速さ重視と品質重視の選択肢です。どれも数秒で MP3 を返します。
何クレジットかかりますか?
モデルとテキストの長さに応じて 0.002 to 40.0 クレジットです。Gemini のモデルは、実際に生成された音声の分だけ課金されます。結果は数秒で用意できます。

AIテキスト読み上げジェネレーター

あらゆるテキストを、数十種類の声と70以上の言語で自然な音声に変換します。トーン、アクセント、テンポ、感情を平易な言葉の指示でコントロール、数秒でそのまま使える品質のナレーションが完成します。

作成できるもの

  • ドキュメンタリーのナレーション: 説得力のあるプロフェッショナルな声
  • ポッドキャストのイントロ・アウトロ・対話: 複数キャラクターの掛け合い
  • 多言語ナレーション: 同じ台本を70以上の言語でカバー
  • オーディオブックのナレーション: 文の途中でも指示できる感情的なテンポ
  • アクセシビリティ: テキストコンテンツを音声で利用可能に

使い方

  1. テキストを貼り付け: 読み上げたい内容を入力
  2. 声を選ぶ、または自動のまま: 自動ならテキストと指示に基づいて最適な声を選択
  3. スタイルのヒントを追加(任意),アクセント、テンポ、感情を記述: 「温かみのあるイギリス英語のアクセント、ゆっくりとしたテンポでドラマチックな間を置いて」
  4. モデルを選ぶ: 速く安価な下書きには Gemini 3.8 Flash-Lite TTS、スタジオ品質のナレーションには Gemini 3.8 Flash TTS、最も表現豊かな演技には Eleven v4、または MiniMax Speech 2.8

スタイルのコツ

  • テンポを整えるため、ナレーションは短く明確な文で書く
  • 句読点で間をコントロール、ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
  • スタイルのヒントは平易な言葉でOK: 「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」

他のパイプラインを見る

動画生成
from 9.5
動画生成
画像生成
0.2-6.7
画像生成
音楽生成
2.5-22.6
音楽生成
動画編集
from 9.5
動画編集