パイプライン一覧に戻る

音声生成

テキストを自然な音声に変換。数十種類の声、70以上の言語に対応し、トーン・アクセント・テンポをスタイル指定でカスタマイズできます。

0.7
AI
自動
指示とテキストに基づいてAIが最適な音声を選択します
または特定の音声を選択...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

未入力の項目: テキスト

使用モデル

API

オーディオGemini 2.5 Flash TTS

Pyraのご紹介:ナレーション

Gemini 2.5 Flash TTS。Pyra自身の物語を、あたたかな語り部の声で。どんな動画にもそのまま重ねられるナレーションです。

最適な用途

  • 70以上の言語でのナレーション・ボイスオーバー
  • 自然言語によるスタイル制御付きのテキスト読み上げ(例:「温かく話す」「ささやく」「興奮したトーン」)
  • 数十種類の表現力豊かな声を使ったマルチボイスコンテンツ
  • 多言語台本, 言語はテキストから自動検出されます

ヒント

  • テンポを整えるため、ナレーションは短く明確な文で書く
  • 句読点で間をコントロール:ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
  • 声を自動のままにすればAIがスタイル指示に合うものを選び、繰り返し登場するキャラクターが欲しい場合は特定の声を固定できます
  • 自然言語のスタイルヒントを使う:「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」

このパイプラインに関する記事

音声生成 API

このパイプラインをご自身のコードから呼び出せます。1回のリクエストで実行が始まり、モデルは独立したエンドポイントではなく入力フィールドです。

4 個の入力
1 必須
0.7 to 1.3 クレジット
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

APIトークンを取得 →

パラメータ

text 必須

音声に変換するテキスト。

string
instructions

トーン、アクセント、テンポ、感情を記述してください。AI が詳細なスタイルプロンプトを生成します。

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts 既定値 gemini-2-5-flash-tts
4 個の入力をすべて表示
voice

数十種類から選べる音声名。auto にすると AI が自動で選択します。

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat 既定値 auto

AIエージェントから使う

任意の MCP クライアントを pipe2 に接続すると、エージェントがこれらのツールを使えるようになります。このパイプラインを見つけ、上と同じスキーマを読み取って実行します。

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

APIリファレンス全文 MCP のセットアップ CLIリファレンス

AIテキスト読み上げジェネレーター

あらゆるテキストを、数十種類の声と70以上の言語で自然な音声に変換します。トーン、アクセント、テンポ、感情を平易な言葉の指示でコントロール, 数秒で制作品質のナレーションが完成します。

作成できるもの

  • ドキュメンタリーのナレーション: 説得力のあるプロフェッショナルな声
  • ポッドキャストのイントロ・アウトロ・対話: 複数キャラクターの掛け合い
  • 多言語ナレーション: 同じ台本を70以上の言語でカバー
  • オーディオブックのナレーション: 文の途中でも指示できる感情的なテンポ
  • アクセシビリティ: テキストコンテンツを音声で利用可能に

使い方

  1. テキストを貼り付け: 読み上げたい内容を入力
  2. 声を選ぶ、または自動のまま: 自動ならテキストと指示に基づいて最適な声を選択
  3. スタイルのヒントを追加(任意),アクセント、テンポ、感情を記述: 「温かみのあるイギリス英語のアクセント、ゆっくりとしたテンポでドラマチックな間を置いて」
  4. モデルを選ぶ: 素早い下書きには Flash TTS、最終仕上げのスタジオ品質の抑揚には Pro TTS

スタイルのコツ

  • テンポを整えるため、ナレーションは短く明確な文で書く
  • 句読点で間をコントロール, ピリオドで完全な停止、カンマで短い間、三点リーダーで長い間
  • スタイルのヒントは平易な言葉でOK: 「ゆっくりとドラマチックに話す」「明るく元気に」「落ち着いて安心感を与えるように」

よくある質問

どんな声が利用できますか?
明るい、深い、温かい、しっかりした、ドラマチックなキャラクターにわたる数十種類の表現力豊かな声。それぞれがトーンや話し方の平易な言葉によるスタイル指示に応答します。
どの言語に対応していますか?
自動検出付きで70以上の言語に対応。英語、中国語、日本語、スペイン語などの主要言語から、セブアノ語、コンカニ語、ルクセンブルク語といった地域言語まで。
指示はどのように機能しますか?
声にどう聞こえてほしいかを平易な言葉で記述します。例えば:「40歳のイギリス人ジャーナリスト、重要な点ではドラマチックな間を置いてゆっくり話す」。AIがあなたの指示を解釈し、声の演技を作り上げます。
出力の音声フォーマットは何ですか?
MP3形式で、ダウンロードしてすぐに使えるほか、動画リールなどのパイプラインにナレーショントラックとして連結できます。
どのモデルを選べばいいですか?
Flash TTS はより安く速い方法, 下書き、短いクリップ、反復作業に最適です。Pro TTS はより高忠実度のモデルで抑揚とテンポが強力, 本番のナレーションにはこちらを。どちらも数秒でレンダリングされ、Pro はほんの少し時間がかかります。
何クレジットかかりますか?
モデルによって 0.7 to 1.3 クレジット。Flash TTS は安価な選択肢で、Pro TTS は少し高くなります。結果は数秒で用意できます。

他のパイプラインを見る

すべて見る →
動画生成
from 9.5
動画生成
画像生成
0.2-6.4
画像生成
音楽生成
2.5-45.1
音楽生成
動画編集
13.1-29.8
動画編集