AI音声生成:テキストを自然な話し声に変える方法
Pipe2.aiのAudio Generatorで、台本からMP3音声を作成します。モデル、声、話し方の指示を選び、トーン、アクセント、テンポを自然な言葉で指定できます。
使い方 著者 Pipe2.ai 更新日 August 31, 2026
AI音声生成は、書かれた台本を話し声の音声に変えます。Pipe2.aiのAudio Generatorは、テキスト、モデル選択、任意の声、任意のスタイル指示を受け取り、ダウンロードしたり動画ナレーションに使ったりできるMP3を返します。基本の流れは、言葉を書く、どう話してほしいかを指定する、生成する、聞く、調整する、です。
2026-08-31にAudio Generatorのseedとworkflowで確認済み: この記事は現在の公開フォームに基づいています。
textは必須、model、voice、instructions、enhance_promptは任意で、返される素材はMP3音声です。長さの調整、歌唱、効果音、声のクローン、匿名アクセスがあるとは想定していません。
5ステップでAI音声を作る
- Audio Generatorを開きます。 Audio Generatorパイプラインから始めます。Pipe2でテキストを話し声に変えるためのパイプラインです。
- モデルを選びます。 速く低コストな標準の流れにはGemini 2.5 Flash TTSを使います。抑揚や間の取り方がより重要ならGemini 2.5 Pro TTSを選びます。声の種類が目的に合うならMiniMax Speech 2.8も選べます。
- 台本を貼り付けます。 読み上げたい言葉を正確に入力します。多言語コンテンツでは、話してほしい言語でそのまま台本を書きます。パイプラインは70以上の言語向けに作られており、言語は台本から推定されます。
- 声とスタイルを選びます。 テキストと指示に合う声を選ばせたい場合は、声をAutoのままにします。同じナレーターを複数クリップで使いたい場合は、名前付きの声を固定します。Voice Instructionsには「温かいドキュメンタリーの語り、ニュートラルなアクセント、落ち着いたテンポで明確な間」のように、普通の言葉で書きます。
- 生成して聞きます。 出力は1つのMP3です。テンポ、発音、数字、トーンを確認します。違和感があれば、テキストや指示を直して別バージョンを作ります。
選んだモデル向けにPipe2が指示を整えてよい場合は、Enhance promptをオンにしておきます。自分の文言を変えずに送る必要がある場合だけオフにします。
Audio Generatorの入力と出力
Audio Generatorはテキスト読み上げのパイプラインであり、既存録音の編集ツールではありません。必須入力は書かれたテキストです。任意で、モデル、声、スタイル指示、プロンプト強化を指定できます。出力はMP3音声です。
そのため、ナレーションの長さはテキストの長さで決まります。独立した長さスライダーはありません。長い台本は長い音声に、短い台本は短い音声になります。非常に長いテキストはworkflow内で分割して結合されることがあります。長いナレーションでは、自然な区切りごとに分けて、最終音声に組み込む前に各セクションを確認する方が扱いやすくなります。
現在の公開説明では、Audio Generatorはナレーション、ボイスオーバー、多言語台本、オーディオブック風の読み上げ、ポッドキャストのイントロ、アクセシビリティ用音声、動画ナレーション向けとされています。音楽や効果音を作る道具ではありません。BGMにはMusic Generatorを使い、生成した声は別素材として保管してください。
モデルと声を選ぶ
モデル選択は、速度、スタイル、費用に影響します。
- Gemini 2.5 Flash TTSは、下書き、短いSNSクリップ、反復調整向けの、より速く低コストな標準モデルです。
- Gemini 2.5 Pro TTSは、本番ナレーション向けの高品質なGeminiオプションです。文のリズムや間がメッセージを支える場面に向きます。
- MiniMax Speech 2.8 Turboは、下書きやSNSクリップ向けの、より速いMiniMax音声オプションです。
- MiniMax Speech 2.8 HDは、最終ナレーション向けの、より磨かれたMiniMaxオプションです。
費用はすべての音声で固定ではありません。現在の課金カタログでは、Gemini TTSはモデル別の段階を使い、MiniMax Speech 2.8は生成文字数で計算されます。長い台本を実行する前に見積もりを確認し、まず短い抜粋で試してください。
声については、連続性より雰囲気の合い方を重視するならAutoが便利です。ナレーター、キャラクター、ブランドの声を複数素材で揃えたい場合は、名前付きの声を使います。発音がうまくいかない場合は、台本側を直します。略語を展開する、名前を音の通りに書く、息継ぎしたい場所に句読点を足す、といった調整が有効です。
読み上げやすいテキストを書く
台本は最も強いコントロールです。別モデルで再実行するより、小さな書き換えの方が効くこともよくあります。
- 短い文で書く。 長く入り組んだ文は、急いだ印象や平板な印象になりがちです。短い文は自然な間を作ります。
- 句読点を意図して使う。 句点は大きな停止、読点は短い間、三点リーダーは長めの間です。ゆっくり読ませたい場所には読点を足します。
- 方向性は指示に書く。 「落ち着いて、安心感があり、ゆっくり、ニュートラルなアクセントで」は「プロっぽく」より明確です。
- 難しい行を先に聞く。 名前、略語、価格、日付、製品名は、全体をナレーションする前にテストする価値があります。
- テイクを分けておく。 長い動画ではセクションごとに生成すると、あとで1段落だけ差し替えられます。
使いやすい指示は、人物像、トーン、アクセント、テンポをまとめます。
落ち着いた製品ナレーター。ニュートラルな米国アクセント。温かいが興奮しすぎない。チュートリアル向けに十分ゆっくり、各文の後に明確な間を置く。
指示は正確な操作パネルではなく、演出の方向性として扱います。かなり近いがまだ足りない場合は、テキストを直して別テイクを生成します。
ボイスオーバーを動画に入れる
生成した声は、最終編集まで別素材として保つと使いやすくなります。Audio GeneratorでMP3を作り、Video ReelのNarration入力に追加します。BGMは別入力にしておくと、ミックス時に声を前に出しやすくなります。音楽が必要なら、先にMusic Generatorで作ります。
より広い制作手順は、AI動画の作り方で、ショット計画、クリップ生成、ナレーション、音楽、字幕やブランディングまで確認できます。音楽と声のバランスが課題なら動画に音楽を入れる方法を読んでください。BGMそのものが必要ならAIで音楽を生成する方法を使います。
台本、生成したMP3、完成動画は別々の素材として保管します。そうすれば、1行だけ録り直したり話し方を変えたりする作業が、全体の作り直しではなく小さな編集で済みます。
よくある質問
AI音声生成とは何ですか?
AI音声生成は、書かれたテキストを話し声の音声に変える仕組みです。Pipe2.aiのAudio Generatorでは、台本、任意の声、任意のスタイル指示、モデル選択を入力し、ダウンロード可能なMP3を返します。
テキストからAI音声を作るにはどうすればよいですか?
Audio Generatorを開き、モデルを選び、読み上げたい正確な文を貼り付けます。声を選ぶかAutoのままにし、Voice Instructionsで話し方を指定してください。生成されたMP3を聞き、テンポ、名前の読み、トーンに違和感があれば台本や指示を調整します。
どのAudio Generatorモデルを選べばよいですか?
Gemini 2.5 Flash TTSは、下書きや短いクリップ向けの標準モデルで、より速く低コストです。Gemini 2.5 Pro TTSは、抑揚やテンポが重要な本番ナレーション向けです。MiniMax Speech 2.8 TurboとHDも多言語音声に利用でき、Turboは素早い下書き、HDはより磨いた最終ナレーションに向いています。
声のトーン、アクセント、テンポを調整できますか?
はい。Voice Instructionsに自然な言葉で指定します。たとえば「落ち着いて安心感があり、ゆっくり、はっきり間を取る」や「明るく、軽快で、エネルギッシュに」と書けます。句読点も重要で、句点は大きな停止、読点は短い間、三点リーダーは長めの間を作ります。
AI音声で歌、音楽、効果音を作れますか?
いいえ。Audio Generatorは話し言葉のテキスト読み上げ用です。歌、音楽、効果音、文字起こし、声のクローンは作りません。BGMにはMusic Generatorを使い、ナレーションと音楽を含む動画はVideo Reelで組み立てます。