音声生成aiの使い方:テキストから音声を作る方法
書いたテキストを自然な話し声に変換する方法を解説します。台本を貼り付け、声を選び、トーンとテンポを平易な言葉で指定して、音声ファイルを書き出します。
著者 Pipe2.ai · 更新日 July 24, 2026
Pipe2.aiでテキストから音声生成aiの音声を作るには、Audio Generatorを開き、読み上げたい台本を貼り付け、声を選び(またはAutoのままにし)、読み方(トーン、アクセント、テンポ、感情)をVoice Instructions欄に記述します。モデルはそのスタイルであなたのテキストを読み上げ、ダウンロードしたり動画に重ねたりできるMP3を返します。収録の予約も、声優の手配も必要ありません。書いたテキストと短いスタイルの指示だけが、入力のすべてです。
ワークフロー確認 — 2026年7月: 以下に記載する入力、声の数、対応言語、スタイル制御の挙動、出力形式は、現行のAudio Generatorパイプラインに照らして確認しています。このガイドでは、現在のフォームに存在しない操作機能があるとは想定していません。
ナレーションを作る5つの手順
- Audio Generatorを開きます。 Audio Generatorパイプラインから始めます。Gemini 2.5 TTSを使用し、73言語にわたる30種類の声を利用できます。
- テキストを貼り付けます。 読み上げたい言葉を正確に入力します。ここでは句読点が重要です。間を制御します(下記参照)。
- 声を選びます。 Autoのままにすればモデルがスタイル指示に合う声を選び、名前付きの声(Zephyr、Puck、Koreなど)を固定すれば、複数のクリップで同じキャラクターを保てます。
- 読み方を記述します。 Voice Instructionsに、どう聞こえるべきかを書きます。「温かみのあるイギリス英語のアクセント、ドラマチックな間を取ったゆっくりとしたペース」や「陽気で明るく、テンポよく」のように。これは数値スライダーではなく、平易な言葉による指示です。
- 生成して聞きます。 出力はMP3です。テンポや、読みにくい名前・数字を確認し、テキストや指示を調整して、必要なら再生成します。
Audio Generatorは、テキスト、任意の声、任意のスタイル指示を受け取り、1つのMP3を返します。音声の長さはテキストの長さに従い、別途の長さ調整はありません。したがって台本そのものが、クリップの長さを決めます。
モデルがうまく読めるテキストを書く
言葉が台本そのものなので、テキストへの小さな修正が、他の何よりも結果を大きく変えます。いくつかの習慣が役立ちます。
- 短く明瞭な文で書きます。 節の多い長い文よりテンポがよく、モデルが自然に息をつける場所を与えます。
- 句読点で間を作ります。 ピリオドは完全な停止、カンマは短い間、三点リーダーはより長い間です。読み方を遅くしたいところにカンマを足します。
- 読みにくい語は音のとおりに綴ります。 名前、頭字語、数字が正しく読まれない場合はそうしてから再生成します。
- キャラクターごとに1つの声を保ちます。 繰り返し登場するナレーターには名前付きの声を固定し、クリップ間で音を一貫させます。単発の作品に良い声が欲しいだけならAutoを使います。
スタイルそのものについては、アクセント、感情、速さをまとめて記述します。たとえば:
穏やかで安心感のあるナレーター。文と文の間に明瞭な間を取った、優しくゆったりとしたペース。中立的なアクセントで、温かみはあるが明るすぎない。
GoogleのGemini音声生成ガイドは、トーンをパラメータとして符号化しようとするより、こうした自然言語による指示を推奨しています。スタイル制御は表現力に富みますが正確ではないため、指示はあくまで方向づけとして扱い、聞いてから調整してください。
声、長さ、知っておくべき制限
いくつかの挙動はつまずきやすいポイントです。
- 長さはテキストに従います。 長さのダイヤルはなく、台本が長ければクリップも長くなります。尺を変えるには言葉を削るか増やします。
- 非常に長い台本はチャンク化されます。 パイプラインは長いテキストを分割し、各部分を生成してつなぎ合わせるため、継ぎ目にわずかなつながりが残ることがあります。長い台本を自然な段落に分けると役立ちます。
- スタイルは方向づけであり、正確ではありません。 指示はトーンとテンポを導きますが、毎回正確な感情やタイミングには当たりません。1つの固定結果を期待せず、再生成してください。
- 話しますが、歌ったり作曲したりはしません。 音楽やインストゥルメンタルのベッドにはMusic Generatorを使います。Audio Generatorは話し声専用です。
ナレーションを動画に入れる
生成した声は、映像に付けたときに最も役立ちます。よく使う流れはAudio Generator → Video Reelです。ナレーションを作り、Video ReelのNarration入力から追加します。BGMは別の入力に置くため、話し声と音楽はミックスされつつ、声が前面に保たれます。ナレーションの下に音楽のベッドも欲しい場合は、Music Generatorで作成し、両方を付けます。
ショットの計画から、クリップの生成、ナレーションと音楽の追加、そして字幕とブランディングまでの完全な制作工程は、AI動画の作り方を参照してください。サウンドトラックを話し声に対してバランスさせるには動画に音楽を入れる方法を、音楽そのものを生成するにはAIで音楽を生成する方法を参照してください。
台本、生成したMP3、完成した動画は、それぞれ別々の素材として保管してください。そうすれば、プロジェクトの残りを作り直さずに、1行を吹き替え直したり読み方を差し替えたりできます。
よくある質問
テキストから音声生成aiで音声を作るには?
台本を貼り付け、声を選び、希望する読み方を記述します。Pipe2.aiではAudio Generatorを開き、テキストを入力し、声を選ぶか(またはAutoのままにし)、「温かく、ゆったりとした、深夜のラジオパーソナリティのような」といったスタイル指示を書きます。モデルはそのスタイルでテキストを読み上げ、ダウンロードしたり動画に重ねたりできるMP3を返します。
利用できる声と言語はどれくらいありますか?
Audio Generatorは、Gemini 2.5 TTSを通じて30種類の異なる声を提供し、73言語に対応しています。声をAutoのままにすればモデルがスタイル指示に合う声を選び、名前付きの声を固定すれば、複数のクリップで同じキャラクターを保てます。
声のトーン、アクセント、テンポを調整できますか?
はい。Voice Instructions欄で、数値パラメータではなく平易な言葉で指定します。アクセント、感情、速さを記述してください。たとえば「穏やかで安心感のある、ゆっくりと明瞭な間を取った」のように書きます。句読点も読み方を左右します。ピリオドは完全な停止、カンマは短い間、三点リーダーはより長い間を作ります。
生成できる音声はどのくらいの長さになりますか?
音声の長さは、時間の設定ではなくテキストの長さに従います。長い台本は自動的にチャンクに分割され、つなぎ合わされるため、非常に長いテキストでは継ぎ目にわずかなつながりが生じることがあります。短く明瞭な文で書くと、テンポが安定します。
音声生成aiは歌ったり効果音を作ったりできますか?
いいえ。Audio Generatorは話し言葉のテキスト読み上げ用に作られており、歌唱や音楽演奏、効果音には対応していません。BGMやインストゥルメンタルのトラックにはMusic Generatorを、1本の動画にナレーションと音楽の両方を入れる場合はVideo Reelで両方を組み立ててください。