Google · 音声

Gemini 2.5 Flash TTS

より高速・低コストな音声合成。下書きや短いクリップに。

別名: Gemini 2.5 Flash Text-to-Speech, Gemini 2.5 Flash Preview TTS, gemini-2.5-flash-preview-tts, Gemini-TTS

音声生成で実行

Gemini 2.5 Flash TTSでできること

  • テキスト→音声

Pipe2での料金

音声生成 →
1回あたり 0.7 クレジット

クレジット料金を見る →

Gemini 2.5 Flash TTSで作った作例

Gemini 2.5 Flash TTSを使うパイプライン

音声生成
0.7-1.3
音声生成

Gemini 2.5 Flash TTSについて

できること

Gemini 2.5 Flash TTS は Gemini プロバイダのテキスト読み上げモデルです。書かれたテキストを渡すと、音声が返ってきます。Pipe2 では音声生成パイプラインの中で動作し、70以上の言語にまたがる数十種類の声から選べるほか、口調・アクセント・話す速さを導くスタイル指示を添えられます。位置づけはより速く安価な合成の選択肢で、長い最終レンダーではなく下書きや短いクリップに向けられています。

使用するタイミング

  • 音声生成を実行し、自分で録音せずに書いた台本をナレーションやボイスオーバーに変えるとき。
  • 言い回しを繰り返し調整するとき。合成の選択肢の中でより速く安価なので、台本をまだ編集している段階の反復に向きます。
  • 短いクリップ(スティンガー、一行の読み上げ、案内)を作り、結果を早く受け取りたいとき。
  • 長いレンダーに踏み切る前に、対応する70以上の言語で声と言語の選択を試すとき。
  • 口調・アクセント・話す速さのスタイル指示を試し、演技の指示が読みをどう変えるか確かめるとき。

実行前に知っておくこと

課金は生成された出力トークンで計測されます(卸単位は約1500出力トークンごとに提示されます)。したがって費用は生成する音声量に比例します。長い台本は短い台本より高くつき、支出を抑える実際的な方法は、テキストを短くするか、より短い区切りに分けて個別に生成することです。入力はテキストと、音声生成で選ぶ声およびスタイル指示です。より速く安価な段階の代償として、下書きと短いクリップが対象になります。どの入力で実行されたか見たい場合、Pipe2 に作例が1件公開されています。

別名

このモデルは Gemini 2.5 Flash Text-to-Speech、Gemini 2.5 Flash Preview TTS、または gemini-2.5-flash-preview-tts として表記される場合があります。略称の "Gemini-TTS" も同じものを指します。

類似モデル