Google · 오디오
Gemini 3.8 Flash TTS
Google의 대표 음성 모델. 30가지 음성, 130개 이상 언어, 인라인 보컬 태그 지원.
~1.3 크레딧 1,000자당
AI 음성 생성에서 실행 텍스트
Gemini 3.8 Flash TTS
오디오
- 제공사
- 사용 파이프라인
- AI 음성 생성
- 최소
- ~1.3 크레딧 1,000자당
지원 설정
AI 음성 생성 →
- 최대 5,000자
- Zephyr — Bright · Puck — Upbeat · Charon — Informative · Kore — Firm · Fenrir — Excitable · Leda — Youthful · Orus — Firm · Aoede — Breezy · Callirrhoe — Easy-going · Autonoe — Bright · Enceladus — Breathy · Iapetus — Clear · Umbriel — Easy-going · Algieba — Smooth · Despina — Smooth · Erinome — Clear · Algenib — Gravelly · Rasalgethi — Informative · Laomedeia — Upbeat · Achernar — Soft · Alnilam — Firm · Schedar — Even · Gacrux — Mature · Pulcherrima — Forward · Achird — Friendly · Zubenelgenubi — Casual · Vindemiatrix — Gentle · Sadachbia — Lively · Sadaltager — Knowledgeable · Sulafat — Warm
- 최대 300자
Gemini 3.8 Flash TTS로 할 수 있는 것
- 텍스트 → 음성
Gemini 3.8 Flash TTS로 만든 결과물
Pyra 소개: 보이스오버
Gemini 3.8 Flash TTS. Pyra 자신의 이야기를 따뜻한 이야기꾼 목소리로. 어떤 영상에도 바로 얹을 수 있는 보이스오버입니다.
Gemini 3.8 Flash TTS을 사용하는 파이프라인
Gemini 3.8 Flash TTS 소개
기능
Gemini 3.8 Flash TTS는 Google의 대표 텍스트 음성 변환 모델입니다. AI 음성 생성에서 Gemini 음성 30가지 중 하나로 텍스트를 읽고 MP3를 돌려줍니다. 텍스트에서 언어를 감지해 130개 이상의 언어를 말하며, 짧은 전달 지시와 텍스트 안에 넣은 <laugh>, <sigh>, <short pause> 같은 소리를 따릅니다.
사용하기 좋은 경우
- 스튜디오 품질의 목소리와 자연스러운 속도가 필요한 내레이션, 오디오북, 설명 영상.
- 사용자가 적은 언어나 지역 방언으로 된 대본.
- 정해진 위치에 웃음, 한숨, 숨소리, 쉼이 들어가는 대사.
실행 전 알아둘 사항
Gemini는 텍스트를 쓰인 그대로 읽으므로 지시는 텍스트가 아니라 음성 지시에 적으세요. 프롬프트 개선을 켜면 Pipe2가 지시를 짧은 스타일로 정리하고, 단어를 바꾸지 않고 소리 태그를 더하며, 음성을 대신 고를 수도 있습니다. 텍스트는 최대 5,000자까지 입력할 수 있습니다. 비용은 Google이 실제로 생성한 오디오에 대해 청구되므로 말하는 길이와 속도에 따라 달라집니다. 프롬프트 개선을 켜면 이 개선 단계의 비용도 포함됩니다. 여러 화자의 대화와 사용자 지정 음성은 여기서 사용할 수 없습니다.
다른 이름
이 모델은 API 이름인 gemini-3.8-flash-tts로 표시되기도 합니다.