AI 음성 생성

0.002 크레딧부터

텍스트를 자연스러운 음성으로 변환하세요. 수십 가지 목소리와 70개 이상의 언어를 지원하며, 말투·억양·속도를 원하는 대로 지정할 수 있습니다.

AI
자동
AI가 지시 사항과 텍스트를 바탕으로 가장 적합한 음성을 선택합니다
또는 특정 음성을 선택하세요...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

입력이 필요합니다: 텍스트

예시

오디오Gemini 2.5 Flash TTS

Pyra 소개: 보이스오버

Gemini 2.5 Flash TTS. Pyra 자신의 이야기를 따뜻한 이야기꾼 목소리로. 어떤 영상에도 바로 얹을 수 있는 보이스오버입니다.

AI 음성 생성 사용 방법

이 파이프라인을 워크플로 어디에 배치할지 결정하는 간결한 가이드입니다.

가장 적합한 용도

  • 70개 이상의 언어로 제작하는 내레이션과 보이스오버
  • “따뜻하게”, “속삭이듯”, “신나는 말투로”처럼 자연어로 스타일을 지정하는 텍스트 음성 변환
  • 수십 가지 목소리를 활용한 다인물 콘텐츠
  • 텍스트 언어를 자동으로 인식하는 다국어 대본

  • 내레이션은 짧고 명확한 문장으로 쓰면 리듬이 더 자연스럽습니다
  • 구두점으로 쉼을 조절하세요. 마침표는 긴 쉼, 쉼표는 짧은 쉼, 말줄임표는 조금 더 긴 여운을 만듭니다
  • 자동 모드에서는 지시에 맞는 목소리를 선택합니다. 같은 캐릭터가 반복해서 등장한다면 특정 목소리를 고정하세요
  • “느리고 극적으로”, “밝고 경쾌하게”, “차분하고 안심시키듯이”처럼 자연어로 연기 방식을 설명하세요

AI 음성 생성 API

직접 작성한 코드에서 이 파이프라인을 호출하세요. 요청 한 번으로 실행이 시작되며, 모델은 별도의 엔드포인트가 아니라 입력 필드입니다.

API 토큰 발급
개 입력
5
필수
1
요금
0.002 to 40.0 크레딧
언어
언어
bun add @pipe2-ai/sdk
파이프라인 실행
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});

pip install pipe2
파이프라인 실행
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
파이프라인 실행
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
파이프라인 실행
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

전체 API 레퍼런스 CLI 레퍼런스

자주 묻는 질문

어떤 목소리를 사용할 수 있나요?
밝고 경쾌한 목소리부터 깊고 따뜻한 목소리, 단호하거나 극적인 목소리까지 수십 가지를 제공합니다. 각 목소리는 자연어 지시에 따라 말투와 전달 방식을 조절할 수 있습니다.
어떤 언어를 지원하나요?
70개 이상의 언어를 지원하며 언어를 자동으로 감지합니다. 영어, 중국어, 일본어, 스페인어 같은 주요 언어뿐 아니라 세부아노어, 콘칸어, 룩셈부르크어 같은 지역 언어도 포함됩니다.
음성 지시는 어떻게 사용하나요?
원하는 목소리를 자연어로 설명하면 됩니다. 예를 들어 “40대 영국인 기자처럼 천천히 말하고, 중요한 부분에서는 극적으로 멈추기”라고 쓰면 해당 지시에 맞춰 전달 방식을 조절합니다.
출력 오디오 형식은 무엇인가요?
MP3로 제공되며 바로 다운로드할 수 있습니다. Video Reel 등에 내레이션 트랙으로 추가할 수도 있습니다.
어떤 모델을 선택해야 하나요?
Flash TTS는 저렴하고 빠르기 때문에 초안, 짧은 클립, 반복 작업에 적합합니다. Pro TTS는 음질과 억양, 리듬이 더 뛰어나 최종 제작용 내레이션에 알맞습니다. 둘 다 몇 초 안에 생성되지만 Pro가 조금 더 오래 걸립니다.
크레딧은 얼마나 필요한가요?
모델에 따라 0.002 to 40.0 크레딧이 듭니다. Flash TTS가 더 저렴하고 Pro TTS는 조금 더 비싸며, 보통 몇 초 안에 결과가 준비됩니다.

AI 텍스트 음성 변환

어떤 텍스트든 자연스러운 음성으로 바꿔 보세요. 수십 가지 목소리와 70개 이상의 언어를 지원하고, 자연어 지시로 말투·억양·속도·감정을 조절할 수 있습니다. 제작에 바로 쓸 수 있는 보이스오버가 몇 초 만에 완성됩니다.

만들 수 있는 것

  • 다큐멘터리 내레이션: 신뢰감 있고 전문적인 목소리
  • 팟캐스트 오프닝·클로징·대화: 여러 인물의 목소리를 자연스럽게 연출
  • 다국어 보이스오버: 같은 대본을 70개 이상의 언어로 제작
  • 오디오북 낭독: 감정과 호흡을 살린 자연스러운 전달
  • 접근성용 음성: 텍스트 콘텐츠를 들을 수 있는 오디오로 변환

작동 방식

  1. 텍스트 입력: 음성으로 읽을 내용을 붙여 넣습니다
  2. 목소리 선택: 직접 고르거나 자동 모드로 두면 텍스트와 지시에 맞는 목소리를 선택합니다
  3. 말하기 스타일 지정(선택): 억양, 속도, 감정을 자연스럽게 설명합니다. 예: "따뜻한 영국식 억양으로 천천히, 중요한 부분에서는 극적으로 멈추기"
  4. 모델 선택: 빠른 초안은 Flash TTS, 완성도 높은 최종 내레이션은 Pro TTS가 적합합니다

스타일 팁

  • 내레이션은 짧고 명확한 문장으로 쓰면 호흡과 리듬이 더 자연스럽습니다
  • 구두점으로 쉼을 조절하세요. 마침표는 긴 쉼, 쉼표는 짧은 쉼, 말줄임표는 조금 더 긴 여운을 만듭니다
  • 원하는 느낌을 자연스럽게 적으세요. 예: "느리고 극적으로", "밝고 경쾌하게", "차분하고 안심시키듯이"

더 많은 파이프라인 살펴보기

AI 영상 생성
from 9.5
AI 영상 생성
AI 이미지 생성
0.2-6.4
AI 이미지 생성
AI 음악 생성
2.5-22.6
AI 음악 생성
AI 영상 편집
13.1-33.3
AI 영상 편집