AI 음성 생성

0.002 크레딧부터

텍스트를 자연스러운 음성으로 변환하세요. 수십 가지 목소리와 70개 이상의 언어를 지원하며, 말투·억양·속도를 원하는 대로 지정할 수 있습니다.

첫 내레이션을 만들어 보세요

읽어 줄 내용을 입력하거나 예시를 들어 보세요.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
생성에 필요한 입력

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

예시

Pyra 소개: 보이스오버

Gemini 3.8 Flash TTS. Pyra 자신의 이야기를 따뜻한 이야기꾼 목소리로. 어떤 영상에도 바로 얹을 수 있는 보이스오버입니다.

AI 음성 생성 사용 방법

이 파이프라인을 워크플로 어디에 배치할지 결정하는 간결한 가이드입니다.

가장 적합한 용도

  • 70개 이상의 언어로 제작하는 내레이션과 보이스오버
  • “따뜻하게”, “속삭이듯”, “신나는 말투로”처럼 자연어로 스타일을 지정하는 텍스트 음성 변환
  • 수십 가지 목소리를 활용한 다인물 콘텐츠
  • 텍스트 언어를 자동으로 인식하는 다국어 대본

팁

  • 내레이션은 짧고 명확한 문장으로 쓰면 리듬이 더 자연스럽습니다
  • 구두점으로 쉼을 조절하세요. 마침표는 긴 쉼, 쉼표는 짧은 쉼, 말줄임표는 조금 더 긴 여운을 만듭니다
  • 자동 모드에서는 지시에 맞는 목소리를 선택합니다. 같은 캐릭터가 반복해서 등장한다면 특정 목소리를 고정하세요
  • “느리고 극적으로”, “밝고 경쾌하게”, “차분하고 안심시키듯이”처럼 자연어로 연기 방식을 설명하세요

AI 음성 생성 API

직접 작성한 코드에서 이 파이프라인을 호출하세요. 요청 한 번으로 실행이 시작되며, 모델은 별도의 엔드포인트가 아니라 입력 필드입니다.

API 토큰 발급
개 입력
5
필수
1
요금
0.002 to 40.0 크레딧
언어
언어
bun add @pipe2-ai/sdk
파이프라인 실행
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
파이프라인 실행
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
파이프라인 실행
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
파이프라인 실행
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

전체 API 레퍼런스 CLI 레퍼런스

자주 묻는 질문

어떤 목소리를 사용할 수 있나요?
밝고 경쾌한 목소리부터 깊고 따뜻한 목소리, 단호하거나 극적인 목소리까지 수십 가지를 제공합니다. 각 목소리는 자연어 지시에 따라 말투와 전달 방식을 조절할 수 있습니다.
어떤 언어를 지원하나요?
70개 이상의 언어를 지원하며 언어를 자동으로 감지합니다. 영어, 중국어, 일본어, 스페인어 같은 주요 언어뿐 아니라 세부아노어, 콘칸어, 룩셈부르크어 같은 지역 언어도 포함됩니다.
음성 지시는 어떻게 사용하나요?
원하는 목소리를 자연어로 설명하면 됩니다. 예를 들어 “40대 영국인 기자처럼 천천히 말하고, 중요한 부분에서는 극적으로 멈추기”라고 쓰면 해당 지시에 맞춰 전달 방식을 조절합니다.
출력 오디오 형식은 무엇인가요?
MP3로 제공되며 바로 다운로드할 수 있습니다. Video Reel 등에 내레이션 트랙으로 추가할 수도 있습니다.
어떤 모델을 선택해야 하나요?
Gemini 3.8 Flash-Lite TTS는 가장 빠르고 저렴해 초안과 짧은 클립에 적합합니다. Gemini 3.8 Flash TTS는 130개 이상의 언어로 스튜디오 품질의 내레이션을 만듭니다. Eleven v4는 표현력이 가장 뛰어나 표시한 위치에서 웃거나 한숨 쉬거나 속삭입니다. MiniMax Speech 2.8의 Turbo와 HD는 속도 중심과 품질 중심의 대안입니다. 모두 몇 초 안에 MP3를 반환합니다.
크레딧은 얼마나 필요한가요?
모델과 텍스트 길이에 따라 0.002 to 40.0 크레딧이 듭니다. Gemini 모델은 실제로 생성된 오디오만큼만 청구됩니다. 보통 몇 초 안에 결과가 준비됩니다.

AI 텍스트 음성 변환

어떤 텍스트든 자연스러운 음성으로 바꿔 보세요. 수십 가지 목소리와 70개 이상의 언어를 지원하고, 자연어 지시로 말투·억양·속도·감정을 조절할 수 있습니다. 제작에 바로 쓸 수 있는 보이스오버가 몇 초 만에 완성됩니다.

만들 수 있는 것

  • 다큐멘터리 내레이션: 신뢰감 있고 전문적인 목소리
  • 팟캐스트 오프닝·클로징·대화: 여러 인물의 목소리를 자연스럽게 연출
  • 다국어 보이스오버: 같은 대본을 70개 이상의 언어로 제작
  • 오디오북 낭독: 감정과 호흡을 살린 자연스러운 전달
  • 접근성용 음성: 텍스트 콘텐츠를 들을 수 있는 오디오로 변환

작동 방식

  1. 텍스트 입력: 음성으로 읽을 내용을 붙여 넣습니다
  2. 목소리 선택: 직접 고르거나 자동 모드로 두면 텍스트와 지시에 맞는 목소리를 선택합니다
  3. 말하기 스타일 지정(선택): 억양, 속도, 감정을 자연스럽게 설명합니다. 예: "따뜻한 영국식 억양으로 천천히, 중요한 부분에서는 극적으로 멈추기"
  4. 모델 선택: 빠르고 저렴한 초안은 Gemini 3.8 Flash-Lite TTS, 스튜디오 품질 내레이션은 Gemini 3.8 Flash TTS, 가장 풍부한 표현은 Eleven v4가 적합하며 MiniMax Speech 2.8도 선택할 수 있습니다

스타일 팁

  • 내레이션은 짧고 명확한 문장으로 쓰면 호흡과 리듬이 더 자연스럽습니다
  • 구두점으로 쉼을 조절하세요. 마침표는 긴 쉼, 쉼표는 짧은 쉼, 말줄임표는 조금 더 긴 여운을 만듭니다
  • 원하는 느낌을 자연스럽게 적으세요. 예: "느리고 극적으로", "밝고 경쾌하게", "차분하고 안심시키듯이"

더 많은 파이프라인 살펴보기

AI 영상 생성
from 9.5
AI 영상 생성
AI 이미지 생성
0.2-6.7
AI 이미지 생성
AI 음악 생성
2.5-22.6
AI 음악 생성
AI 영상 편집
from 9.5
AI 영상 편집