ai 음성 만드는 법: 텍스트를 음성으로 변환하기
글로 쓴 텍스트를 자연스러운 음성으로 바꾸는 방법입니다. 대본을 붙여 넣고, 목소리를 고르고, 톤과 속도를 평범한 말로 설명한 다음 오디오 파일로 내보내세요.
작성자 Pipe2.ai · 업데이트 July 24, 2026
Pipe2.ai에서 텍스트로 ai 음성을 만들려면 Audio Generator를 열고, 말하게 할 대본을 붙여 넣고, 목소리를 고른 뒤(또는 Auto로 두고), 전달 방식(톤, 억양, 속도, 감정)을 Voice Instructions 필드에 설명하세요. 모델이 그 스타일로 텍스트를 읽어 다운로드하거나 동영상에 얹을 수 있는 MP3를 돌려줍니다. 녹음 세션도, 섭외할 성우도 필요 없습니다. 쓴 텍스트와 짧은 스타일 메모가 입력의 전부입니다.
워크플로 검토 — 2026년 7월: 아래의 입력, 목소리 수, 지원 언어, 스타일 조절 동작, 출력 형식은 현재 Audio Generator 파이프라인을 기준으로 확인했습니다. 이 가이드에서는 폼에 없는 조절 기능을 사용할 수 있다고 가정하지 않습니다.
보이스오버를 만드는 5단계
- Audio Generator를 여세요. Audio Generator 파이프라인에서 시작합니다. Gemini 2.5 TTS를 사용하며 73개 언어에 걸쳐 30가지 목소리를 제공합니다.
- 텍스트를 붙여 넣으세요. 말하게 할 정확한 단어를 입력합니다. 여기서는 문장 부호가 중요합니다. 쉼을 좌우하기 때문입니다(아래 참고).
- 목소리를 고르세요. Auto로 두면 모델이 스타일 메모에 맞는 목소리를 골라 주고, 여러 클립에서 같은 캐릭터를 유지하고 싶으면 지정된 목소리(Zephyr, Puck, Kore 등)를 고정합니다.
- 전달 방식을 설명하세요. Voice Instructions에 어떻게 들려야 하는지 적습니다. “따뜻한 영국식 억양, 극적인 쉼과 함께 느린 속도” 또는 “밝고 활기차게, 경쾌하게”처럼요. 이것은 수치 슬라이더가 아니라 평범한 말로 하는 지시입니다.
- 생성하고 들어 보세요. 출력은 MP3입니다. 속도와 까다로운 이름·숫자를 확인하고, 필요하면 텍스트나 지시를 수정해 다시 생성합니다.
Audio Generator는 텍스트와 선택 사항인 목소리, 선택 사항인 스타일 지시를 받아 MP3 하나를 돌려줍니다. 오디오 길이는 텍스트의 길이를 따르며 별도의 길이 조절 기능이 없으므로, 대본 자체가 클립의 재생 시간을 결정합니다.
모델이 잘 읽는 텍스트를 쓰세요
단어가 곧 대본이므로, 텍스트에 대한 작은 수정이 다른 어떤 것보다 결과를 크게 바꿉니다. 몇 가지 습관이 도움이 됩니다.
- 짧고 명확한 문장으로 쓰세요. 절이 많은 긴 문장보다 속도가 잘 잡히고, 모델이 자연스럽게 숨 쉴 자리를 줍니다.
- 문장 부호로 쉼을 만드세요. 마침표는 완전한 멈춤, 쉼표는 짧은 쉼, 말줄임표는 더 긴 쉼입니다. 전달을 느리게 하고 싶은 곳에 쉼표를 넣으세요.
- 까다로운 단어는 소리 나는 대로 적으세요. 이름, 약어, 숫자가 잘못 읽히면 소리 나는 대로 표기한 뒤 다시 생성합니다.
- 캐릭터마다 한 목소리를 유지하세요. 반복 등장하는 내레이터에는 지정된 목소리를 고정해 클립 전반에서 소리가 일관되게 하고, 단일 결과물에 좋은 매칭만 필요하면 Auto를 사용하세요.
스타일 자체는 억양, 감정, 속도를 함께 설명하세요. 예를 들면:
차분하고 안심시키는 내레이터. 문장 사이에 또렷한 쉼을 두고 부드럽고 느긋한 속도로. 중립적인 억양, 따뜻하지만 지나치게 밝지는 않게.
구글의 Gemini 음성 생성 가이드는 톤을 파라미터로 표현하려 하기보다 이런 식의 자연어 지시를 권장합니다. 스타일 조절은 표현력이 있지만 정확하지는 않으므로, 지시는 안내로 여기고 들어 본 뒤 다듬으세요.
알아 둘 만한 목소리, 길이, 한계
몇 가지 동작은 걸려 넘어지기 쉽습니다.
- 길이는 텍스트를 따릅니다. 시간 조절 기능이 없으며, 대본이 길수록 클립이 길어집니다. 재생 시간을 바꾸려면 단어를 줄이거나 늘리세요.
- 아주 긴 대본은 조각으로 나뉩니다. 파이프라인은 긴 텍스트를 나누고 각 부분을 생성한 뒤 이어 붙이는데, 이음매에 약간의 연결 흔적이 남을 수 있습니다. 긴 대본을 자연스러운 문단으로 나누면 도움이 됩니다.
- 스타일은 방향일 뿐 정밀하지 않습니다. 지시는 톤과 속도를 이끌지만 매 실행마다 정확한 감정이나 타이밍을 맞추지는 못합니다. 하나의 고정된 결과를 기대하기보다 다시 생성하세요.
- 말은 하지만 노래하거나 반주하지는 않습니다. 음악이나 인스트루멘털 배경이 필요하면 Music Generator를 사용하세요. Audio Generator는 말하기 전용입니다.
보이스오버를 동영상에 넣으세요
생성된 목소리는 화면에 붙일 때 가장 쓸모가 있습니다. 흔한 경로는 Audio Generator → Video Reel입니다. 내레이션을 만든 뒤 Video Reel의 Narration 입력으로 추가하면, 배경 음악은 각자의 입력에 남고, 음성과 음악이 목소리를 앞에 둔 채 믹스됩니다. 내레이션 아래에 음악 배경도 깔고 싶다면 Music Generator로 하나 만들어 둘 다 붙이세요.
샷 기획부터 클립 생성, 내레이션과 음악 추가, 그리고 자막과 브랜딩까지 전체 제작 순서를 보려면 AI 동영상 만드는 법을 따르세요. 사운드트랙을 음성에 맞춰 조율하려면 대사를 가리지 않고 동영상에 음악 넣는 방법을, 음악 자체를 생성하려면 AI로 음악 생성하는 방법을 참고하세요.
대본, 생성된 MP3, 최종 동영상을 별도의 에셋으로 보관하세요. 그러면 나머지 프로젝트를 다시 만들지 않고도 한 줄을 다시 녹음하거나 전달 방식을 교체할 수 있습니다.
자주 묻는 질문
텍스트로 ai 음성을 어떻게 만드나요?
대본을 붙여 넣고, 목소리를 고르고, 원하는 전달 방식을 설명하세요. Pipe2.ai에서 Audio Generator를 열고 텍스트를 입력한 뒤, 목소리를 선택하거나 Auto로 두고, ‘따뜻하고 느긋한, 심야 라디오 진행자 같은’처럼 스타일 지시를 적으세요. 모델이 그 스타일로 텍스트를 읽어 다운로드하거나 동영상에 얹을 수 있는 MP3를 돌려줍니다.
몇 개의 목소리와 언어를 사용할 수 있나요?
Audio Generator는 Gemini 2.5 TTS를 통해 30가지의 서로 다른 목소리와 73개 언어를 제공합니다. 목소리를 Auto로 두면 모델이 스타일 지시에 맞는 목소리를 골라 주며, 여러 클립에서 같은 캐릭터를 유지하고 싶을 때는 특정 목소리를 지정하세요.
목소리의 톤, 억양, 속도를 조절할 수 있나요?
네. Voice Instructions 필드에서 수치 파라미터가 아니라 평범한 말로 조절합니다. 억양, 감정, 속도를 설명하세요. 예를 들어 ‘차분하고 안심시키는, 또렷한 쉼과 함께 느리게’처럼요. 문장 부호도 전달 방식을 좌우합니다. 마침표는 완전한 멈춤을, 쉼표는 짧은 쉼을, 말줄임표는 더 긴 쉼을 만듭니다.
생성된 음성은 얼마나 길 수 있나요?
오디오 길이는 시간 설정이 아니라 텍스트의 길이를 따릅니다. 긴 대본은 자동으로 조각으로 나뉘어 다시 이어 붙여지므로, 아주 긴 텍스트에서는 이음매에 약간의 연결 흔적이 있을 수 있습니다. 짧고 명확한 문장으로 쓰면 속도가 고르게 유지됩니다.
ai 음성이 노래를 부르거나 효과음을 낼 수 있나요?
아니요. Audio Generator는 노래나 음악 연주가 아니라 말하는 텍스트-투-스피치를 위해 만들어졌으며, 효과음도 만들지 않습니다. 배경 음악이나 인스트루멘털 트랙이 필요하면 Music Generator를 사용하고, 보이스오버와 음악을 한 동영상에 함께 담으려면 Video Reel에서 둘 다 조립하세요.