AI 자막 생성과 음성 텍스트 변환: TXT·SRT 만들기
동영상을 편집 가능한 TXT와 타임스탬프가 있는 SRT로 변환하고 언어 감지, 화자 구분, 반복 단어 교정을 활용하는 방법을 알아보세요.
사용 방법 작성자 Pipe2.ai 업데이트 September 2, 2026
이 글의 목차
이 파이프라인을 사용해 보세요
AI 음성 텍스트 변환은 동영상 속 말을 편집 가능한 글로 바꿉니다. Pipe2.ai의 Transcription에 동영상이나 오디오를 업로드하면 일반 TXT와 타임스탬프가 있는 SRT를 모두 받을 수 있습니다. 언어 감지, 화자 라벨, 반복해서 잘못 인식되는 단어의 교정도 설정할 수 있습니다.
동영상을 텍스트로 바꾸는 다섯 단계
- 오디오가 선명한 동영상을 고릅니다. Transcription에는 말소리가 필요합니다. 무음 동영상에서는 텍스트를 만들 수 없습니다.
- 파일을 업로드합니다. Transcription을 열고 변환할 동영상이나 오디오를 첨부합니다.
- 언어와 화자를 설정합니다. 언어를 모르면 Auto로 둡니다. 인터뷰나 토론에서는 화자 감지를 켜고, 필요하면 예상 인원을 입력합니다.
- 반복 단어 교정을 추가합니다. 이름, 약어, 제품명이 매번 같은 잘못된 형태로 인식된다면 인식된 표기를 올바른 표기에 연결합니다. 대소문자를 구분하며 완전한 단어와 일치할 때만 바뀝니다.
- 실행한 뒤 두 파일을 검토합니다. 읽고 편집할 때는 TXT를, 타이밍이 중요하거나 자막을 만들 때는 SRT를 사용합니다.
현재 파이프라인은 ElevenLabs Scribe v2를 사용합니다. 공개 양식에는 업로드한 동영상 또는 오디오 한 개, Auto와 명시된 10개 언어, 선택 사항인 화자 감지, 0~20명의 선택적 화자 수 힌트, 선택적 단어 교정을 입력할 수 있습니다. 결과는 서로 별개인 SRT와 TXT 에셋입니다.
다음 작업에 맞춰 TXT와 SRT 선택하기
두 출력에는 같은 발화 내용이 들어 있지만 구성 방식이 다릅니다.
| 출력 | 내용 | 적합한 용도 |
|---|---|---|
| TXT | 자막 시간 블록이 없는 연속된 읽기용 글 | 메모, 인용, 검색, 요약, 초안, 편집 검토 |
| SRT | 시작·종료 시간이 있는 번호 매긴 텍스트 블록 | 자막, 문장 경계에 맞춘 트리밍, 동영상과 동기화해야 하는 작업 |
둘 다 보관하세요. TXT는 빠르게 읽기 좋고, SRT는 영상 제작에 필요한 시간을 유지합니다. 다음 단계가 자동 자막 생성이라면 SRT를 검토한 뒤 동영상에 자막을 추가하는 방법을 따르세요.
음성 인식 결과를 더 정확하게 만들기
품질은 녹음에서 시작됩니다. 마이크를 화자에게 가까이 두고 배경 음악과 방의 울림을 줄이며 여러 사람이 동시에 말하지 않도록 하세요. 나중에 볼륨을 높여도 애초에 선명하게 녹음되지 않은 말은 복구할 수 없습니다.
언어를 알면 직접 선택하고, 모르면 Auto로 시작합니다. 누가 말했는지 중요할 때 화자 감지가 유용하지만 라벨에는 사람의 검토가 필요합니다. 비슷한 목소리, 끼어드는 말, 서로 다른 녹음 소스는 구분을 어렵게 할 수 있습니다.
Corrections는 일정하고 예측 가능한 오류에 사용하고 전체 문장을 다시 쓰는 용도로 쓰지 않습니다. 예를 들어 브랜드명이 늘 비슷한 일반 단어로 나오면 완전한 단어 교정으로 두 출력의 표기를 함께 고칠 수 있습니다. 불명확한 문장을 복원하거나 화자의 의도를 판단하는 기능은 아닙니다.
공개 전에 변환 결과 검토하기
AI 텍스트는 작업 문서이며 모든 단어가 정확하다는 증거가 아닙니다. 원본을 들으면서 다음 항목을 특히 확인하세요.
- 사람 이름, 조직명, 전문 용어, 약어
- 숫자, 가격, 날짜, 측정 단위
- 인터뷰와 그룹 대화의 화자 전환
- 일반 맞춤법 검사가 잘못 바꿀 수 있는 고유명사
- 소음, 음악, 억양, 겹치는 말이 있는 구간
- 너무 일찍 시작하거나 늦게 끝나거나 글이 지나치게 많은 SRT 블록
누군가의 말을 인용하려면 녹음과 대조하세요. 자막을 만들려면 글이 완성 영상의 일부가 되기 전에 문구와 타이밍을 고치세요.
텍스트를 자막이나 클립에 활용하기
Transcription은 화면에 글자를 입히지 않습니다. 다음 에셋을 만들기 전에 확인할 수 있는 재사용 가능한 파일을 만듭니다.
화면에 보이는 자막을 만들려면 검토한 SRT와 원본 동영상을 Captions에 첨부합니다. 숏폼 편집에서는 하나의 텍스트가 전체 작업을 지원할 수 있습니다. 좋은 구간을 찾고, 문장 경계에서 자르고, 완성 클립에 자막을 넣는 흐름입니다. 긴 동영상을 쇼츠로 만드는 방법에서 전체 순서를, 문장에 맞춰 동영상을 자르는 방법에서 자연스러운 컷 지점을 자세히 설명합니다.
단계를 나누면 한 SRT를 교정해 여러 자막 스타일에 재사용할 수 있습니다. TXT는 설명, 메모, 텍스트 기반 편집에 활용할 수 있어 원본을 다시 변환할 필요가 없습니다.
이 생성기가 하지 않는 일
텍스트 변환기는 음성을 글로 바꾸지만 녹음을 자동으로 요약하거나 하이라이트를 고르거나 번역하거나 자막이 입혀진 동영상을 만들지는 않습니다. 각각 별도의 편집 또는 제작 단계입니다.
오디오 트랙도 필요합니다. 화면에만 표시되고 소리 내어 읽히지 않은 글은 음성이 아니므로 변환 결과에 포함되지 않습니다. 중요한 슬라이드, 라벨, 화면 글자가 있다면 따로 확인해 필요할 때 메모에 추가하세요.
처음부터 가장 큰 아카이브를 처리하지 말고 대표적인 녹음 하나로 시작하세요. 화자, 전문 용어, 녹음 환경을 어떻게 처리하는지 확인하고 반복 교정을 추가한 뒤 나머지 파일에도 같은 검토 목록을 적용하면 됩니다.
자주 묻는 질문
동영상에서 텍스트를 추출하려면 어떻게 하나요?
오디오 트랙이 있는 동영상을 Transcription 파이프라인에 업로드하고, 언어를 Auto로 두거나 실제 언어를 선택한 뒤 필요하면 화자 감지를 켜고 실행하세요. 편집 가능한 TXT와 타임스탬프가 있는 SRT가 생성됩니다.
TXT와 SRT 출력은 무엇이 다른가요?
TXT는 시간 블록이 없는 연속된 글이라 편집, 인용, 메모, 검색에 편리합니다. SRT는 음성을 시작·종료 시간이 있는 블록으로 나눠 동영상 플레이어나 자막 도구가 영상과 동기화할 수 있게 합니다.
AI 음성 텍스트 변환으로 여러 화자를 구분할 수 있나요?
네. 인터뷰, 팟캐스트, 패널 토론에는 화자 감지를 켜세요. 인원을 알면 1~20명으로 입력하고, 모르면 0으로 두어 자동 감지를 사용합니다. 발언자 표시가 중요할 때는 라벨을 반드시 검토해야 합니다.
텍스트 변환을 실행하면 동영상에 자막도 표시되나요?
아니요. Transcription은 SRT와 TXT를 별도 파일로 만들 뿐 영상에 글자를 렌더링하지 않습니다. 표시되는 자막을 만들려면 SRT를 검토한 다음 원본 동영상과 함께 Captions 파이프라인에 넣으세요.
AI가 만든 동영상 텍스트는 어떻게 검수하나요?
녹음을 들으면서 이름, 약어, 숫자, 화자 전환, 소음이나 겹치는 말이 있는 구간을 확인하세요. 반복 오인식에는 단어 교정을 사용하고, 자막이나 인용문을 공개하기 전에 SRT 타이밍도 검토하세요.