영상·오디오 전사
0.8 크레딧부터
영상이나 오디오를 텍스트로 변환하세요. 타임스탬프, 화자 구분, 99개 이상의 언어를 지원합니다.
0 – 20
선택 사항: 생성되는 SRT와 TXT에서 특정 단어를 교체합니다. 이름, 약어, 전문 용어처럼 항상 같은 방식으로 잘못 인식되는 단어를 바로잡을 때 유용합니다. 각 키에는 잘못 전사된 단어를, 값에는 올바른 표기를 입력하세요. 대소문자를 구분하고 단어 전체가 일치할 때만 적용됩니다. 비워 두면 인식 결과를 그대로 출력합니다.
사용 모델
-
ElevenLabs
- 개 입력
- 5
- 필수
- 1
- 요금
- from 0.8 크레딧
| 입력 | 유형 | 기본값 | 설명 |
|---|---|---|---|
source_asset_id | string | 기본값— | 전사할 오디오 또는 영상입니다. 업로드 후 반환된 자산 ID를 사용하세요. 업로드 방법은 /docs/api/에서 확인할 수 있습니다. |
corrections | object | 기본값{} | 선택 사항: 생성되는 SRT와 TXT에서 특정 단어를 교체합니다. 이름, 약어, 전문 용어처럼 항상 같은 방식으로 잘못 인식되는 단어를 바로잡을 때 유용합니다. 각 키에는 잘못 전사된 단어를, 값에는 올바른 표기를 입력하세요. 대소문자를 구분하고 단어 전체가 일치할 때만 적용됩니다. 비워 두면 인식 결과를 그대로 출력합니다. |
diarize | boolean | 기본값false | 각 구간의 화자를 표시합니다. 인터뷰나 여러 사람이 참여한 녹음에서 켜세요. |
language_code | enum | 기본값auto | 녹음된 언어입니다. 비워 두면 오디오에서 자동으로 감지합니다.auto · en · es +8autoenesptfrdehiarjakozh |
num_speakers | integer | 기본값0 | 예상 화자 수입니다. 비워 두면 자동으로 감지합니다. |
MCP 클라이언트를 pipe2에 연결하면 에이전트가 이 도구들을 사용할 수 있습니다. 이 파이프라인을 찾아 위와 동일한 스키마를 읽고 실행합니다.
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}이 파이프라인을 사용하는 레시피
모든 레시피 보기-
긴 영상 하나로 자막이 들어간 클립 여러 개 만들기
긴 영상을 자막이 들어간 짧은 클립 N개로 나눕니다. 전체 영상은 한 번만 전사하고, AI가 주요 장면을 고른 뒤 각 클립의 트리밍과 자막 작업을 병렬로 처리합니다. TikTok, Reels, Shorts용 세로 화면(9:16), Instagram용 정사각형(1:1)이나 세로형(4:5)으로도 바꿀 수 있으며, 자막 위치는 화면 비율에 맞춰 자동 조정됩니다.
-
시청자 질문 → 애니메이션으로 보여 주는 답변
검토한 답변과 시각적 장면 구성을 내레이션, 스톡 영상, 시간에 맞춘 도해, 동기화된 자막이 있는 세로형 설명 영상으로 만드세요.
자주 묻는 질문
어떤 파일 형식을 지원하나요?
MP4, MOV, AVI, MP3, WAV, M4A, FLAC 등 일반적인 영상과 오디오 파일을 지원합니다. 영상 파일에서는 오디오 트랙을 자동으로 추출합니다.
전사 정확도는 어느 정도인가요?
주요 언어의 깨끗한 오디오에서는 단어 오류율이 5% 미만입니다. 실제 정확도는 녹음 품질, 배경 소음, 발음의 명확성에 따라 달라집니다.
화자 구분이란 무엇인가요?
켜면 각 구간에 [speaker_0], [speaker_1]처럼 발화한 사람을 표시합니다. 녹음에 몇 명이 참여했는지 안다면 화자 수를 지정해 정확도를 높일 수 있습니다.
어떤 언어를 지원하나요?
99개 언어를 지원하며 자동 감지도 제공합니다. 원본 언어를 알고 있다면 직접 지정하는 편이 가장 정확합니다.
처리 시간은 얼마나 걸리나요?
보통 오디오 길이의 10~30% 정도가 걸립니다. 예를 들어 10분 녹음은 약 1~3분 안에 전사됩니다.
AI 영상·오디오 전사
영상이나 오디오 파일을 업로드하면 단어 단위 타임스탬프가 포함된 정확한 전사본을 생성합니다. 필요하면 화자도 구분할 수 있으며, SRT 자막과 일반 텍스트로 받아 자막 제작, 편집, 콘텐츠 재활용에 바로 쓸 수 있습니다.
이것으로 할 수 있는 일
- 영상 자막 제작: SRT를 만든 뒤 소셜 영상에 자막으로 삽입
- 긴 콘텐츠 재활용: 전사본을 LLM에 입력해 요약, 클립 아이디어, 소셜 문구 제작
- 인터뷰와 팟캐스트 전사: 여러 사람이 말하는 녹음에서 화자를 구분
- 접근성 향상: 음성 콘텐츠를 읽고 검색할 수 있는 형태로 변환
- 번역 준비: 번역과 다국어 보이스오버에 사용할 깨끗한 원문 확보
작동 방식
- 파일 업로드: MP4, MOV, MP3, WAV, M4A, FLAC 등 일반적인 영상·오디오 형식을 지원합니다
- 언어 선택: 알고 있다면 직접 고르고, 아니면 자동 감지를 사용합니다
- 화자 구분 설정: 필요하면 각 구간에 화자 라벨을 붙입니다
- 결과 다운로드: 타임스탬프가 포함된 SRT와 일반 텍스트를 받습니다
출력 형식
- SRT: 밀리초 단위 타임스탬프가 포함되어 영상 편집기에 바로 넣을 수 있는 자막 파일
- 일반 텍스트: 편집, 요약, 번역에 쓰기 좋은 읽기 쉬운 전사본