전사
모든 영상이나 오디오 파일을 텍스트로 전사합니다. 타임스탬프, 화자 감지, 99개 이상 언어 지원.
0 – 20
생성된 SRT와 TXT에 적용되는 선택적 단어 단위 치환입니다, 인식기가 특정 단어(이름, 약어, 전문 용어)를 잘못 알아듣고 매번 똑같이 틀리게 표기할 때 유용합니다. 각 키는 전사된 단어이고, 값은 올바른 표기입니다. 대소문자를 구분하며, 단어 전체와 일치해야 합니다. 비워 두면 인식기가 작성한 그대로 전사본을 내보냅니다.
입력이 필요합니다: 비디오 또는 오디오 파일
사용 모델
API이 파이프라인을 사용하는 레시피
이 파이프라인 관련 기사
전사 API
직접 작성한 코드에서 이 파이프라인을 호출하세요. 요청 한 번으로 실행이 시작되며, 모델은 별도의 엔드포인트가 아니라 입력 필드입니다.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--wait매개변수
-
source_asset_id필수 -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
생성된 SRT와 TXT에 적용되는 선택적 단어 단위 치환입니다, 인식기가 특정 단어(이름, 약어, 전문 용어)를 잘못 알아듣고 매번 똑같이 틀리게 표기할 때 유용합니다. 각 키는 전사된 단어이고, 값은 올바른 표기입니다. 대소문자를 구분하며, 단어 전체와 일치해야 합니다. 비워 두면 인식기가 작성한 그대로 전사본을 내보냅니다.
object기본값[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
boolean기본값false
입력 5개 모두 보기
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozh기본값auto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integer기본값0
AI 에이전트에서 사용하기
MCP 클라이언트를 pipe2에 연결하면 에이전트가 이 도구들을 사용할 수 있습니다. 이 파이프라인을 찾아 위와 동일한 스키마를 읽고 실행합니다.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}AI 영상 전사
모든 영상이나 오디오 파일을 업로드하면 단어 단위 타임스탬프가 포함된 정확한 전사본을 받을 수 있습니다. 화자 감지는 선택 사항입니다. SRT 자막이나 일반 텍스트로 출력되어 자막 제작, 편집, 재활용에 바로 사용할 수 있습니다.
이것으로 할 수 있는 일
- 영상 자막 제작: SRT를 생성한 뒤 소셜용으로 굽거나 오버레이하세요
- 롱폼 콘텐츠 재활용: 전사본을 어떤 LLM에든 넣어 요약, 클립 아이디어, 소셜 카피를 만드세요
- 인터뷰 + 팟캐스트 전사: 화자 감지가 적용된 다중 화자 녹음
- 접근성: 음성 콘텐츠를 읽고 검색할 수 있게 만드세요
- 번역 준비: 번역된 보이스오버의 원본으로 쓸 깔끔한 전사본
작동 방식
- 업로드: 영상 또는 오디오, 모든 일반 형식(MP4, MOV, MP3, WAV, M4A, FLAC)
- 언어 선택: 또는 자동 감지로 두세요
- 화자 감지 켜기: 각 세그먼트에 화자 라벨을 붙입니다
- 다운로드: 타임스탬프가 포함된 SRT + 일반 텍스트 전사본
출력 형식
- SRT: 밀리초 단위로 정확한 타임스탬프가 있는 자막 파일, 영상 편집기에 바로 넣을 수 있습니다
- 일반 텍스트: 편집, 요약, 번역에 쓸 깔끔하고 읽기 쉬운 전사본
자주 묻는 질문
어떤 파일 형식이 지원되나요?
전사는 얼마나 정확한가요?
화자 감지란 무엇인가요?
어떤 언어가 지원되나요?
시간이 얼마나 걸리나요?
더 많은 파이프라인 살펴보기
전체 보기 →텍스트 프롬프트, 이미지, 또는 참조 클립으로 AI 영상을 생성합니다. 시네마틱 샷, 제품 공개, 라이프스타일 광고, 동기화된 오디오와 자연스러운 모션과 함께.
텍스트나 참조 사진에서 AI 이미지를 생성하세요. 제품 사진, 캐릭터 아트, 읽기 쉬운 텍스트가 담긴 포스터, 사실적인 인물 사진, 몇 초 만에 고해상도로.
수십 가지 음성, 70개 이상의 언어, 그리고 톤·억양·속도를 위한 맞춤 스타일 지시로 텍스트를 자연스러운 음성으로 바꿉니다.
원하는 분위기, 장르, 길이에 맞는 오리지널 배경 음악을 생성하세요. 로열티 프리, 몇 초 만에 준비됩니다.