파이프라인으로 돌아가기

전사

모든 영상이나 오디오 파일을 텍스트로 전사합니다. 타임스탬프, 화자 감지, 99개 이상 언어 지원.

모델ElevenLabs Scribe v2
0.8

0 – 20

생성된 SRT와 TXT에 적용되는 선택적 단어 단위 치환입니다, 인식기가 특정 단어(이름, 약어, 전문 용어)를 잘못 알아듣고 매번 똑같이 틀리게 표기할 때 유용합니다. 각 키는 전사된 단어이고, 값은 올바른 표기입니다. 대소문자를 구분하며, 단어 전체와 일치해야 합니다. 비워 두면 인식기가 작성한 그대로 전사본을 내보냅니다.

입력이 필요합니다: 비디오 또는 오디오 파일

사용 모델

API

이 파이프라인을 사용하는 레시피

이 파이프라인 관련 기사

전사 API

직접 작성한 코드에서 이 파이프라인을 호출하세요. 요청 한 번으로 실행이 시작되며, 모델은 별도의 엔드포인트가 아니라 입력 필드입니다.

5 개 입력
1 필수
from 0.8 크레딧
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

API 토큰 발급 →

매개변수

source_asset_id 필수

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

생성된 SRT와 TXT에 적용되는 선택적 단어 단위 치환입니다, 인식기가 특정 단어(이름, 약어, 전문 용어)를 잘못 알아듣고 매번 똑같이 틀리게 표기할 때 유용합니다. 각 키는 전사된 단어이고, 값은 올바른 표기입니다. 대소문자를 구분하며, 단어 전체와 일치해야 합니다. 비워 두면 인식기가 작성한 그대로 전사본을 내보냅니다.

object 기본값 [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean 기본값 false
입력 5개 모두 보기
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh 기본값 auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer 기본값 0

AI 에이전트에서 사용하기

MCP 클라이언트를 pipe2에 연결하면 에이전트가 이 도구들을 사용할 수 있습니다. 이 파이프라인을 찾아 위와 동일한 스키마를 읽고 실행합니다.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

전체 API 레퍼런스 MCP 설정 CLI 레퍼런스

AI 영상 전사

모든 영상이나 오디오 파일을 업로드하면 단어 단위 타임스탬프가 포함된 정확한 전사본을 받을 수 있습니다. 화자 감지는 선택 사항입니다. SRT 자막이나 일반 텍스트로 출력되어 자막 제작, 편집, 재활용에 바로 사용할 수 있습니다.

이것으로 할 수 있는 일

  • 영상 자막 제작: SRT를 생성한 뒤 소셜용으로 굽거나 오버레이하세요
  • 롱폼 콘텐츠 재활용: 전사본을 어떤 LLM에든 넣어 요약, 클립 아이디어, 소셜 카피를 만드세요
  • 인터뷰 + 팟캐스트 전사: 화자 감지가 적용된 다중 화자 녹음
  • 접근성: 음성 콘텐츠를 읽고 검색할 수 있게 만드세요
  • 번역 준비: 번역된 보이스오버의 원본으로 쓸 깔끔한 전사본

작동 방식

  1. 업로드: 영상 또는 오디오, 모든 일반 형식(MP4, MOV, MP3, WAV, M4A, FLAC)
  2. 언어 선택: 또는 자동 감지로 두세요
  3. 화자 감지 켜기: 각 세그먼트에 화자 라벨을 붙입니다
  4. 다운로드: 타임스탬프가 포함된 SRT + 일반 텍스트 전사본

출력 형식

  • SRT: 밀리초 단위로 정확한 타임스탬프가 있는 자막 파일, 영상 편집기에 바로 넣을 수 있습니다
  • 일반 텍스트: 편집, 요약, 번역에 쓸 깔끔하고 읽기 쉬운 전사본

자주 묻는 질문

어떤 파일 형식이 지원되나요?
모든 영상이나 오디오 파일, MP4, MOV, AVI, MP3, WAV, M4A, FLAC 등. 파이프라인이 영상 파일에서 오디오 트랙을 자동으로 추출합니다.
전사는 얼마나 정확한가요?
주요 언어의 명료한 오디오에서 단어 오류율 5% 미만입니다. 정확도는 오디오 품질, 배경 소음, 화자의 명료함에 따라 달라집니다.
화자 감지란 무엇인가요?
활성화하면 전사본이 각 세그먼트에 그것을 말한 화자를 라벨링합니다([speaker_0], [speaker_1] 등). 녹음에 몇 명이 있는지 알고 있다면 화자 수 힌트를 사용해 정확도를 높이세요.
어떤 언어가 지원되나요?
자동 감지와 함께 99개 언어를 지원합니다. 원본 언어를 알고 있다면 최고의 정확도를 위해 특정 언어를 설정하세요.
시간이 얼마나 걸리나요?
일반적으로 오디오 길이의 10~30%입니다. 10분 녹음은 전사에 1~3분이 걸립니다.

더 많은 파이프라인 살펴보기

전체 보기 →
영상 생성
from 9.5
영상 생성
이미지 생성
0.2-6.4
이미지 생성
음성 생성
0.7-1.3
음성 생성
음악 생성
2.5-45.1
음악 생성