영상·오디오 전사

0.8 크레딧부터

영상이나 오디오를 텍스트로 변환하세요. 타임스탬프, 화자 구분, 99개 이상의 언어를 지원합니다.

0 – 20

선택 사항: 생성되는 SRT와 TXT에서 특정 단어를 교체합니다. 이름, 약어, 전문 용어처럼 항상 같은 방식으로 잘못 인식되는 단어를 바로잡을 때 유용합니다. 각 키에는 잘못 전사된 단어를, 값에는 올바른 표기를 입력하세요. 대소문자를 구분하고 단어 전체가 일치할 때만 적용됩니다. 비워 두면 인식 결과를 그대로 출력합니다.

입력이 필요합니다: 영상 또는 오디오 파일

사용 모델

1 모델

영상·오디오 전사 API

직접 작성한 코드에서 이 파이프라인을 호출하세요. 요청 한 번으로 실행이 시작되며, 모델은 별도의 엔드포인트가 아니라 입력 필드입니다.

API 토큰 발급
개 입력
5
필수
1
요금
from 0.8 크레딧
언어
언어
bun add @pipe2-ai/sdk
파이프라인 실행
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
파이프라인 실행
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
파이프라인 실행
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
파이프라인 실행
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

전체 API 레퍼런스 CLI 레퍼런스

이 파이프라인을 사용하는 레시피

모든 레시피 보기

자주 묻는 질문

어떤 파일 형식을 지원하나요?
MP4, MOV, AVI, MP3, WAV, M4A, FLAC 등 일반적인 영상과 오디오 파일을 지원합니다. 영상 파일에서는 오디오 트랙을 자동으로 추출합니다.
전사 정확도는 어느 정도인가요?
주요 언어의 깨끗한 오디오에서는 단어 오류율이 5% 미만입니다. 실제 정확도는 녹음 품질, 배경 소음, 발음의 명확성에 따라 달라집니다.
화자 구분이란 무엇인가요?
켜면 각 구간에 [speaker_0], [speaker_1]처럼 발화한 사람을 표시합니다. 녹음에 몇 명이 참여했는지 안다면 화자 수를 지정해 정확도를 높일 수 있습니다.
어떤 언어를 지원하나요?
99개 언어를 지원하며 자동 감지도 제공합니다. 원본 언어를 알고 있다면 직접 지정하는 편이 가장 정확합니다.
처리 시간은 얼마나 걸리나요?
보통 오디오 길이의 10~30% 정도가 걸립니다. 예를 들어 10분 녹음은 약 1~3분 안에 전사됩니다.

AI 영상·오디오 전사

영상이나 오디오 파일을 업로드하면 단어 단위 타임스탬프가 포함된 정확한 전사본을 생성합니다. 필요하면 화자도 구분할 수 있으며, SRT 자막과 일반 텍스트로 받아 자막 제작, 편집, 콘텐츠 재활용에 바로 쓸 수 있습니다.

이것으로 할 수 있는 일

  • 영상 자막 제작: SRT를 만든 뒤 소셜 영상에 자막으로 삽입
  • 긴 콘텐츠 재활용: 전사본을 LLM에 입력해 요약, 클립 아이디어, 소셜 문구 제작
  • 인터뷰와 팟캐스트 전사: 여러 사람이 말하는 녹음에서 화자를 구분
  • 접근성 향상: 음성 콘텐츠를 읽고 검색할 수 있는 형태로 변환
  • 번역 준비: 번역과 다국어 보이스오버에 사용할 깨끗한 원문 확보

작동 방식

  1. 파일 업로드: MP4, MOV, MP3, WAV, M4A, FLAC 등 일반적인 영상·오디오 형식을 지원합니다
  2. 언어 선택: 알고 있다면 직접 고르고, 아니면 자동 감지를 사용합니다
  3. 화자 구분 설정: 필요하면 각 구간에 화자 라벨을 붙입니다
  4. 결과 다운로드: 타임스탬프가 포함된 SRT와 일반 텍스트를 받습니다

출력 형식

  • SRT: 밀리초 단위 타임스탬프가 포함되어 영상 편집기에 바로 넣을 수 있는 자막 파일
  • 일반 텍스트: 편집, 요약, 번역에 쓰기 좋은 읽기 쉬운 전사본

더 많은 파이프라인 살펴보기

AI 영상 생성
from 9.5
AI 영상 생성
AI 이미지 생성
0.2-6.4
AI 이미지 생성
AI 음성 생성
0.002-40.0
AI 음성 생성
AI 음악 생성
2.5-22.6
AI 음악 생성