ElevenLabs · 텍스트

ElevenLabs Scribe v2

화자 구분이 포함된 정확한 음성-텍스트 변환.

다른 이름: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2

전사에서 실행

ElevenLabs Scribe v2로 할 수 있는 것

  • 음성 → 텍스트

Pipe2 가격

전사 →
실행당 3.6 크레딧

크레딧 가격 보기 →

ElevenLabs Scribe v2을 사용하는 파이프라인

전사
from 0.8
전사

ElevenLabs Scribe v2 소개

기능

ElevenLabs Scribe v2는 오디오를 받아 텍스트를 내놓습니다. 영상이나 오디오 파일을 주면 타임스탬프와 화자 라벨이 붙은 전사본을 돌려주므로, 각 줄의 텍스트가 녹음의 특정 지점과 그때 말한 사람에 연결됩니다. 이 모델이 구동하는 전사 파이프라인은 99개 이상 언어를 다룹니다. 오디오·이미지·영상은 생성하지 않습니다. 유일한 출력은 전사본과 그에 딸린 시간 및 화자 메타데이터입니다.

사용 시점

  • 녹음된 인터뷰나 팟캐스트에 전사 파이프라인을 실행할 때. 무엇을 말했는지뿐 아니라 누가 어느 줄을 말했는지 알아야 하는 경우입니다.
  • 영상 파일을 검색·인용·편집할 수 있는 텍스트로 바꿀 때. 타임스탬프 덕분에 어떤 문장이든 원본의 해당 순간으로 되짚을 수 있습니다.
  • 영어가 아니거나 여러 언어가 섞인 녹음을 전사할 때. 파이프라인이 99개 이상 언어를 다룹니다.
  • 시간 정보와 화자 라벨이 붙은 전사본을 만들어, 여러분의 작업 흐름에서 다음 단계로 넘길 때.
  • 결과물이 다시 녹음하거나 다시 렌더링할 것이 아니라 음성에서 얻은 텍스트인 모든 작업.

실행 전 알아둘 점

비용은 오디오 길이에 따라 늘어납니다. 도매 단위는 분 단위이며 30분과 60분 구간이 있어, 긴 녹음은 짧은 녹음보다 비례해 비쌉니다. 실제로 필요한 구간까지 잘라내는 것이 쓸 수 있는 주된 수단입니다. 저울질할 품질이나 해상도 설정이 없고, 참조 이미지나 추가 입력도 없습니다. 미디어 파일 하나를 올리고 전사본 하나를 받습니다. 화자 라벨은 여러분이 설정하는 값이 아니라 모델 자체에서 나오므로 그 부분에는 조정할 것이 없습니다. 화자 구분이 결과물에 중요하다면 라벨을 녹음과 대조해 보세요. 이 모델에는 아직 공개된 예시가 없습니다.

다른 이름

이 모델은 ElevenLabs Scribe, Scribe v2 (Batch), 또는 식별자 scribe_v2로 언급될 수 있습니다. 모두 Pipe2의 동일한 모델을 가리킵니다.