ElevenLabs · 텍스트
ElevenLabs Scribe v2
화자 구분이 포함된 정확한 음성-텍스트 변환.
다른 이름: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2
전사에서 실행ElevenLabs Scribe v2로 할 수 있는 것
- 음성 → 텍스트
Pipe2 가격
| 실행당 | 3.6 크레딧 |
ElevenLabs Scribe v2을 사용하는 파이프라인
ElevenLabs Scribe v2 소개
기능
ElevenLabs Scribe v2는 오디오를 받아 텍스트를 내놓습니다. 영상이나 오디오 파일을 주면 타임스탬프와 화자 라벨이 붙은 전사본을 돌려주므로, 각 줄의 텍스트가 녹음의 특정 지점과 그때 말한 사람에 연결됩니다. 이 모델이 구동하는 전사 파이프라인은 99개 이상 언어를 다룹니다. 오디오·이미지·영상은 생성하지 않습니다. 유일한 출력은 전사본과 그에 딸린 시간 및 화자 메타데이터입니다.
사용 시점
- 녹음된 인터뷰나 팟캐스트에 전사 파이프라인을 실행할 때. 무엇을 말했는지뿐 아니라 누가 어느 줄을 말했는지 알아야 하는 경우입니다.
- 영상 파일을 검색·인용·편집할 수 있는 텍스트로 바꿀 때. 타임스탬프 덕분에 어떤 문장이든 원본의 해당 순간으로 되짚을 수 있습니다.
- 영어가 아니거나 여러 언어가 섞인 녹음을 전사할 때. 파이프라인이 99개 이상 언어를 다룹니다.
- 시간 정보와 화자 라벨이 붙은 전사본을 만들어, 여러분의 작업 흐름에서 다음 단계로 넘길 때.
- 결과물이 다시 녹음하거나 다시 렌더링할 것이 아니라 음성에서 얻은 텍스트인 모든 작업.
실행 전 알아둘 점
비용은 오디오 길이에 따라 늘어납니다. 도매 단위는 분 단위이며 30분과 60분 구간이 있어, 긴 녹음은 짧은 녹음보다 비례해 비쌉니다. 실제로 필요한 구간까지 잘라내는 것이 쓸 수 있는 주된 수단입니다. 저울질할 품질이나 해상도 설정이 없고, 참조 이미지나 추가 입력도 없습니다. 미디어 파일 하나를 올리고 전사본 하나를 받습니다. 화자 라벨은 여러분이 설정하는 값이 아니라 모델 자체에서 나오므로 그 부분에는 조정할 것이 없습니다. 화자 구분이 결과물에 중요하다면 라벨을 녹음과 대조해 보세요. 이 모델에는 아직 공개된 예시가 없습니다.
다른 이름
이 모델은 ElevenLabs Scribe, Scribe v2 (Batch), 또는 식별자 scribe_v2로 언급될 수 있습니다. 모두 Pipe2의 동일한 모델을 가리킵니다.