ElevenLabs Scribe v2
Transcripción precisa de voz a texto con etiquetas de hablante.
También conocido como: ElevenLabs Scribe, Scribe v2 (Batch), scribe_v2
Úsalo en TranscripciónQué puede hacer ElevenLabs Scribe v2
- Voz a texto
Precios en Pipe2
| Por ejecución | 3.6 créditos |
Pipelines que usan ElevenLabs Scribe v2
Acerca de ElevenLabs Scribe v2
Qué hace
ElevenLabs Scribe v2 toma audio como entrada y produce texto como salida. Le das un archivo de vídeo o audio y devuelve una transcripción con marcas de tiempo y etiquetas de hablante, de modo que cada línea de texto queda ligada a un punto de la grabación y a quien estuviera hablando. El pipeline Transcripción al que da servicio cubre más de 99 idiomas. No genera audio, imágenes ni vídeo. La única salida es la transcripción y sus metadatos asociados de tiempo y hablante.
Cuándo usarlo
- Ejecutar el pipeline Transcripción sobre una entrevista o un pódcast grabado donde necesitas saber quién dijo cada línea, no solo qué se dijo.
- Convertir un archivo de vídeo en texto que puedas buscar, citar o editar. Las marcas de tiempo te permiten mapear cualquier frase al momento del original.
- Transcribir grabaciones que no están en inglés o que mezclan idiomas, ya que el pipeline cubre más de 99 idiomas.
- Producir una transcripción cronometrada y con hablantes etiquetados que puedas pasar a lo que venga después en tu propio flujo de trabajo.
- Cualquier trabajo cuyo entregable sea texto derivado del habla, en lugar de algo que necesites volver a locutar o renderizar.
Qué conviene saber antes de ejecutarlo
El coste escala con la duración del audio. Las unidades mayoristas son por minuto, con tramos de 30 y 60 minutos, así que una grabación larga cuesta proporcionalmente más que una corta. Recortar hasta la sección que realmente necesitas es la palanca principal que tienes. No hay ajuste de calidad o resolución con el que negociar, ni imagen de referencia ni entrada adicional: subes un archivo multimedia y recibes una transcripción. Las etiquetas de hablante salen del propio modelo y no de un ajuste que configures, así que ahí no hay nada que afinar. Contrasta las etiquetas con tu grabación si la atribución de hablantes importa para el entregable. Todavía no hay ejemplos publicados para este modelo.
También conocido como
Puedes ver este modelo mencionado como ElevenLabs Scribe, Scribe v2 (Batch) o por el identificador scribe_v2. Todos se refieren al mismo modelo en Pipe2.