Volver a los pipelines

Transcripción

Transcribe a texto cualquier archivo de vídeo o audio. Marcas de tiempo, detección de hablantes y compatibilidad con más de 99 idiomas.

ModeloElevenLabs Scribe v2
0.8

0 – 20

Sustituciones opcionales por límite de palabra aplicadas al SRT y TXT generados: útil cuando el reconocedor entiende mal una palabra concreta (un nombre, un acrónimo, un término técnico) y la escribe igual de mal cada vez. Cada clave es la palabra tal como se transcribió; el valor es la ortografía correcta. Distingue mayúsculas y minúsculas; las coincidencias deben corresponder a palabras completas. Déjalo vacío para entregar la transcripción tal como la escribió el reconocedor.

Aún falta: Archivo de vídeo o audio

Funciona con

API

Recetas que usan este pipeline

Artículos sobre este pipeline

API de Transcripción

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

5 entradas
1 obligatorio
from 0.8 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Obtener un token de API →

Parámetros

source_asset_id obligatorio

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Sustituciones opcionales por límite de palabra aplicadas al SRT y TXT generados: útil cuando el reconocedor entiende mal una palabra concreta (un nombre, un acrónimo, un término técnico) y la escribe igual de mal cada vez. Cada clave es la palabra tal como se transcribió; el valor es la ortografía correcta. Distingue mayúsculas y minúsculas; las coincidencias deben corresponder a palabras completas. Déjalo vacío para entregar la transcripción tal como la escribió el reconocedor.

object por defecto [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean por defecto false
Ver las 5 entradas
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh por defecto auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer por defecto 0

Úsalo desde un agente de IA

Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referencia completa de la API Configuración de MCP Referencia de la CLI

Transcripción de vídeo con IA

Sube cualquier archivo de vídeo o audio y recibe una transcripción precisa con marcas de tiempo por palabra. Detección de hablantes opcional. Salida en subtítulos SRT o texto plano: lista para subtitular, editar o reaprovechar.

Qué puedes hacer con esto

  • Subtitular vídeos: genera el SRT y luego incrústalo o superponlo para redes
  • Reaprovechar contenido de formato largo: alimenta las transcripciones a cualquier LLM para resúmenes, ideas de clips y copys para redes
  • Transcribir entrevistas y pódcasts: grabaciones con varios hablantes con diarización
  • Accesibilidad: haz que el contenido hablado sea legible y buscable
  • Preparación de traducción: transcripción limpia como fuente para locuciones traducidas

Cómo funciona

  1. Sube: vídeo o audio, en cualquier formato común (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Elige un idioma: o déjalo en detección automática
  3. Activa la detección de hablantes: etiqueta cada segmento con el hablante
  4. Descarga: SRT con marcas de tiempo + transcripción en texto plano

Formatos de salida

  • SRT: archivo de subtítulos con marcas de tiempo con precisión de milisegundos, se incorpora directamente a los editores de vídeo
  • Texto plano: transcripción limpia y legible para editar, resumir o traducir

Preguntas frecuentes

¿Qué formatos de archivo son compatibles?
Cualquier archivo de vídeo o audio: MP4, MOV, AVI, MP3, WAV, M4A, FLAC y más. El pipeline extrae automáticamente la pista de audio de los archivos de vídeo.
¿Qué precisión tiene la transcripción?
Tasas de error por palabra por debajo del 5 % para audio claro en los idiomas principales. La precisión depende de la calidad del audio, el ruido de fondo y la claridad del hablante.
¿Qué es la detección de hablantes?
Cuando está activada, la transcripción etiqueta cada segmento con el hablante que lo dijo ([speaker_0], [speaker_1], etc.). Usa la indicación de Número de hablantes para mejorar la precisión cuando sepas cuántas personas hay en la grabación.
¿Qué idiomas son compatibles?
99 idiomas con detección automática. Fija un idioma concreto para obtener la mejor precisión cuando conozcas el idioma de origen.
¿Cuánto tarda?
Normalmente entre el 10 % y el 30 % de la duración del audio. Una grabación de 10 minutos tarda de 1 a 3 minutos en transcribirse.

Explorar más pipelines

Ver todo →
Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.4
Generador de imágenes
Generador de audio
0.7-1.3
Generador de audio
Generador de música
2.5-45.1
Generador de música