Transcripción
Transcribe a texto cualquier archivo de vídeo o audio. Marcas de tiempo, detección de hablantes y compatibilidad con más de 99 idiomas.
0 – 20
Sustituciones opcionales por límite de palabra aplicadas al SRT y TXT generados: útil cuando el reconocedor entiende mal una palabra concreta (un nombre, un acrónimo, un término técnico) y la escribe igual de mal cada vez. Cada clave es la palabra tal como se transcribió; el valor es la ortografía correcta. Distingue mayúsculas y minúsculas; las coincidencias deben corresponder a palabras completas. Déjalo vacío para entregar la transcripción tal como la escribió el reconocedor.
Aún falta: Archivo de vídeo o audio
Funciona con
APIRecetas que usan este pipeline
Artículos sobre este pipeline
API de Transcripción
Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitParámetros
-
source_asset_idobligatorio -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Sustituciones opcionales por límite de palabra aplicadas al SRT y TXT generados: útil cuando el reconocedor entiende mal una palabra concreta (un nombre, un acrónimo, un término técnico) y la escribe igual de mal cada vez. Cada clave es la palabra tal como se transcribió; el valor es la ortografía correcta. Distingue mayúsculas y minúsculas; las coincidencias deben corresponder a palabras completas. Déjalo vacío para entregar la transcripción tal como la escribió el reconocedor.
objectpor defecto[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanpor defectofalse
Ver las 5 entradas
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhpor defectoauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerpor defecto0
Úsalo desde un agente de IA
Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Referencia completa de la API Configuración de MCP Referencia de la CLI
Transcripción de vídeo con IA
Sube cualquier archivo de vídeo o audio y recibe una transcripción precisa con marcas de tiempo por palabra. Detección de hablantes opcional. Salida en subtítulos SRT o texto plano: lista para subtitular, editar o reaprovechar.
Qué puedes hacer con esto
- Subtitular vídeos: genera el SRT y luego incrústalo o superponlo para redes
- Reaprovechar contenido de formato largo: alimenta las transcripciones a cualquier LLM para resúmenes, ideas de clips y copys para redes
- Transcribir entrevistas y pódcasts: grabaciones con varios hablantes con diarización
- Accesibilidad: haz que el contenido hablado sea legible y buscable
- Preparación de traducción: transcripción limpia como fuente para locuciones traducidas
Cómo funciona
- Sube: vídeo o audio, en cualquier formato común (MP4, MOV, MP3, WAV, M4A, FLAC)
- Elige un idioma: o déjalo en detección automática
- Activa la detección de hablantes: etiqueta cada segmento con el hablante
- Descarga: SRT con marcas de tiempo + transcripción en texto plano
Formatos de salida
- SRT: archivo de subtítulos con marcas de tiempo con precisión de milisegundos, se incorpora directamente a los editores de vídeo
- Texto plano: transcripción limpia y legible para editar, resumir o traducir
Preguntas frecuentes
¿Qué formatos de archivo son compatibles?
¿Qué precisión tiene la transcripción?
¿Qué es la detección de hablantes?
¿Qué idiomas son compatibles?
¿Cuánto tarda?
Explorar más pipelines
Ver todo →Genera vídeos con IA a partir de una indicación de texto, una imagen o un clip de referencia. Planos cinematográficos, presentaciones de producto, anuncios de estilo de vida, con audio sincronizado y movimiento natural.
Genera imágenes con IA a partir de texto o fotos de referencia. Fotos de producto, arte de personajes, pósters con texto legible, retratos fotorrealistas: alta resolución en segundos.
Convierte texto en voz natural con decenas de voces, más de 70 idiomas e indicaciones de estilo personalizadas para el tono, el acento y el ritmo.
Genera música de fondo original que encaje con el ambiente, el género y la duración que describas. Libre de regalías, lista en segundos.