Transcripción
Convierte cualquier archivo de vídeo o audio en texto, con marcas de tiempo, detección de hablantes y compatibilidad con más de 99 idiomas.
0 – 20
Sustituciones opcionales de palabras completas que se aplican a los archivos SRT y TXT. Resultan útiles cuando el reconocimiento transcribe siempre de forma incorrecta un nombre, un acrónimo o un término técnico. Cada clave debe contener la palabra tal como aparece en la transcripción y su valor, la grafía correcta. Se distinguen mayúsculas y minúsculas y solo se sustituyen palabras completas. Deja el campo vacío si quieres conservar el texto tal como se reconoció.
Funciona con
-
ElevenLabs
API de Transcripción
Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.
Obtener un token de API- entradas
- 5
- obligatorio
- 1
- Precios
- from 0.8 créditos
| Entrada | Tipo | por defecto | Descripción |
|---|---|---|---|
source_asset_id | string | por defecto— | Audio o vídeo que quieres transcribir. Usa el ID del recurso que devuelve la subida; consulta /docs/api/ para ver el proceso. |
corrections | object | por defecto{} | Sustituciones opcionales de palabras completas que se aplican a los archivos SRT y TXT. Resultan útiles cuando el reconocimiento transcribe siempre de forma incorrecta un nombre, un acrónimo o un término técnico. Cada clave debe contener la palabra tal como aparece en la transcripción y su valor, la grafía correcta. Se distinguen mayúsculas y minúsculas y solo se sustituyen palabras completas. Deja el campo vacío si quieres conservar el texto tal como se reconoció. |
diarize | boolean | por defectofalse | Identifica quién habla. Actívalo para entrevistas y grabaciones con varias personas. |
language_code | enum | por defectoauto | Idioma hablado. Déjalo vacío para detectarlo a partir del audio.auto · en · es +8autoenesptfrdehiarjakozh |
num_speakers | integer | por defecto0 | Número de hablantes esperado. Déjalo vacío para detectarlo automáticamente. |
Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Recetas que usan este pipeline
Ver todas las recetas-
Vídeo largo → varios clips subtitulados con un solo comando
Divide cualquier vídeo largo en N clips más cortos y subtitulados. Transcribe una sola vez, deja que la IA seleccione los mejores momentos y recorta y subtitula cada clip en paralelo. También puedes adaptarlo al formato vertical (9:16) para TikTok, Reels o Shorts, cuadrado (1:1) para Instagram o retrato (4:5); la posición de los subtítulos se ajusta automáticamente.
-
Pregunta del público → respuesta visual animada
Convierte tu respuesta aprobada y tu secuencia visual en un vídeo explicativo vertical con narración, vídeos de archivo, diagramas temporizados y subtítulos sincronizados.
Preguntas frecuentes
¿Qué formatos de archivo son compatibles?
¿Qué precisión tiene la transcripción?
¿Qué es la detección de hablantes?
¿Qué idiomas son compatibles?
¿Cuánto tarda?
Transcripción de vídeo con IA
Sube cualquier archivo de vídeo o audio y recibe una transcripción precisa con marcas de tiempo por palabra y detección opcional de hablantes. Descarga el resultado como subtítulos SRT o texto plano, listo para editar, reutilizar o añadir al vídeo.
Qué puedes hacer con esto
- Subtitular vídeos: genera el SRT y después intégralo en la imagen o súbelo como pista independiente
- Reutilizar contenido largo: emplea la transcripción en cualquier LLM para crear resúmenes, ideas de clips y textos para redes
- Transcribir entrevistas y pódcasts: distingue a los participantes en grabaciones con varias voces
- Mejorar la accesibilidad: convierte el contenido hablado en texto legible y fácil de buscar
- Preparar traducciones: utiliza una transcripción limpia como base para locuciones en otros idiomas
Cómo funciona
- Sube el archivo: vídeo o audio en cualquier formato habitual (MP4, MOV, MP3, WAV, M4A o FLAC)
- Elige el idioma: o deja que se detecte automáticamente
- Activa la detección de hablantes: identifica quién interviene en cada segmento
- Descarga el resultado: un SRT con marcas de tiempo y una transcripción en texto plano
Formatos de salida
- SRT: archivo de subtítulos con marcas de tiempo precisas al milisegundo, listo para usar en editores de vídeo
- Texto plano: transcripción limpia y legible para editar, resumir o traducir