Generador de subtítulos IA: transcribir vídeo a TXT y SRT
Convierte un vídeo en una transcripción TXT editable y un SRT con tiempos, detección de idioma, etiquetas de hablante y correcciones reutilizables.
Guía práctica Por Pipe2.ai Actualizado September 2, 2026
En esta página
Prueba estos pipelines
Un generador de subtítulos IA convierte la voz de un vídeo en texto editable y temporizado. Con Transcription de Pipe2.ai, subes un vídeo o audio y recibes tanto un TXT como un SRT con marcas de tiempo; además, puedes detectar el idioma, etiquetar a los hablantes y corregir palabras que se reconozcan mal de forma repetida.
Transcribe un vídeo a texto en cinco pasos
- Elige un vídeo con una pista de audio clara. Transcription necesita voz. Un vídeo silencioso no puede producir una transcripción.
- Sube el archivo. Abre Transcription y adjunta el vídeo o audio que quieras convertir.
- Configura el idioma y los hablantes. Deja Idioma en Auto si no estás seguro. Para entrevistas o mesas redondas, activa Detección de hablantes y, si quieres, indica cuántos esperas.
- Añade correcciones recurrentes. Si un nombre, una sigla o un producto suele reconocerse siempre de la misma forma incorrecta, asigna esa forma a la escritura correcta. Las correcciones distinguen mayúsculas y minúsculas y coinciden con palabras completas.
- Ejecuta y revisa los dos archivos. Usa TXT para leer y editar. Usa SRT cuando importe la sincronización o cuando la transcripción vaya a convertirse en subtítulos.
La pipeline actual utiliza ElevenLabs Scribe v2. Su formulario público admite un único recurso de vídeo o audio subido, Auto y diez idiomas seleccionables, detección opcional de hablantes, una pista opcional de 0 a 20 hablantes y correcciones de palabras. Devuelve recursos SRT y TXT separados.
Elige TXT o SRT según el trabajo
Las dos salidas contienen lo que se dijo, pero lo organizan de forma distinta.
| Salida | Qué contiene | Para qué sirve mejor |
|---|---|---|
| TXT | Texto continuo y legible sin bloques temporizados | Notas, citas, búsquedas, resúmenes, borradores y revisión editorial |
| SRT | Bloques numerados con tiempos de inicio y fin | Subtítulos, recortes guiados por frases y flujos que deben mantenerse alineados con el vídeo |
Conserva ambos. TXT se lee con rapidez; SRT mantiene los tiempos necesarios para producir vídeo. Si el siguiente paso es crear subtítulos visibles, revisa el SRT y sigue la guía para añadir subtítulos a un vídeo.
Consigue una conversión de voz a texto más limpia
La calidad empieza en la grabación. Acerca el micrófono, reduce la música de fondo y el eco, y evita que varias personas hablen a la vez. Aumentar el volumen después no recupera palabras que nunca se grabaron con claridad.
Selecciona el idioma cuando lo conozcas; en caso contrario, Auto es un buen punto de partida. La detección de hablantes ayuda cuando importa saber quién dijo cada frase, pero las etiquetas necesitan revisión humana. Voces parecidas, interrupciones y fuentes de grabación distintas pueden confundir al modelo.
Reserva Correcciones para errores constantes y previsibles, no para reescribir el contenido. Si una marca siempre aparece como una palabra común parecida, una sustitución de palabra completa puede arreglarla en ambas salidas. No reconstruye frases poco claras ni decide lo que la persona quiso decir.
Revisa la transcripción antes de publicarla
Una transcripción de IA es un documento de trabajo, no una garantía literal. Léela mientras escuchas el original y presta especial atención a:
- Nombres, organizaciones, términos técnicos y siglas
- Números, precios, fechas y medidas
- Cambios de hablante en entrevistas y conversaciones de grupo
- Nombres propios que un corrector ortográfico podría cambiar por error
- Fragmentos con ruido, música, acentos o voces superpuestas
- Bloques SRT que empiezan pronto, terminan tarde o contienen demasiado texto
Si vas a citar a alguien, contrasta la cita con la grabación. Si vas a crear subtítulos, corrige las palabras y los tiempos antes de integrarlos en el vídeo final.
Convierte la transcripción en subtítulos o clips
Transcription no incrusta texto en la imagen. Crea archivos reutilizables para que puedas revisarlos antes de producir otro recurso.
Para subtítulos visibles, adjunta el SRT revisado y el vídeo original a Captions. Para editar contenido corto, una sola transcripción puede alimentar todo el proceso: localizar momentos útiles, cortar en límites de frase y subtitular los clips. La guía para convertir un vídeo largo en shorts explica la secuencia, y el artículo sobre recortar por frases detalla cómo conseguir cortes limpios.
Separar los pasos resulta útil. Puedes corregir un SRT, reutilizarlo con varios estilos de subtítulos y conservar TXT para descripciones, notas o un montaje sobre papel sin volver a transcribir la fuente.
Lo que el generador no hace
Un transcriptor convierte voz en texto; no resume automáticamente la grabación, elige los mejores momentos, traduce el contenido ni crea un vídeo ya subtitulado. Son tareas editoriales o de producción separadas.
También necesita una pista de audio. El texto que aparece en pantalla sin ser pronunciado no forma parte de la transcripción. Si hay diapositivas, rótulos o texto de interfaz importantes, revísalos por separado y añádelos a tus notas.
Empieza con una grabación representativa, no con todo tu archivo. Comprueba cómo trata tus voces, vocabulario y condiciones de audio, añade las correcciones recurrentes y aplica la misma lista de revisión al resto del lote.
Preguntas frecuentes
¿Cómo genero una transcripción a partir de un vídeo?
Sube un vídeo con pista de audio a la pipeline Transcription, deja el idioma en Auto o elige el que se habla, activa la detección de hablantes si la necesitas y ejecuta el proceso. Recibirás una transcripción TXT editable y un archivo SRT con marcas de tiempo.
¿Qué diferencia hay entre la salida TXT y la SRT?
TXT contiene el texto seguido sin bloques temporizados, por lo que resulta cómodo para editar, citar, tomar notas y buscar. SRT divide el diálogo en bloques con tiempos de inicio y fin que los reproductores y las herramientas de subtítulos pueden sincronizar con el vídeo.
¿Puede un generador de subtítulos con IA distinguir a los hablantes?
Sí. Activa Detección de hablantes para entrevistas, podcasts y mesas redondas. Si sabes cuántas personas hablan, indica un valor de 1 a 20; si no, deja 0 para la detección automática. Revisa siempre las etiquetas cuando la atribución sea importante.
¿La transcripción añade subtítulos visibles al vídeo?
No. Transcription crea archivos SRT y TXT separados, pero no dibuja las palabras en el vídeo. Para obtener subtítulos visibles, revisa el SRT y úsalo junto con el vídeo original en la pipeline Captions.
¿Cómo debo revisar una transcripción de vídeo generada por IA?
Escucha la grabación mientras lees y comprueba nombres, siglas, números, cambios de hablante y fragmentos con ruido o voces superpuestas. Usa correcciones de palabras para errores repetidos y revisa los tiempos del SRT antes de publicar subtítulos o citas.