← Artículos
Guía práctica

Cómo hacer shorts: convertir un vídeo largo en clips

Transcribe la grabación, elige los momentos que merecen un clip, corta en los límites de frase y reencuadra en vertical. La transcripción gobierna todo lo demás.

Por Pipe2.ai · Actualizado July 22, 2026

Para convertir un vídeo largo en shorts, transcribe primero y deja que la transcripción gobierne todo lo demás. La transcripción dice qué se dijo, así que puedes elegir los momentos que merecen un clip; lleva los límites de frase, así que los cortes caen entre frases y no a mitad de palabra; y alimenta el reencuadre y los subtítulos sin una segunda pasada. Grabar y luego cazar clips arrastrando la línea de tiempo es la versión lenta del mismo trabajo.

Nota de alcance, julio de 2026: Los pasos siguientes corresponden a pipelines que hoy funcionan en Pipe2.ai — Transcription, Highlights, Video Trim, Video Reframe y Captions. El comportamiento descrito se comprobó contra sus esquemas de entrada actuales, no contra material promocional.

Por qué la transcripción es todo el truco

Todos los pasos posteriores a la transcripción reciben la transcripción como entrada. No es una casualidad de la herramienta: es la razón por la que este proceso puede automatizarse.

  • Elegir momentos requiere saber qué se dijo, no qué forma tiene la onda.
  • Recortar requiere límites de frase, o los clips abren a mitad de palabra.
  • Reencuadrar mejora si se sabe dónde hay habla a lo largo de la línea de tiempo.
  • Subtitular requiere las palabras y sus tiempos, que ya tienes.

Así que transcribe la grabación completa una vez, guarda ese archivo y entrégalo a cada paso siguiente. Un pódcast de 60 minutos se transcribe una sola vez y eso sirve para todo el lote de clips. Si tu flujo vuelve a transcribir en cada clip, está repitiendo el paso más caro N veces sin ganar nada.

Paso 1 — Transcribe la grabación completa

Procesa el archivo entero, no los fragmentos que crees querer. No se pueden elegir buenos momentos de una grabación que no has leído.

Dos opciones merecen una decisión consciente:

  • Detección de hablante (diarize) — imprescindible en entrevistas y mesas redondas. Saber quién habló convierte “una buena frase” en “una buena frase del invitado”, y normalmente es esa la que merece el clip.
  • Correcciones (corrections) — un mapa de términos que el modelo tiende a oír mal. Nombres de producto, nombres propios y jerga son los sospechosos habituales. Corregirlos una vez en la transcripción sale más barato que corregirlos en cada archivo de subtítulos después.

Paso 2 — Elige los momentos, no los persigas

Lee la transcripción buscando momentos que se sostengan solos: una afirmación con su justificación, una historia con remate, una pregunta respondida con precisión. La prueba es si el pasaje tiene sentido para quien no ha visto el original.

Highlights hace eso contra la transcripción y devuelve un número concreto de propuestas, de modo que pides la cantidad que realmente piensas publicar — diez clips de un seminario, tres de una entrevista corta — en vez de cribar una lista infinita. La entrada style orienta qué busca, y eso importa porque los mejores momentos de un seminario comercial y de un pódcast de humor no tienen la misma forma.

Trata la salida como una preselección, no como un veredicto. El modelo encuentra pasajes que se leen bien; cuáles encajan en el canal lo decides tú.

Paso 3 — Corta en los límites de frase

Aquí es donde el recorte automático se delata. Un clip cortado sobre una marca de tiempo cruda empieza a mitad de palabra y termina antes de que la idea aterrice. Parece extraído en vez de editado, y ningún pulido posterior lo recupera.

Video Trim recibe un inicio, un final y la transcripción, y ajusta cada corte al límite de frase más cercano. Tú das aproximadamente el punto; la herramienta encuentra el borde limpio. El efecto práctico es que puedes elegir momentos a ojo — leyendo, rápido — y aun así obtener clips que abren y cierran bien.

Paso 4 — Reencuadra a vertical

Una grabación 16:9 recortada por el centro deja a la persona medio fuera de plano cada vez que se inclina. Video Reframe analiza fotogramas clave, localiza las caras en cada uno y elige un recorte que sigue al sujeto a lo largo del plano.

Conviene ser preciso sobre qué hace y qué no: encuentra y sigue caras, y toma una decisión editorial sobre dónde colocar el encuadre. No está decidiendo quién está hablando en ese instante. Donde un plano no tiene sujeto claro — una diapositiva, una grabación de pantalla, un recurso a pantalla completa — aplica letterbox en lugar de inventarse un recorte, que es lo correcto para contenido que ya llena el cuadro.

Fija la relación de aspecto de destino de forma explícita, según dónde vaya a publicarse.

Paso 5 — Quema los subtítulos

La mayor parte del vídeo social se ve en silencio. Un clip sin subtítulos es uno que la mayoría pasará de largo antes de saber de qué va.

Como la transcripción ya existe, Captions es casi gratis a estas alturas: entrégale el clip recortado y la transcripción, elige un preset y recibe un MP4 terminado con el texto quemado — sin depender de que la plataforma renderice subtítulos desde un archivo subido aparte, algo que varía entre plataformas y a menudo se ignora.

Qué separa un buen clip de uno extraído a la fuerza

  • Una idea por clip. Si necesitas dos frases de contexto para explicarlo, ese contexto pertenece al clip o el momento está mal elegido.
  • Abre con la frase más fuerte, no con el carraspeo previo. La transcripción deja claro dónde está.
  • Mantén la cara en cuadro — un clip de busto parlante donde el sujeto se va al borde parece descuidado.
  • No cortes por cuota. Diez clips mediocres de un seminario rinden menos que tres buenos, y publicarlos cuesta lo mismo.
  • Corta en pensamientos completos y deja que la duración sea la que haga falta.

Cómo encaja con lo demás

Cuando la cadena funciona, la misma transcripción sostiene cosas que de otro modo serían proyectos aparte: marcadores de capítulo para el vídeo completo, un resumen escrito, subtítulos del original. Vale la pena saberlo al decidir si transcribir: el coste se paga una vez y se reparte entre todo lo que viene después.

Si además de recortar produces el vídeo original, Cómo hacer vídeos con IA cubre la generación, y Cómo poner subtítulos a un vídeo entra a fondo en su estilo.

Pruébalo

Empieza con una grabación que ya tengas. Transcríbela, pide tres propuestas a Highlights y recorta solo esas — el objetivo de la primera pasada es ver si los momentos que encuentra coinciden con los que habrías elegido tú. Cuando coincidan, la misma cadena corre sobre una hora de material sin cambiar nada salvo la cantidad.

Preguntas frecuentes

¿Cómo se convierte un vídeo largo en clips cortos?

Transcribe primero y usa la transcripción para elegir los momentos, cortarlos y reencuadrarlos. Trabajar desde la transcripción es lo que hace automático el resto: el mismo archivo dice qué se dijo, dónde empieza y acaba cada frase, y dónde un corte no parte una palabra por la mitad.

¿Cuánto debe durar un clip corto?

Lo suficiente para contener una idea completa y ni un segundo más. En la práctica suelen ser entre 20 y 60 segundos. La restricción que importa no es el límite de la plataforma, sino si el clip tiene sentido para alguien que no ha visto el vídeo original: por eso se corta alrededor de un pensamiento completo y no a una duración fija.

¿Por qué mis clips empiezan o acaban a mitad de palabra?

Porque el corte se hizo sobre una marca de tiempo y no sobre el habla. Al recortar contra una transcripción, cada corte se ajusta al límite de frase, así que el clip abre al principio de una frase y cierra al final de otra. Es la diferencia más visible entre un clip que parece editado y uno que parece extraído a la fuerza.

¿Hay que volver a transcribir para cada clip?

No, y no deberías. Transcribe la grabación completa una vez y reutiliza esa transcripción para elegir momentos, recortar, reencuadrar y subtitular. Todos los pasos posteriores aceptan la transcripción como entrada, así que una sola pasada sobre una grabación de 60 minutos sirve para todo el lote.

¿Cómo paso un vídeo horizontal a vertical sin cortar a la gente?

El reencuadre automático analiza fotogramas clave, localiza las caras en cada uno y elige un recorte que mantiene al sujeto en cuadro según cambia el plano, en lugar de recortar por un centro fijo. Donde no hay un sujeto claro — una diapositiva, una grabación de pantalla, un recurso que ocupa todo el cuadro — aplica letterbox, que es el tratamiento correcto para contenido que ya llena la pantalla.

¿Los clips cortos necesitan subtítulos?

Sí. La mayor parte del vídeo social se ve sin sonido, así que un clip sin subtítulos es un clip que casi todo el mundo va a pasar de largo. Como la transcripción ya existe desde el primer paso, los subtítulos no cuestan nada adicional y se queman en el archivo exportado, sin depender de cómo cada plataforma renderice un archivo de subtítulos subido aparte.

Prueba estos pipelines

Artículos relacionados