Reencuadre de vídeo
Recorta automáticamente vídeo horizontal a vertical con encuadre por IA del hablante activo. Listo para TikTok en una sola llamada: encuadra al hablante en cada plano y corta limpiamente en cada límite.
Aún falta: Vídeo, Relación de aspecto objetivo
Ideal para
- •Reencuadrar metraje 16:9 de pódcast / entrevista / documental a 9:16 para TikTok/Reels/Shorts
- •Seguir a un sujeto concreto (presentador, producto, pantalla) cuando el contenido tiene varios puntos focales
- •Producir cuadrados 1:1 de Instagram a partir de másteres horizontales con seguimiento del hablante activo
- •Cerrar el ciclo de formato largo a cortos cuando se encadena con video-trim y captions
Cuándo usarlo
- •Después de video-trim: el recorte elige el momento, el reencuadre elige el encuadre
- •Antes de captions: reencuadra primero para que el texto de los subtítulos encaje en el lienzo 9:16
- •De forma independiente para usuarios con clips horizontales ya editados que necesitan versiones verticales
Consejos
- ✓Aporta una transcripción con diarización para entrevistas y paneles: guía el encuadre del hablante activo por plano de forma mucho más fiable que la visión sola
- ✓Los planos sin un único sujeto claro (pantallas compartidas, planos generales amplios) se muestran con barras por diseño: es la opción segura, no un fallo
- ✓No hay controles de paneo / zoom / suavizado que ajustar: el director de cámara es de fijar-y-cortar determinista
Recetas que usan este pipeline
Artículos sobre este pipeline
API de Reencuadre de vídeo
Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "video-reframe",
input: {
video_url: "https://example.com/interview.mp4",
target_aspect_ratio: "9:16",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="video-reframe",
input={
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline video-reframe \
--input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
--waitParámetros
-
target_aspect_ratioobligatorio -
Aspect ratio to reframe to — vertical for shorts, square for feeds.
9:161:14:516:9por defecto9:16 -
video_urlobligatorio -
Public URL of the video to reframe.
string -
transcript_url -
Public URL of a transcript. Used to keep the speaker in frame.
string
Úsalo desde un agente de IA
Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Referencia completa de la API Configuración de MCP Referencia de la CLI
Reencuadre de vídeo: de horizontal a vertical con seguimiento del hablante
La mayoría del vídeo viral vive en 9:16 (TikTok, Reels, Shorts), pero la mayoría del metraje se graba en 16:9. Reencuadre de vídeo salva esa distancia: encuentra al hablante activo en cada plano y lo encuadra en un recorte vertical limpio, mantenido perfectamente fijo durante el plano y cortando solo donde corta la fuente. Sin edición manual, sin controles de cámara que ajustar.
Cómo funciona
- Detecta los límites de plano: el detector de cortes de escena de FFmpeg divide la fuente para que cada decisión de encuadre se limite a un plano continuo.
- Localiza rostros e identifica el reparto: una pasada de visión más un detector de rostros de CV encuentran y agrupan los rostros en los fotogramas clave de cada plano, dando a cada persona una identidad estable.
- Resuelve el sujeto focal por plano: primero el audio: una transcripción con diarización nombra al hablante activo; de lo contrario, una pasada de visión de una etiqueta por plano y los rostros de CV deciden. El hablante se lleva el encuadre; un plano ambiguo se muestra con barras (mostrando a todos) en lugar de adivinar.
- Planifica la cámara de forma determinista: un planificador puro convierte el foco por plano en un plan de fijar-y-cortar: un recorte estático por plano, cortes secos en los límites, planos de menos de un segundo fusionados con los vecinos. Sin paneos, sin deriva, sin artefactos de movimiento: las mismas entradas siempre producen el mismo plan.
- Renderiza: FFmpeg aplica el recorte estático por plano (o unas barras centradas para los planos de fotograma completo), manteniendo el audio intacto.
Aporta una transcripción para el seguimiento de varios hablantes
Para entrevistas y paneles, pasa una transcripción con diarización (SRT) que cubra el mismo rango temporal que el vídeo. Sus turnos de hablante guían la elección del foco, de modo que un plano de dos personas sigue a quien realmente está hablando, no solo al rostro más grande en pantalla. Sin transcripción, el planificador sigue funcionando, recurriendo a la etiqueta de visión por plano y a las posiciones de los rostros de CV.
Preguntas frecuentes
¿Qué relaciones de aspecto son compatibles?
¿Y si mi fuente ya es vertical?
¿Cómo elige a quién seguir?
¿Alguna vez hace paneos o zoom?
¿Cuánto cuesta?
¿Puedo encadenarlo con Recorte de vídeo?
Explorar más pipelines
Ver todo →Genera vídeos con IA a partir de una indicación de texto, una imagen o un clip de referencia. Planos cinematográficos, presentaciones de producto, anuncios de estilo de vida, con audio sincronizado y movimiento natural.
Genera imágenes con IA a partir de texto o fotos de referencia. Fotos de producto, arte de personajes, pósters con texto legible, retratos fotorrealistas: alta resolución en segundos.
Convierte texto en voz natural con decenas de voces, más de 70 idiomas e indicaciones de estilo personalizadas para el tono, el acento y el ritmo.
Genera música de fondo original que encaje con el ambiente, el género y la duración que describas. Libre de regalías, lista en segundos.