Volver a los pipelines

Reencuadre de vídeo

Recorta automáticamente vídeo horizontal a vertical con encuadre por IA del hablante activo. Listo para TikTok en una sola llamada: encuadra al hablante en cada plano y corta limpiamente en cada límite.

2

Aún falta: Vídeo, Relación de aspecto objetivo

Ideal para

  • Reencuadrar metraje 16:9 de pódcast / entrevista / documental a 9:16 para TikTok/Reels/Shorts
  • Seguir a un sujeto concreto (presentador, producto, pantalla) cuando el contenido tiene varios puntos focales
  • Producir cuadrados 1:1 de Instagram a partir de másteres horizontales con seguimiento del hablante activo
  • Cerrar el ciclo de formato largo a cortos cuando se encadena con video-trim y captions

Cuándo usarlo

  • Después de video-trim: el recorte elige el momento, el reencuadre elige el encuadre
  • Antes de captions: reencuadra primero para que el texto de los subtítulos encaje en el lienzo 9:16
  • De forma independiente para usuarios con clips horizontales ya editados que necesitan versiones verticales

Consejos

  • Aporta una transcripción con diarización para entrevistas y paneles: guía el encuadre del hablante activo por plano de forma mucho más fiable que la visión sola
  • Los planos sin un único sujeto claro (pantallas compartidas, planos generales amplios) se muestran con barras por diseño: es la opción segura, no un fallo
  • No hay controles de paneo / zoom / suavizado que ajustar: el director de cámara es de fijar-y-cortar determinista

Recetas que usan este pipeline

Artículos sobre este pipeline

API de Reencuadre de vídeo

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

3 entradas
2 obligatorio
2 to 5 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "video-reframe",
  input: {
    video_url: "https://example.com/interview.mp4",
    target_aspect_ratio: "9:16",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="video-reframe",
    input={
        "video_url": "https://example.com/interview.mp4",
        "target_aspect_ratio": "9:16",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "video_url": "https://example.com/interview.mp4",
  "target_aspect_ratio": "9:16"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline video-reframe \
  --input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
  --wait

Obtener un token de API →

Parámetros

target_aspect_ratio obligatorio

Aspect ratio to reframe to — vertical for shorts, square for feeds.

9:161:14:516:9 por defecto 9:16
video_url obligatorio

Public URL of the video to reframe.

string
transcript_url

Public URL of a transcript. Used to keep the speaker in frame.

string

Úsalo desde un agente de IA

Apunta cualquier cliente MCP a pipe2 y tu agente obtiene estas herramientas. Encuentra este pipeline, lee el mismo esquema de arriba y lo ejecuta.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referencia completa de la API Configuración de MCP Referencia de la CLI

Reencuadre de vídeo: de horizontal a vertical con seguimiento del hablante

La mayoría del vídeo viral vive en 9:16 (TikTok, Reels, Shorts), pero la mayoría del metraje se graba en 16:9. Reencuadre de vídeo salva esa distancia: encuentra al hablante activo en cada plano y lo encuadra en un recorte vertical limpio, mantenido perfectamente fijo durante el plano y cortando solo donde corta la fuente. Sin edición manual, sin controles de cámara que ajustar.

Cómo funciona

  1. Detecta los límites de plano: el detector de cortes de escena de FFmpeg divide la fuente para que cada decisión de encuadre se limite a un plano continuo.
  2. Localiza rostros e identifica el reparto: una pasada de visión más un detector de rostros de CV encuentran y agrupan los rostros en los fotogramas clave de cada plano, dando a cada persona una identidad estable.
  3. Resuelve el sujeto focal por plano: primero el audio: una transcripción con diarización nombra al hablante activo; de lo contrario, una pasada de visión de una etiqueta por plano y los rostros de CV deciden. El hablante se lleva el encuadre; un plano ambiguo se muestra con barras (mostrando a todos) en lugar de adivinar.
  4. Planifica la cámara de forma determinista: un planificador puro convierte el foco por plano en un plan de fijar-y-cortar: un recorte estático por plano, cortes secos en los límites, planos de menos de un segundo fusionados con los vecinos. Sin paneos, sin deriva, sin artefactos de movimiento: las mismas entradas siempre producen el mismo plan.
  5. Renderiza: FFmpeg aplica el recorte estático por plano (o unas barras centradas para los planos de fotograma completo), manteniendo el audio intacto.

Aporta una transcripción para el seguimiento de varios hablantes

Para entrevistas y paneles, pasa una transcripción con diarización (SRT) que cubra el mismo rango temporal que el vídeo. Sus turnos de hablante guían la elección del foco, de modo que un plano de dos personas sigue a quien realmente está hablando, no solo al rostro más grande en pantalla. Sin transcripción, el planificador sigue funcionando, recurriendo a la etiqueta de visión por plano y a las posiciones de los rostros de CV.

Preguntas frecuentes

¿Qué relaciones de aspecto son compatibles?
9:16 (TikTok/Reels/Shorts), 1:1 (cuadrado de Instagram), 4:5 (vertical de Instagram) y 16:9 (paso directo: no se aplica reencuadre).
¿Y si mi fuente ya es vertical?
El pipeline lo detecta y devuelve la fuente tal cual con meta.skipped=already_target_aspect.
¿Cómo elige a quién seguir?
Primero el audio. Si aportas una transcripción con diarización, encuadra al hablante activo por plano; de lo contrario, deciden una etiqueta de visión por plano más un detector de rostros de CV. Los planos sin un único sujeto claro (pantallas compartidas, planos generales amplios) se muestran con barras en lugar de adivinar.
¿Alguna vez hace paneos o zoom?
No. Cada plano recibe un recorte estático mantenido perfectamente fijo; la cámara solo corta en un límite de plano. Esto hace que la clase de artefactos de paneo tembloroso / cámara que persigue sea estructuralmente imposible.
¿Cuánto cuesta?
2 to 5 créditos, escalando con la duración del clip: los clips cortos quedan en el extremo bajo y los más largos en el alto.
¿Puedo encadenarlo con Recorte de vídeo?
Sí: la cadena típica es video-trim (longitud) → video-reframe (aspecto) → captions (incrustación). La mayoría de los usuarios querrán los tres para un corto terminado.

Explorar más pipelines

Ver todo →
Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.4
Generador de imágenes
Generador de audio
0.7-1.3
Generador de audio
Generador de música
2.5-45.1
Generador de música