Voltar aos pipelines

Reenquadramento de Vídeo

Recorte automaticamente vídeo horizontal para vertical com enquadramento do locutor ativo por IA. Pronto para TikTok em uma única chamada, enquadra o locutor em cada tomada e corta de forma limpa em cada limite.

2

Ainda falta: Vídeo, Proporção Desejada

Ideal para

  • Reenquadrar filmagens de podcast / entrevista / documentário em 16:9 para 9:16 TikTok/Reels/Shorts
  • Rastrear um tema específico (apresentador, produto, tela) quando o conteúdo tem vários pontos focais
  • Produzir quadrados 1:1 do Instagram a partir de masters horizontais com rastreamento do locutor ativo
  • Fechar o ciclo de formato longo para shorts quando encadeado com video-trim e captions

Quando usar

  • Depois do video-trim, o trim escolhe o momento, o reframe escolhe o enquadramento
  • Antes do captions, reenquadre primeiro para que o texto das legendas caiba na tela 9:16
  • De forma independente, para usuários com clipes horizontais já editados que precisam de versões verticais

Dicas

  • Forneça uma transcrição diarizada para entrevistas e painéis, ela conduz o enquadramento do locutor ativo por tomada de forma muito mais confiável do que a visão sozinha
  • Tomadas sem um único tema claro (compartilhamentos de tela, planos abertos de estabelecimento) recebem letterbox por design, essa é a escolha segura, não um erro
  • Não há botões de panorâmica / zoom / suavização para ajustar, o diretor de câmera é determinístico, de travar e cortar

Receitas que usam este pipeline

Artigos sobre este pipeline

API do Reenquadramento de Vídeo

Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.

3 entradas
2 obrigatório
2 to 5 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "video-reframe",
  input: {
    video_url: "https://example.com/interview.mp4",
    target_aspect_ratio: "9:16",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="video-reframe",
    input={
        "video_url": "https://example.com/interview.mp4",
        "target_aspect_ratio": "9:16",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "video_url": "https://example.com/interview.mp4",
  "target_aspect_ratio": "9:16"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline video-reframe \
  --input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
  --wait

Obter um token de API →

Parâmetros

target_aspect_ratio obrigatório

Aspect ratio to reframe to — vertical for shorts, square for feeds.

9:161:14:516:9 predefinição 9:16
video_url obrigatório

Public URL of the video to reframe.

string
transcript_url

Public URL of a transcript. Used to keep the speaker in frame.

string

Use a partir de um agente de IA

Aponte qualquer cliente MCP para o pipe2 e o seu agente ganha estas ferramentas. Ele encontra este pipeline, lê o mesmo esquema acima e executa-o.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referência completa da API Configuração de MCP Referência da CLI

Reenquadramento de Vídeo: De Horizontal para Vertical com Rastreamento de Locutor

A maior parte do vídeo viral vive em 9:16 (TikTok, Reels, Shorts), mas a maioria das filmagens é gravada em 16:9. O Reenquadramento de Vídeo fecha essa lacuna: ele encontra o locutor ativo em cada tomada e o enquadra em um recorte vertical limpo, mantido perfeitamente imóvel ao longo da tomada, cortando apenas onde a fonte corta. Sem edição manual, sem botões de câmera para ajustar.

Como Funciona

  1. Detectar os limites das tomadas: o detector de corte de cena do FFmpeg particiona a fonte para que cada decisão de enquadramento fique restrita a uma única tomada contínua.
  2. Localizar rostos e identificar o elenco: uma passagem de visão mais um detector de rostos por visão computacional (CV) encontram e agrupam rostos nos quadros-chave de cada tomada, dando a cada pessoa uma identidade estável.
  3. Resolver o tema focal por tomada: áudio em primeiro lugar: uma transcrição diarizada nomeia o locutor ativo; caso contrário, uma passagem de visão com um rótulo por tomada e os rostos de CV decidem. O locutor recebe o quadro; uma tomada ambígua recebe letterbox (mostra todos) em vez de adivinhar.
  4. Planejar a câmera, de forma determinística: um planejador puro transforma o foco por tomada em um plano de travar e cortar: um recorte estático por tomada, cortes secos nos limites, tomadas de menos de um segundo mescladas às vizinhas. Sem panorâmicas, sem deriva, sem artefatos de movimento, as mesmas entradas sempre produzem o mesmo plano.
  5. Renderizar: o FFmpeg aplica o recorte estático por tomada (ou um letterbox centralizado para tomadas de quadro inteiro), mantendo o áudio intacto.

Forneça uma transcrição para o rastreamento de vários locutores

Para entrevistas e painéis, passe uma transcrição diarizada (SRT) cobrindo o mesmo intervalo de tempo do vídeo. As trocas de locutor dela conduzem a escolha do foco, de modo que um plano de dois acompanha quem está realmente falando, e não apenas o maior rosto na tela. Sem uma transcrição, o planejador ainda funciona, recorrendo ao rótulo de visão por tomada e às posições dos rostos de CV.

Perguntas frequentes

Quais proporções de tela são suportadas?
9:16 (TikTok/Reels/Shorts), 1:1 (quadrado do Instagram), 4:5 (retrato do Instagram) e 16:9 (passagem direta, sem reenquadramento aplicado).
E se a minha fonte já for vertical?
O pipeline detecta isso e retorna a fonte como está, com meta.skipped=already_target_aspect.
Como ele escolhe quem seguir?
Áudio em primeiro lugar. Se você fornecer uma transcrição diarizada, ele enquadra o locutor ativo por tomada; caso contrário, um rótulo de visão por tomada mais um detector de rostos por CV decidem. Tomadas sem um único tema claro, compartilhamentos de tela, planos abertos de estabelecimento, recebem letterbox para mostrar o quadro inteiro em vez de adivinhar.
Ele chega a fazer panorâmica ou zoom?
Não. Cada tomada recebe um único recorte estático mantido perfeitamente imóvel; a câmera só corta no limite de uma tomada. Isso torna estruturalmente impossível a classe de artefatos de panorâmica tremida / câmera à procura.
Quanto custa?
2 to 5 créditos, escalando com a duração do clipe: clipes curtos ficam na faixa baixa e os mais longos no topo.
Posso encadeá-lo com o video-trim?
Sim, a cadeia típica é video-trim (duração) → video-reframe (proporção) → captions (gravação). A maioria dos usuários vai querer os três para um short finalizado.

Explorar mais pipelines

Ver tudo →
Gerador de Vídeo
from 9.5
Gerador de Vídeo
Gerador de Imagens
0.2-6.4
Gerador de Imagens
Gerador de Áudio
0.7-1.3
Gerador de Áudio
Gerador de Música
2.5-45.1
Gerador de Música