Reenquadramento de Vídeo
Recorte automaticamente vídeo horizontal para vertical com enquadramento do locutor ativo por IA. Pronto para TikTok em uma única chamada, enquadra o locutor em cada tomada e corta de forma limpa em cada limite.
Ainda falta: Vídeo, Proporção Desejada
Ideal para
- •Reenquadrar filmagens de podcast / entrevista / documentário em 16:9 para 9:16 TikTok/Reels/Shorts
- •Rastrear um tema específico (apresentador, produto, tela) quando o conteúdo tem vários pontos focais
- •Produzir quadrados 1:1 do Instagram a partir de masters horizontais com rastreamento do locutor ativo
- •Fechar o ciclo de formato longo para shorts quando encadeado com video-trim e captions
Quando usar
- •Depois do video-trim, o trim escolhe o momento, o reframe escolhe o enquadramento
- •Antes do captions, reenquadre primeiro para que o texto das legendas caiba na tela 9:16
- •De forma independente, para usuários com clipes horizontais já editados que precisam de versões verticais
Dicas
- ✓Forneça uma transcrição diarizada para entrevistas e painéis, ela conduz o enquadramento do locutor ativo por tomada de forma muito mais confiável do que a visão sozinha
- ✓Tomadas sem um único tema claro (compartilhamentos de tela, planos abertos de estabelecimento) recebem letterbox por design, essa é a escolha segura, não um erro
- ✓Não há botões de panorâmica / zoom / suavização para ajustar, o diretor de câmera é determinístico, de travar e cortar
Receitas que usam este pipeline
Artigos sobre este pipeline
API do Reenquadramento de Vídeo
Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "video-reframe",
input: {
video_url: "https://example.com/interview.mp4",
target_aspect_ratio: "9:16",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="video-reframe",
input={
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline video-reframe \
--input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
--waitParâmetros
-
target_aspect_ratioobrigatório -
Aspect ratio to reframe to — vertical for shorts, square for feeds.
9:161:14:516:9predefinição9:16 -
video_urlobrigatório -
Public URL of the video to reframe.
string -
transcript_url -
Public URL of a transcript. Used to keep the speaker in frame.
string
Use a partir de um agente de IA
Aponte qualquer cliente MCP para o pipe2 e o seu agente ganha estas ferramentas. Ele encontra este pipeline, lê o mesmo esquema acima e executa-o.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Referência completa da API Configuração de MCP Referência da CLI
Reenquadramento de Vídeo: De Horizontal para Vertical com Rastreamento de Locutor
A maior parte do vídeo viral vive em 9:16 (TikTok, Reels, Shorts), mas a maioria das filmagens é gravada em 16:9. O Reenquadramento de Vídeo fecha essa lacuna: ele encontra o locutor ativo em cada tomada e o enquadra em um recorte vertical limpo, mantido perfeitamente imóvel ao longo da tomada, cortando apenas onde a fonte corta. Sem edição manual, sem botões de câmera para ajustar.
Como Funciona
- Detectar os limites das tomadas: o detector de corte de cena do FFmpeg particiona a fonte para que cada decisão de enquadramento fique restrita a uma única tomada contínua.
- Localizar rostos e identificar o elenco: uma passagem de visão mais um detector de rostos por visão computacional (CV) encontram e agrupam rostos nos quadros-chave de cada tomada, dando a cada pessoa uma identidade estável.
- Resolver o tema focal por tomada: áudio em primeiro lugar: uma transcrição diarizada nomeia o locutor ativo; caso contrário, uma passagem de visão com um rótulo por tomada e os rostos de CV decidem. O locutor recebe o quadro; uma tomada ambígua recebe letterbox (mostra todos) em vez de adivinhar.
- Planejar a câmera, de forma determinística: um planejador puro transforma o foco por tomada em um plano de travar e cortar: um recorte estático por tomada, cortes secos nos limites, tomadas de menos de um segundo mescladas às vizinhas. Sem panorâmicas, sem deriva, sem artefatos de movimento, as mesmas entradas sempre produzem o mesmo plano.
- Renderizar: o FFmpeg aplica o recorte estático por tomada (ou um letterbox centralizado para tomadas de quadro inteiro), mantendo o áudio intacto.
Forneça uma transcrição para o rastreamento de vários locutores
Para entrevistas e painéis, passe uma transcrição diarizada (SRT) cobrindo o mesmo intervalo de tempo do vídeo. As trocas de locutor dela conduzem a escolha do foco, de modo que um plano de dois acompanha quem está realmente falando, e não apenas o maior rosto na tela. Sem uma transcrição, o planejador ainda funciona, recorrendo ao rótulo de visão por tomada e às posições dos rostos de CV.
Perguntas frequentes
Quais proporções de tela são suportadas?
E se a minha fonte já for vertical?
Como ele escolhe quem seguir?
Ele chega a fazer panorâmica ou zoom?
Quanto custa?
Posso encadeá-lo com o video-trim?
Explorar mais pipelines
Ver tudo →Gere vídeos com IA a partir de um prompt de texto, imagem ou clipe de referência. Tomadas cinematográficas, revelações de produto, anúncios de estilo de vida, com áudio sincronizado e movimento natural.
Gere imagens com IA a partir de texto ou fotos de referência. Fotos de produto, arte de personagens, cartazes com texto legível, retratos fotorrealistas, alta resolução em segundos.
Transforme texto em fala natural com dezenas de vozes, mais de 70 idiomas e direções de estilo personalizadas para tom, sotaque e ritmo.
Gere música de fundo original que combine com qualquer clima, gênero e duração que você descrever. Livre de royalties, pronta em segundos.