Torna alle pipeline

Reinquadratura video

Ritaglia automaticamente il video orizzontale in verticale con inquadratura AI del parlante attivo. Pronto per TikTok in un'unica chiamata, inquadra il parlante in ogni ripresa e taglia in modo pulito a ogni stacco.

2

Ancora necessario: Video, Proporzioni di destinazione

Ideale per

  • Reinquadrare filmati 16:9 di podcast / interviste / documentari in 9:16 per TikTok/Reels/Shorts
  • Tracciare un soggetto specifico (host, prodotto, schermo) quando il contenuto ha più punti focali
  • Produrre quadrati 1:1 per Instagram da master orizzontali con tracciamento del parlante attivo
  • Chiudere il ciclo da long-form a shorts quando concatenata con video-trim e captions

Quando usarlo

  • Dopo video-trim, il trim sceglie il momento, la reinquadratura sceglie l'inquadratura
  • Prima di captions, reinquadra prima così il testo dei sottotitoli entra nel canvas 9:16
  • Da sola per utenti con clip orizzontali già montate che necessitano di versioni verticali

Suggerimenti

  • Fornisci una trascrizione con diarizzazione per interviste e panel, guida l'inquadratura del parlante attivo per ripresa in modo molto più affidabile della sola visione
  • Le riprese senza un chiaro soggetto singolo (condivisioni schermo, riprese d'ambientazione ampie) vengono mostrate in letterbox per progettazione, è la scelta sicura, non un errore
  • Non ci sono manopole di panoramica / zoom / smussatura da regolare, il director della camera è lock-and-cut deterministico

Ricette che usano questo pipeline

Articoli su questo pipeline

API di Reinquadratura video

Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.

3 input
2 obbligatorio
2 to 5 crediti
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "video-reframe",
  input: {
    video_url: "https://example.com/interview.mp4",
    target_aspect_ratio: "9:16",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="video-reframe",
    input={
        "video_url": "https://example.com/interview.mp4",
        "target_aspect_ratio": "9:16",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "video_url": "https://example.com/interview.mp4",
  "target_aspect_ratio": "9:16"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline video-reframe \
  --input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
  --wait

Ottieni un token API →

Parametri

target_aspect_ratio obbligatorio

Aspect ratio to reframe to — vertical for shorts, square for feeds.

9:161:14:516:9 predefinito 9:16
video_url obbligatorio

Public URL of the video to reframe.

string
transcript_url

Public URL of a transcript. Used to keep the speaker in frame.

string

Usala da un agente IA

Punta un qualsiasi client MCP su pipe2 e il tuo agente ottiene questi strumenti. Trova questa pipeline, legge lo stesso schema qui sopra e la esegue.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Riferimento API completo Configurazione MCP Riferimento CLI

Reinquadratura video: Da orizzontale a verticale con tracciamento del parlante

La maggior parte dei video virali vive in 9:16 (TikTok, Reels, Shorts) ma la maggior parte dei filmati è girata in 16:9. La Reinquadratura video colma il divario: trova il parlante attivo in ogni ripresa e lo inquadra in un ritaglio verticale pulito, tenuto perfettamente fermo per tutta la ripresa, tagliando solo dove taglia la sorgente. Nessun editing manuale, nessuna manopola della camera da regolare.

Come funziona

  1. Rileva gli stacchi tra le riprese: il rilevatore di cambi di scena di FFmpeg partiziona la sorgente in modo che ogni decisione di inquadratura sia limitata a una singola ripresa continua.
  2. Localizza i volti e identifica il cast: un passaggio di visione più un rilevatore di volti CV trovano e raggruppano i volti nei fotogrammi chiave di ogni ripresa, dando a ogni persona un'identità stabile.
  3. Risolve il soggetto focale per ripresa: audio-first: una trascrizione con diarizzazione nomina il parlante attivo; altrimenti un passaggio di visione con una sola etichetta per ripresa e i volti CV decidono. Il parlante ottiene l'inquadratura; una ripresa ambigua viene mostrata in letterbox (mostrando tutti) invece di tirare a indovinare.
  4. Pianifica la camera, in modo deterministico: un pianificatore puro trasforma il focale per ripresa in un piano lock-and-cut: un ritaglio statico per ripresa, tagli netti agli stacchi, riprese sotto il secondo fuse con quelle adiacenti. Nessuna panoramica, nessuna deriva, nessun artefatto di movimento, gli stessi input producono sempre lo stesso piano.
  5. Renderizza: FFmpeg applica il ritaglio statico per ripresa (o un letterbox centrato per le riprese a fotogramma intero), mantenendo l'audio intatto.

Fornisci una trascrizione per il tracciamento multi-parlante

Per interviste e panel, passa una trascrizione con diarizzazione (SRT) che copre lo stesso intervallo temporale del video. I suoi turni di parola guidano la scelta del focale, così una ripresa a due segue chi sta effettivamente parlando, non solo il volto più grande sullo schermo. Senza una trascrizione il pianificatore funziona comunque, ripiegando sull'etichetta di visione per ripresa e sulle posizioni dei volti CV.

Domande frequenti

Quali proporzioni sono supportate?
9:16 (TikTok/Reels/Shorts), 1:1 (quadrato Instagram), 4:5 (verticale Instagram) e 16:9 (passthrough, nessuna reinquadratura applicata).
E se la mia sorgente è già verticale?
La pipeline lo rileva e restituisce la sorgente così com'è con meta.skipped=already_target_aspect.
Come decide chi seguire?
Audio-first. Se fornisci una trascrizione con diarizzazione, inquadra il parlante attivo per ripresa; altrimenti decidono un'etichetta di visione per ripresa più un rilevatore di volti CV. Le riprese senza un chiaro soggetto singolo, condivisioni schermo, riprese d'ambientazione ampie, vengono mostrate in letterbox per mostrare l'intero fotogramma invece di tirare a indovinare.
Fa mai panoramiche o zoom?
No. Ogni ripresa ottiene un ritaglio statico tenuto perfettamente fermo; la camera taglia solo a uno stacco di ripresa. Questo rende strutturalmente impossibile la classe di artefatti panoramica-tremolante / camera-a-caccia.
Quanto costa?
2 to 5 crediti, in scala con la durata della clip: le clip brevi stanno nella fascia bassa e quelle più lunghe in quella alta.
Posso concatenarla con video-trim?
Sì, la catena tipica è video-trim (lunghezza) → video-reframe (proporzioni) → captions (incorporazione). La maggior parte degli utenti vorrà tutti e tre per uno short finito.

Esplora altri pipeline

Vedi tutto →
Generatore video
from 9.5
Generatore video
Generatore immagini
0.2-6.4
Generatore immagini
Generatore audio
0.7-1.3
Generatore audio
Generatore musica
2.5-45.1
Generatore musica