Retour aux pipelines

Recadrage vidéo

Recadrez automatiquement une vidéo horizontale en vertical avec un cadrage IA sur le locuteur actif. Prête pour TikTok en un seul appel, cadre le locuteur dans chaque plan et coupe proprement à chaque transition.

2

Encore requis : Vidéo, Format cible

Idéal pour

  • Recadrer des séquences de podcast / interview / documentaire 16:9 en 9:16 pour TikTok/Reels/Shorts
  • Suivre un sujet spécifique (présentateur, produit, écran) lorsque le contenu comporte plusieurs points focaux
  • Produire des carrés Instagram 1:1 à partir de masters horizontaux avec suivi du locuteur actif
  • Boucler le passage du format long au short lorsqu'il est enchaîné avec video-trim et captions

Quand l'utiliser

  • Après video-trim, le trim choisit le moment, le reframe choisit le cadrage
  • Avant captions, recadrez d'abord pour que le texte des sous-titres tienne dans le canevas 9:16
  • En autonome pour les utilisateurs disposant de clips horizontaux déjà montés qui ont besoin de versions verticales

Conseils

  • Fournissez une transcription diarisée pour les interviews et les tables rondes, elle guide le cadrage sur le locuteur actif par plan bien plus fiablement que la vision seule
  • Les plans sans sujet unique clair (partages d'écran, plans d'ensemble larges) passent en letterbox par conception, c'est le choix sûr, pas un échec
  • Il n'y a aucun réglage de panoramique / zoom / lissage à ajuster, le réalisateur de caméra est un verrouillage-et-coupe déterministe

Recettes utilisant ce pipeline

Articles sur ce pipeline

API Recadrage vidéo

Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.

3 entrées
2 requis
2 to 5 crédits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "video-reframe",
  input: {
    video_url: "https://example.com/interview.mp4",
    target_aspect_ratio: "9:16",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="video-reframe",
    input={
        "video_url": "https://example.com/interview.mp4",
        "target_aspect_ratio": "9:16",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "video_url": "https://example.com/interview.mp4",
  "target_aspect_ratio": "9:16"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline video-reframe \
  --input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
  --wait

Obtenir un jeton d'API →

Paramètres

target_aspect_ratio requis

Aspect ratio to reframe to — vertical for shorts, square for feeds.

9:161:14:516:9 par défaut 9:16
video_url requis

Public URL of the video to reframe.

string
transcript_url

Public URL of a transcript. Used to keep the speaker in frame.

string

Utilisez-le depuis un agent IA

Pointez n'importe quel client MCP vers pipe2 et votre agent obtient ces outils. Il trouve ce pipeline, lit le même schéma ci-dessus, puis l'exécute.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Référence complète de l'API Configuration MCP Référence de la CLI

Recadrage vidéo: De l'horizontal au vertical avec suivi du locuteur

La plupart des vidéos virales sont en 9:16 (TikTok, Reels, Shorts), mais la plupart des séquences sont filmées en 16:9. Le Recadrage vidéo comble l'écart : il repère le locuteur actif dans chaque plan et le cadre dans un recadrage vertical net, maintenu parfaitement stable tout au long du plan, en coupant uniquement là où la source coupe. Aucun montage manuel, aucun réglage de caméra à ajuster.

Comment ça marche

  1. Détecter les limites de plan: le détecteur de changement de scène de FFmpeg segmente la source afin que chaque décision de cadrage soit limitée à un plan continu unique.
  2. Localiser les visages et identifier les intervenants: une passe visuelle plus un détecteur de visages CV repèrent et regroupent les visages sur les images clés de chaque plan, donnant à chaque personne une identité stable.
  3. Déterminer le sujet focal par plan: priorité à l'audio : une transcription diarisée nomme le locuteur actif ; sinon, une passe visuelle à une étiquette par plan et les visages CV décident. Le locuteur obtient le cadre ; un plan ambigu passe en letterbox (montre tout le monde) plutôt que de deviner.
  4. Planifier la caméra, de façon déterministe: un planificateur pur transforme le point focal de chaque plan en un plan de verrouillage et coupe : un recadrage statique par plan, des coupes franches aux transitions, les plans de moins d'une seconde fusionnés avec leurs voisins. Aucun panoramique, aucune dérive, aucun artefact de mouvement, les mêmes entrées produisent toujours le même plan.
  5. Rendu: FFmpeg applique le recadrage statique par plan (ou un letterbox centré pour les plans en cadre complet), en conservant l'audio intact.

Fournissez une transcription pour le suivi multi-locuteurs

Pour les interviews et les tables rondes, fournissez une transcription diarisée (SRT) couvrant la même plage temporelle que la vidéo. Ses tours de parole guident le choix du point focal, de sorte qu'un plan à deux personnes suit celle qui parle réellement, et non simplement le plus grand visage à l'écran. Sans transcription, le planificateur fonctionne quand même, en se repliant sur l'étiquette visuelle par plan et les positions des visages CV.

Foire aux questions

Quels formats d'image sont pris en charge ?
9:16 (TikTok/Reels/Shorts), 1:1 (carré Instagram), 4:5 (portrait Instagram) et 16:9 (passthrough, aucun recadrage appliqué).
Que se passe-t-il si ma source est déjà verticale ?
Le pipeline le détecte et renvoie la source telle quelle avec meta.skipped=already_target_aspect.
Comment choisit-il qui suivre ?
Priorité à l'audio. Si vous fournissez une transcription diarisée, il cadre le locuteur actif par plan ; sinon, une étiquette visuelle par plan et un détecteur de visages CV décident. Les plans sans sujet unique clair, partages d'écran, plans d'ensemble larges, passent en letterbox pour montrer le cadre entier plutôt que de deviner.
Fait-il parfois des panoramiques ou des zooms ?
Non. Chaque plan reçoit un recadrage statique maintenu parfaitement stable ; la caméra ne coupe qu'à une limite de plan. Cela rend structurellement impossible la classe d'artefacts de panoramique tremblant / caméra qui cherche.
Combien ça coûte ?
2 to 5 crédits, évoluant avec la durée du clip : les clips courts se situent dans le bas de la fourchette et les plus longs dans le haut.
Puis-je l'enchaîner avec video-trim ?
Oui, la chaîne typique est video-trim (durée) → video-reframe (format) → captions (incrustation). La plupart des utilisateurs voudront les trois pour un short terminé.

Découvrir plus de pipelines

Voir tout →
Générateur de vidéos
from 9.5
Générateur de vidéos
Générateur d'images
0.2-6.4
Générateur d'images
Générateur audio
0.7-1.3
Générateur audio
Générateur de musique
2.5-45.1
Générateur de musique