Recadrage vidéo
Recadrez automatiquement une vidéo horizontale en vertical avec un cadrage IA sur le locuteur actif. Prête pour TikTok en un seul appel, cadre le locuteur dans chaque plan et coupe proprement à chaque transition.
Encore requis : Vidéo, Format cible
Idéal pour
- •Recadrer des séquences de podcast / interview / documentaire 16:9 en 9:16 pour TikTok/Reels/Shorts
- •Suivre un sujet spécifique (présentateur, produit, écran) lorsque le contenu comporte plusieurs points focaux
- •Produire des carrés Instagram 1:1 à partir de masters horizontaux avec suivi du locuteur actif
- •Boucler le passage du format long au short lorsqu'il est enchaîné avec video-trim et captions
Quand l'utiliser
- •Après video-trim, le trim choisit le moment, le reframe choisit le cadrage
- •Avant captions, recadrez d'abord pour que le texte des sous-titres tienne dans le canevas 9:16
- •En autonome pour les utilisateurs disposant de clips horizontaux déjà montés qui ont besoin de versions verticales
Conseils
- ✓Fournissez une transcription diarisée pour les interviews et les tables rondes, elle guide le cadrage sur le locuteur actif par plan bien plus fiablement que la vision seule
- ✓Les plans sans sujet unique clair (partages d'écran, plans d'ensemble larges) passent en letterbox par conception, c'est le choix sûr, pas un échec
- ✓Il n'y a aucun réglage de panoramique / zoom / lissage à ajuster, le réalisateur de caméra est un verrouillage-et-coupe déterministe
Recettes utilisant ce pipeline
Articles sur ce pipeline
API Recadrage vidéo
Appelez ce pipeline depuis votre propre code. Une requête lance une exécution ; le modèle est un champ d'entrée, pas un endpoint distinct.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "video-reframe",
input: {
video_url: "https://example.com/interview.mp4",
target_aspect_ratio: "9:16",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="video-reframe",
input={
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline video-reframe \
--input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
--waitParamètres
-
target_aspect_ratiorequis -
Aspect ratio to reframe to — vertical for shorts, square for feeds.
9:161:14:516:9par défaut9:16 -
video_urlrequis -
Public URL of the video to reframe.
string -
transcript_url -
Public URL of a transcript. Used to keep the speaker in frame.
string
Utilisez-le depuis un agent IA
Pointez n'importe quel client MCP vers pipe2 et votre agent obtient ces outils. Il trouve ce pipeline, lit le même schéma ci-dessus, puis l'exécute.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Référence complète de l'API Configuration MCP Référence de la CLI
Recadrage vidéo: De l'horizontal au vertical avec suivi du locuteur
La plupart des vidéos virales sont en 9:16 (TikTok, Reels, Shorts), mais la plupart des séquences sont filmées en 16:9. Le Recadrage vidéo comble l'écart : il repère le locuteur actif dans chaque plan et le cadre dans un recadrage vertical net, maintenu parfaitement stable tout au long du plan, en coupant uniquement là où la source coupe. Aucun montage manuel, aucun réglage de caméra à ajuster.
Comment ça marche
- Détecter les limites de plan: le détecteur de changement de scène de FFmpeg segmente la source afin que chaque décision de cadrage soit limitée à un plan continu unique.
- Localiser les visages et identifier les intervenants: une passe visuelle plus un détecteur de visages CV repèrent et regroupent les visages sur les images clés de chaque plan, donnant à chaque personne une identité stable.
- Déterminer le sujet focal par plan: priorité à l'audio : une transcription diarisée nomme le locuteur actif ; sinon, une passe visuelle à une étiquette par plan et les visages CV décident. Le locuteur obtient le cadre ; un plan ambigu passe en letterbox (montre tout le monde) plutôt que de deviner.
- Planifier la caméra, de façon déterministe: un planificateur pur transforme le point focal de chaque plan en un plan de verrouillage et coupe : un recadrage statique par plan, des coupes franches aux transitions, les plans de moins d'une seconde fusionnés avec leurs voisins. Aucun panoramique, aucune dérive, aucun artefact de mouvement, les mêmes entrées produisent toujours le même plan.
- Rendu: FFmpeg applique le recadrage statique par plan (ou un letterbox centré pour les plans en cadre complet), en conservant l'audio intact.
Fournissez une transcription pour le suivi multi-locuteurs
Pour les interviews et les tables rondes, fournissez une transcription diarisée (SRT) couvrant la même plage temporelle que la vidéo. Ses tours de parole guident le choix du point focal, de sorte qu'un plan à deux personnes suit celle qui parle réellement, et non simplement le plus grand visage à l'écran. Sans transcription, le planificateur fonctionne quand même, en se repliant sur l'étiquette visuelle par plan et les positions des visages CV.
Foire aux questions
Quels formats d'image sont pris en charge ?
Que se passe-t-il si ma source est déjà verticale ?
Comment choisit-il qui suivre ?
Fait-il parfois des panoramiques ou des zooms ?
Combien ça coûte ?
Puis-je l'enchaîner avec video-trim ?
Découvrir plus de pipelines
Voir tout →Générez des vidéos par IA à partir d'une invite textuelle, d'une image ou d'un clip de référence. Plans cinématographiques, présentations de produits, publicités lifestyle, avec un audio synchronisé et un mouvement naturel.
Générez des images par IA à partir de texte ou de photos de référence. Photos de produits, illustrations de personnages, affiches avec texte lisible, portraits photoréalistes, haute résolution en quelques secondes.
Transformez du texte en voix naturelle grâce à des dizaines de voix, plus de 70 langues et des directions de style personnalisées pour le ton, l'accent et le rythme.
Générez une musique de fond originale qui correspond à n'importe quelle ambiance, genre et durée que vous décrivez. Libre de droits, prête en quelques secondes.