Video-Reframe
Beschneide horizontales Video automatisch zu vertikalem mit KI-Aktivsprecher-Framing. TikTok-fertig in einem Aufruf, rahmt den Sprecher in jeder Einstellung und schneidet an jeder Grenze sauber.
Noch erforderlich: Video, Ziel-Seitenverhältnis
Am besten für
- •16:9-Podcast-/Interview-/Dokumentarmaterial auf 9:16 für TikTok/Reels/Shorts umrahmen
- •Ein bestimmtes Motiv verfolgen (Moderator, Produkt, Bildschirm), wenn der Inhalt mehrere Fokuspunkte hat
- •1:1-Instagram-Quadrate aus horizontalen Mastern mit Aktivsprecher-Tracking erzeugen
- •Den Kreislauf von Langform zu Shorts schließen, wenn es mit video-trim und captions verkettet wird
Wann zu verwenden
- •Nach video-trim, Trim wählt den Moment, Reframe wählt das Framing
- •Vor captions, zuerst umrahmen, damit der Untertiteltext auf die 9:16-Leinwand passt
- •Eigenständig für Nutzer mit bereits geschnittenen horizontalen Clips, die vertikale Versionen brauchen
Tipps
- ✓Liefere bei Interviews und Panels ein diarisiertes Transkript, es steuert das Aktivsprecher-Framing pro Einstellung weit zuverlässiger als Vision allein
- ✓Einstellungen ohne klares Einzelmotiv (Bildschirmfreigaben, weite Establishing-Shots) erhalten per Design eine Letterbox, das ist die sichere Wahl, kein Fehler
- ✓Es gibt keine Schwenk-/Zoom-/Glättungsregler zum Einstellen, der Kameraregisseur ist deterministisches Lock-and-Cut
Rezepte mit dieser Pipeline
Artikel zu dieser Pipeline
Video-Reframe API
Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "video-reframe",
input: {
video_url: "https://example.com/interview.mp4",
target_aspect_ratio: "9:16",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="video-reframe",
input={
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"video_url": "https://example.com/interview.mp4",
"target_aspect_ratio": "9:16"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline video-reframe \
--input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
--waitParameter
-
target_aspect_ratioerforderlich -
Aspect ratio to reframe to — vertical for shorts, square for feeds.
9:161:14:516:9Standard9:16 -
video_urlerforderlich -
Public URL of the video to reframe.
string -
transcript_url -
Public URL of a transcript. Used to keep the speaker in frame.
string
Aus einem KI-Agenten heraus nutzen
Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Video-Reframe: von Horizontal zu Vertikal mit Sprecher-Tracking
Die meisten viralen Videos leben bei 9:16 (TikTok, Reels, Shorts), aber das meiste Material wird in 16:9 gedreht. Video-Reframe schließt die Lücke: Es findet den aktiven Sprecher in jeder Einstellung und rahmt ihn in einem sauberen vertikalen Ausschnitt, durch die gesamte Einstellung perfekt ruhig gehalten und nur dort geschnitten, wo die Quelle schneidet. Keine manuelle Bearbeitung, keine Kameraregler zum Einstellen.
So funktioniert es
- Erkenne Einstellungsgrenzen: der Szenenschnitt-Detektor von FFmpeg partitioniert die Quelle, sodass jede Framing-Entscheidung auf eine durchgehende Einstellung beschränkt ist.
- Lokalisiere Gesichter und identifiziere die Besetzung: ein Vision-Durchlauf plus ein CV-Gesichtsdetektor finden und gruppieren Gesichter über die Keyframes jeder Einstellung hinweg und geben jeder Person eine stabile Identität.
- Bestimme das Fokusmotiv pro Einstellung: audio-first: Ein diarisiertes Transkript benennt den aktiven Sprecher; andernfalls entscheiden ein Vision-Durchlauf mit einem Label pro Einstellung und die CV-Gesichter. Der Sprecher bekommt den Rahmen; eine mehrdeutige Einstellung wird mit Letterbox versehen (zeigt alle), statt zu raten.
- Plane die Kamera deterministisch: ein reiner Planer verwandelt das Fokusmotiv pro Einstellung in einen Lock-and-Cut-Plan: ein statischer Ausschnitt pro Einstellung, harte Schnitte an den Grenzen, Einstellungen unter einer Sekunde in Nachbarn zusammengeführt. Keine Schwenks, keine Drift, keine Bewegungsartefakte, dieselben Eingaben ergeben immer denselben Plan.
- Rendern: FFmpeg wendet den statischen Ausschnitt pro Einstellung an (oder eine zentrierte Letterbox für Ganzbild-Einstellungen) und hält das Audio intakt.
Liefere ein Transkript für Multi-Sprecher-Tracking
Übergib bei Interviews und Panels ein diarisiertes Transkript (SRT), das denselben Zeitbereich wie das Video abdeckt. Seine Sprecherwechsel steuern die Fokuswahl, sodass eine Zwei-Personen-Einstellung dem folgt, wer tatsächlich spricht, nicht nur dem größten Gesicht im Bild. Ohne Transkript funktioniert der Planer weiterhin und greift auf das Vision-Label pro Einstellung und die CV-Gesichtspositionen zurück.
Häufig gestellte Fragen
Welche Seitenverhältnisse werden unterstützt?
Was, wenn meine Quelle bereits vertikal ist?
Wie wählt es, wem es folgt?
Schwenkt oder zoomt es jemals umher?
Was kostet es?
Kann ich es mit video-trim verketten?
Weitere Pipelines entdecken
Alle ansehen →Erzeuge KI-Videos aus einem Text-Prompt, Bild oder Referenzclip. Filmische Aufnahmen, Produktenthüllungen, Lifestyle-Werbung, mit synchronisiertem Audio und natürlicher Bewegung.
Erzeuge KI-Bilder aus Text oder Referenzfotos. Produktaufnahmen, Charakter-Artworks, Poster mit lesbarem Text, fotorealistische Porträts, hochauflösend in Sekunden.
Verwandle Text in natürliche Sprache mit Dutzenden Stimmen, mehr als 70 Sprachen und individuellen Stilvorgaben für Tonfall, Akzent und Sprechtempo.
Erzeuge originale Hintergrundmusik, die zu jeder Stimmung, jedem Genre und jeder Länge passt, die du beschreibst. Lizenzfrei, in Sekunden fertig.