Zurück zu den Pipelines

Video-Reframe

Beschneide horizontales Video automatisch zu vertikalem mit KI-Aktivsprecher-Framing. TikTok-fertig in einem Aufruf, rahmt den Sprecher in jeder Einstellung und schneidet an jeder Grenze sauber.

2

Noch erforderlich: Video, Ziel-Seitenverhältnis

Am besten für

  • 16:9-Podcast-/Interview-/Dokumentarmaterial auf 9:16 für TikTok/Reels/Shorts umrahmen
  • Ein bestimmtes Motiv verfolgen (Moderator, Produkt, Bildschirm), wenn der Inhalt mehrere Fokuspunkte hat
  • 1:1-Instagram-Quadrate aus horizontalen Mastern mit Aktivsprecher-Tracking erzeugen
  • Den Kreislauf von Langform zu Shorts schließen, wenn es mit video-trim und captions verkettet wird

Wann zu verwenden

  • Nach video-trim, Trim wählt den Moment, Reframe wählt das Framing
  • Vor captions, zuerst umrahmen, damit der Untertiteltext auf die 9:16-Leinwand passt
  • Eigenständig für Nutzer mit bereits geschnittenen horizontalen Clips, die vertikale Versionen brauchen

Tipps

  • Liefere bei Interviews und Panels ein diarisiertes Transkript, es steuert das Aktivsprecher-Framing pro Einstellung weit zuverlässiger als Vision allein
  • Einstellungen ohne klares Einzelmotiv (Bildschirmfreigaben, weite Establishing-Shots) erhalten per Design eine Letterbox, das ist die sichere Wahl, kein Fehler
  • Es gibt keine Schwenk-/Zoom-/Glättungsregler zum Einstellen, der Kameraregisseur ist deterministisches Lock-and-Cut

Rezepte mit dieser Pipeline

Artikel zu dieser Pipeline

Video-Reframe API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

3 Eingaben
2 erforderlich
2 to 5 Credits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "video-reframe",
  input: {
    video_url: "https://example.com/interview.mp4",
    target_aspect_ratio: "9:16",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="video-reframe",
    input={
        "video_url": "https://example.com/interview.mp4",
        "target_aspect_ratio": "9:16",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "video_url": "https://example.com/interview.mp4",
  "target_aspect_ratio": "9:16"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "video-reframe", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline video-reframe \
  --input-json '{"video_url": "https://example.com/interview.mp4", "target_aspect_ratio": "9:16"}' \
  --wait

API-Token holen →

Parameter

target_aspect_ratio erforderlich

Aspect ratio to reframe to — vertical for shorts, square for feeds.

9:161:14:516:9 Standard 9:16
video_url erforderlich

Public URL of the video to reframe.

string
transcript_url

Public URL of a transcript. Used to keep the speaker in frame.

string

Aus einem KI-Agenten heraus nutzen

Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Vollständige API-Referenz MCP-Einrichtung CLI-Referenz

Video-Reframe: von Horizontal zu Vertikal mit Sprecher-Tracking

Die meisten viralen Videos leben bei 9:16 (TikTok, Reels, Shorts), aber das meiste Material wird in 16:9 gedreht. Video-Reframe schließt die Lücke: Es findet den aktiven Sprecher in jeder Einstellung und rahmt ihn in einem sauberen vertikalen Ausschnitt, durch die gesamte Einstellung perfekt ruhig gehalten und nur dort geschnitten, wo die Quelle schneidet. Keine manuelle Bearbeitung, keine Kameraregler zum Einstellen.

So funktioniert es

  1. Erkenne Einstellungsgrenzen: der Szenenschnitt-Detektor von FFmpeg partitioniert die Quelle, sodass jede Framing-Entscheidung auf eine durchgehende Einstellung beschränkt ist.
  2. Lokalisiere Gesichter und identifiziere die Besetzung: ein Vision-Durchlauf plus ein CV-Gesichtsdetektor finden und gruppieren Gesichter über die Keyframes jeder Einstellung hinweg und geben jeder Person eine stabile Identität.
  3. Bestimme das Fokusmotiv pro Einstellung: audio-first: Ein diarisiertes Transkript benennt den aktiven Sprecher; andernfalls entscheiden ein Vision-Durchlauf mit einem Label pro Einstellung und die CV-Gesichter. Der Sprecher bekommt den Rahmen; eine mehrdeutige Einstellung wird mit Letterbox versehen (zeigt alle), statt zu raten.
  4. Plane die Kamera deterministisch: ein reiner Planer verwandelt das Fokusmotiv pro Einstellung in einen Lock-and-Cut-Plan: ein statischer Ausschnitt pro Einstellung, harte Schnitte an den Grenzen, Einstellungen unter einer Sekunde in Nachbarn zusammengeführt. Keine Schwenks, keine Drift, keine Bewegungsartefakte, dieselben Eingaben ergeben immer denselben Plan.
  5. Rendern: FFmpeg wendet den statischen Ausschnitt pro Einstellung an (oder eine zentrierte Letterbox für Ganzbild-Einstellungen) und hält das Audio intakt.

Liefere ein Transkript für Multi-Sprecher-Tracking

Übergib bei Interviews und Panels ein diarisiertes Transkript (SRT), das denselben Zeitbereich wie das Video abdeckt. Seine Sprecherwechsel steuern die Fokuswahl, sodass eine Zwei-Personen-Einstellung dem folgt, wer tatsächlich spricht, nicht nur dem größten Gesicht im Bild. Ohne Transkript funktioniert der Planer weiterhin und greift auf das Vision-Label pro Einstellung und die CV-Gesichtspositionen zurück.

Häufig gestellte Fragen

Welche Seitenverhältnisse werden unterstützt?
9:16 (TikTok/Reels/Shorts), 1:1 (Instagram-Quadrat), 4:5 (Instagram-Hochformat) und 16:9 (Durchleitung, kein Reframing angewendet).
Was, wenn meine Quelle bereits vertikal ist?
Die Pipeline erkennt dies und gibt die Quelle unverändert mit meta.skipped=already_target_aspect zurück.
Wie wählt es, wem es folgt?
Audio-first. Wenn du ein diarisiertes Transkript lieferst, rahmt es den aktiven Sprecher pro Einstellung; andernfalls entscheiden ein Vision-Label pro Einstellung plus ein CV-Gesichtsdetektor. Einstellungen ohne klares Einzelmotiv, Bildschirmfreigaben, weite Establishing-Shots, werden mit Letterbox versehen, um das ganze Bild zu zeigen, statt zu raten.
Schwenkt oder zoomt es jemals umher?
Nein. Jede Einstellung erhält einen statischen Ausschnitt, der perfekt ruhig gehalten wird; die Kamera schneidet nur an einer Einstellungsgrenze. Das macht die Artefaktklasse aus zittrigen Schwenks / suchender Kamera strukturell unmöglich.
Was kostet es?
2 to 5 Credits, skalierend mit der Cliplänge: kurze Clips liegen am unteren Ende, längere Clips am oberen.
Kann ich es mit video-trim verketten?
Ja, die typische Kette ist video-trim (Länge) → video-reframe (Seitenverhältnis) → captions (Einbrennen). Die meisten Nutzer werden für einen fertigen Short alle drei wollen.

Weitere Pipelines entdecken

Alle ansehen →
Video-Generator
from 9.5
Video-Generator
Bild-Generator
0.2-6.4
Bild-Generator
Audio-Generator
0.7-1.3
Audio-Generator
Musik-Generator
2.5-45.1
Musik-Generator