如何把长视频剪成短视频:从转写到竖屏成片
先转写,再挑出值得剪的片段,按句子边界裁切,最后重构为竖屏。第一步之后,转写驱动一切。
作者 Pipe2.ai · 更新于 July 22, 2026
要把长视频剪成短视频,先做转写,然后让转写驱动之后的每一步。转写里有「说了什么」,所以你能挑出值得剪的片段;它带着句子边界,所以切点落在句与句之间而不是词的中间;它还能直接喂给画面重构和字幕,不必再跑第二遍。先录制、再拖动时间轴去找片段,是同一件事的慢速版本。
**范围说明,2026 年 7 月:**下面的步骤对应 Pipe2.ai 当前在跑的流水线——Transcription、Highlights、Video Trim、Video Reframe 和 Captions。文中描述的行为是对照它们当前的输入结构核对的,不是照抄宣传文案。
为什么转写是整个诀窍
转写之后的每一步,输入都是转写。这不是工具上的巧合,而正是这套流程能够自动化的原因。
- 挑片段需要知道说了什么,而不是波形长什么样。
- 裁切需要句子边界,否则片段会从半个词开始。
- 画面重构在知道语音落在时间轴哪里时会更准。
- 字幕需要词和它们的时间点——而这些你已经有了。
所以:整段录制只转写一次,保留这个文件,并把它交给之后的每一步。一段 60 分钟的播客只转写一次,就够整批片段使用。如果你的流程对每个片段都重新转写,那是在把最贵的一步重复 N 遍,却没有任何收益。
第一步 — 转写整段录制
处理完整文件,而不是你以为需要的那几段。你没读过的录制,挑不出好片段。
有两个选项值得刻意设置:
- 说话人分离(
diarize)——访谈和圆桌里不可或缺。知道是谁说的,能把「一句好话」变成「嘉宾说的一句好话」,而值得剪的通常是后者。 - 纠正词表(
corrections)——把模型容易听错的词提前列出来。产品名、人名和行话是常见的几类。在转写阶段改一次,比之后在每个字幕文件里改都便宜。
第二步 — 片段是挑出来的,不是找出来的
读转写文本,找那些能独立成立的片段:有论据的主张、有落点的故事、被干净利落回答的问题。判断标准是:这段内容对没看过原片的人是否说得通。
Highlights 针对转写做这件事,并返回你指定数量的候选,所以你可以直接要实际打算发布的条数——一场网络研讨会要十条,一次短访谈要三条——而不必在一份没有尽头的清单里筛。style 输入用来指定它找什么,这一点是有意义的:销售型研讨会和喜剧播客里「好片段」的形状并不一样。
把输出当作候选名单,而不是判决。模型能找出读起来好的段落;哪些适合你的频道,仍然由你决定。
第三步 — 在句子边界处裁切
这一步最容易暴露自动剪辑的粗糙。按原始时间戳裁出的片段从半个词开始,在想法落地之前就结束了。它看起来像抠出来的而不是剪出来的,之后再怎么打磨也补不回来。
Video Trim 接收起止时间和转写文本,并把每个切点吸附到最近的句子边界。你给出大致正确的位置,干净的边界由工具去找。实际效果是:你可以一边读一边快速粗选,仍然得到开合利落的片段。
第四步 — 重构为竖屏
16:9 的录制从正中裁下去,讲话人每次侧身都会有半张脸出画。Video Reframe 会分析关键帧、定位其中的人脸,并选择一个在整个镜头里跟随主体的裁切。
有必要把它做什么、不做什么说清楚:它寻找并跟随人脸,并就画面该放在哪里做出编辑上的判断。它并不是在判断此刻是谁在说话。当一个镜头没有明确主体时——幻灯片、录屏、铺满画面的空镜——它会走信箱式黑边而不是硬造一个裁切,对本就占满画面的内容而言这是正确的选择。
目标画幅比例请按发布位置显式设置。
第五步 — 烧录字幕
社交视频大多是静音观看的。没有字幕的片段,多数人还没弄清它讲什么就划走了。
由于转写已经存在,此时 Captions 几乎不花额外成本:把裁好的片段和转写交给它,选一个预设,就能拿到文字已烧录的成品 MP4——不必依赖平台如何渲染你另行上传的字幕文件,那种渲染各平台不一,而且经常被忽略。
好片段和抠出来的片段差在哪
- 一个片段一个想法。 如果需要两句铺垫才能解释这个片段,那铺垫本就该在片段里,或者是这个片段选错了。
- 用最有力的一句开场,不是它前面的清嗓子。哪一句最有力,看转写一目了然。
- 让人脸留在画面里——主体飘到边缘的说话头像片段,看上去很随便。
- 不要为了凑数而剪。 一场研讨会剪十条平庸的,效果不如三条好的,而发布成本一样。
- 按完整的想法来切,时长该是多少就是多少。
它和其他环节的关系
这条链跑顺之后,同一份转写还能支撑本来要单独立项的事情:完整版的章节标记、成文的摘要、原片的字幕。在决定要不要转写时这点值得考虑——成本只付一次,却摊薄到后续所有环节上。
如果你不只是剪辑,还要自己制作源视频,如何用 AI 制作视频讲的是生成这一侧,如何给视频加字幕则更深入地讲字幕的呈现。
动手试试
从你手上已有的一段录制开始。转写它,让 Highlights 只给三个候选,然后只裁这三段——第一轮的目的,是看它找出的片段是否和你自己会选的一致。一旦对得上,同样这条链跑一小时的素材也一样,只需要改一个数量。
常见问题
怎样把长视频剪成短片?
先做转写,然后用转写文本来挑片段、裁切和重构画面。从转写出发正是让后续步骤自动化的关键:同一个文件既告诉你说了什么,也标出每句话从哪里开始、到哪里结束,以及在哪里下刀不会把一个词切成两半。
短片应该多长?
刚好装下一个完整想法,不必更长。实践中通常是 20 到 60 秒。真正的约束不是平台的时长上限,而是这段内容对没看过原片的人是否说得通——所以要围绕一个完整的想法来切,而不是切到固定时长。
为什么我的片段从半个词开始或结束?
因为裁切是按时间戳做的,而不是按语音。对着转写文本裁切时,每个切点会吸附到句子边界,于是片段从句首开始、到句尾结束。这是「看起来经过剪辑」和「看起来只是抠出来」之间最明显的差别。
每个片段都要重新转写吗?
不需要,也不应该。整段录制只转写一次,然后把这份转写复用于挑片段、裁切、重构画面和字幕。转写之后的每一步都接受转写作为输入,所以对一段 60 分钟录制的一次处理就够整批片段使用。
怎样把横屏视频变成竖屏又不把人裁掉?
自动重构会分析关键帧,定位每一帧中的人脸,并选择一个能在镜头切换时把主体留在画面内的裁切,而不是固定按中心裁。当画面里没有明确主体时——幻灯片、录屏、满屏的空镜——它会改用信箱式黑边处理,对本就铺满画面的内容来说这才是正确做法。
短片需要字幕吗?
需要。社交平台上的视频大多是静音观看的,没有字幕的片段大多数人会直接划走。由于第一步已经产出了转写,字幕几乎不增加额外成本,并且会烧录进导出的文件,而不依赖各平台如何渲染另行上传的字幕文件。