如何把长视频剪成短视频:从转录到竖屏成片
先转录,再挑出值得保留的片段,按完整句子裁剪,最后调整为竖屏;第一步生成的转录会贯穿整个流程。
操作指南 作者 Pipe2.ai 更新于 July 22, 2026
本文目录
要把长视频剪成短视频,第一步先转录,之后所有步骤都围绕这份转录展开。文字内容可以帮助挑出值得保留的片段,句子时间点能让切点落在完整句子之间,同一份文件还可以直接用于调整画幅和添加字幕,无需重复转录。相比在时间轴上来回拖动寻找片段,这种方法更快也更准确。
**范围说明,2026 年 7 月:**下文步骤对应 Pipe2.ai 当前提供的 Transcription、Highlights、Video Trim、Video Reframe 和 Captions。文中所述功能均根据当前产品设置和实际处理行为核对,并非宣传性概述。
为什么转录文件是整个流程的关键
转录完成后的每一步都会使用这份文件,这正是整个流程能够自动化的原因。
- 挑片段需要知道说了什么,而不是波形长什么样。
- 裁切需要句子边界,否则片段会从半个词开始。
- 调整画幅在知道语音位于时间轴的什么位置时会更准确。
- 字幕需要词和它们的时间点——而这些你已经有了。
因此,整段录制只需转录一次。保留这份文件,并在之后每一步中复用。一段 60 分钟的播客只需转录一次,就足以制作整批片段;如果每个片段都重新转录,只会重复付出成本,没有额外收益。
第一步:转录整段视频
处理完整文件,而不是你以为需要的那几段。你没读过的录制,挑不出好片段。
有两个选项值得刻意设置:
- 说话人分离(
diarize):访谈和圆桌讨论中不可或缺。知道每句话是谁说的,才能从普通引语中找出真正值得保留的嘉宾观点。 - 纠正词表:提前列出模型容易听错的词,常见的有产品名、人名和行业术语。在转录阶段统一修正,比之后逐个修改字幕文件省事得多。
第二步:按内容挑选片段
读转录稿,找那些能独立成立的片段:有论据的主张、有落点的故事、被干净利落回答的问题。判断标准是:这段内容对没看过原片的人是否说得通。
Highlights 会根据转录内容挑选片段,并返回指定数量的候选。你可以直接填写实际准备发布的条数,例如从网络研讨会中选 10 条,从短访谈中选 3 条,无需再筛选一份没有上限的清单。style 用于说明想找哪类内容;销售型研讨会和喜剧播客对“好片段”的标准显然不同。
把结果当作候选清单,而不是最终决定。模型可以找出内容完整的段落,但哪些适合你的频道,仍应由你判断。
第三步:按完整句子裁剪
自动剪辑是否粗糙,在这一步最容易暴露。只按原始时间戳裁出的片段可能从半个词开始,也可能在意思说完整之前结束,让人一看就知道是随手截取的,后续再怎么包装也难以补救。
Video Trim 接收起止时间和转录文本,并把两个切点移到最近的完整句子边界。你只需给出大致位置,系统会找到准确边界。这样既能根据文字快速粗选,也能得到开头和结尾都很完整的片段。
第四步:调整为竖屏
如果把 16:9 视频固定从正中央裁成竖屏,说话人一侧身就可能有半张脸移出画面。Video Reframe 会分析关键帧、定位人脸,并选择能在镜头变化中跟随主体的裁剪区域。
需要说明的是:它寻找并跟随的是人脸,再决定画面应该保留哪个区域,并不会判断当前是谁在说话。如果镜头中没有明确主体,例如幻灯片、录屏或铺满全屏的空镜,它会保留完整画面并加上黑边,而不是勉强裁掉内容。
目标画幅比例请按发布位置显式设置。
第五步:添加嵌入式字幕
社交视频大多是静音观看的。没有字幕的片段,多数人还没弄清它讲什么就划走了。
由于转录文件已经准备好,此时使用 Captions 几乎无需额外成本:上传裁好的片段和转录文件,选择一种预设,即可得到字幕已经嵌入画面的 MP4。这样无需依赖平台显示单独上传的字幕文件,因为各平台的呈现方式并不一致,观众也经常不会主动开启。
好片段与随手截取的片段有什么区别
- 一个片段一个想法。 如果需要两句铺垫才能解释这个片段,那铺垫本就该在片段里,或者是这个片段选错了。
- **用最有力的一句话开场,**不要保留之前无关紧要的铺垫。查看转录文本,就能很快找到真正的开场句。
- 让人脸留在画面里——主体飘到边缘的说话头像片段,看上去很随便。
- 不要为了凑数而剪。 一场研讨会剪十条平庸的,效果不如三条好的,而发布成本一样。
- 按完整的想法来切,时长该是多少就是多少。
它和其他环节的关系
整套流程跑通后,同一份转录文件还能用于完整版视频的章节标记、文字摘要和原片字幕。这一点值得纳入成本考虑:转录只做一次,却能支持许多后续任务。
如果你不只是剪辑,还要自己制作源视频,如何用 AI 制作视频讲的是生成这一侧,如何给视频加字幕则更深入地讲字幕的呈现。
动手试试
从现有的一段录制开始。先转录,再让 Highlights 只给出 3 个候选,然后裁剪这 3 段。第一轮的目的,是确认它选出的片段是否与你自己的判断一致。一旦结果吻合,同样的方法也可以处理一小时的素材,只需调整候选数量。
常见问题
怎样把长视频剪成短片?
先转录整段视频,再根据转录文本挑选片段、裁剪和调整画幅。转录文件既记录了说话内容,也标出了每句话的起止时间,因此后续步骤可以自动完成,也不会把一个词剪断。
短片应该多长?
刚好装下一个完整想法,不必更长。实践中通常是 20 到 60 秒。真正的约束不是平台的时长上限,而是这段内容对没看过原片的人是否说得通——所以要围绕一个完整的想法来切,而不是切到固定时长。
为什么我的片段从半个词开始或结束?
因为裁剪只看了时间戳,没有参考说话内容。根据转录文本裁剪时,两个切点会对齐完整句子,让片段从句首开始、在句尾结束。这是成片显得经过认真剪辑,而不是随手截取的关键。
每个片段都要重新转录吗?
不需要。整段录制只需转录一次,之后挑选片段、裁剪、调整画幅和添加字幕都可以复用这份文件。一段 60 分钟的录制只需处理一次,就能供整批短片使用。
怎样把横屏视频变成竖屏又不把人裁掉?
自动调整画幅会分析关键帧,定位其中的人脸,并选择能在镜头变化时把主体留在画面内的裁剪区域,而不是始终从正中央裁切。如果画面里没有明确主体,例如幻灯片、录屏或铺满全屏的空镜,则会保留完整画面并加上黑边。
短片需要字幕吗?
需要。社交平台上的视频经常在静音状态下观看,没有字幕时,观众很可能直接划走。第一步已经生成了转录文件,因此添加字幕几乎无需额外成本;文字会直接嵌入导出的视频,不受各平台字幕显示方式影响。