如何制作 AI 视频:从提示词到成片
从编写脚本和分镜清单开始,生成短视频片段并配上音频,最后添加字幕和品牌元素,完成一支 AI 视频。
作者 Pipe2.ai · 更新于 July 10, 2026
制作 AI 视频时,应把 AI 生成看作创建镜头的过程,而不是用一条提示词取代完整的剪辑流程。先确定信息和格式,编写脚本和分镜清单,为每个镜头生成短片段并检查结果,再将通过审核的片段与单独提供的旁白或音乐组装起来,最后添加字幕和品牌元素。在 Pipe2.ai 中,这套流程分别对应 Script Writer、Video Generator、Video Reel、Music Generator、Captions 和 Watermark。
工作流核查 — 2026 年 7 月: 本指南中的输入、输出、路由和组装行为已根据 Pipe2.ai 当前的目录架构和 Worker 工作流进行核对。这里记录的是制作方法,并不表示我们进行了跨模型画质基准测试。
从成片目标出发
在编写提示词之前,先明确希望观众看完后理解什么或采取什么行动。一份实用的创作简报应说明:
- 目标受众和唯一的核心信息
- 计划发布的平台和画面比例
- 成片的大致时长
- 视频是否需要旁白、音乐、仅供片段单独使用的原生场景音频,或者静音
- 需要保持一致的产品、人物、颜色或视觉识别
- 最终的行动号召
生成镜头前先选择输出格式。即使主体相同,竖屏社交视频和横屏产品演示所需的构图也不同。所有镜头保持同一画面比例,还能减少组装时出现的意外。如果计划使用 Video Reel,请把旁白和音乐准备成独立音频素材:组装步骤不会保留源片段中嵌入的音频。
当前的 Video Generator 适合生成短片段,而不是一次产出完整的多场景剪辑。把成片创意拆成若干镜头,每个镜头只表达一个动作或视觉节拍。
把创意整理成脚本和分镜清单
如果你只有一个主题,还没有完整方案,可以使用 Script Writer。它会返回结构化的制作蓝图,包括章节、旁白、视觉方向、音频计划和组装备注。这个步骤只负责规划,不会生成媒体素材。
在开始生成前先检查蓝图。把每个章节归纳为四项可执行内容:
- 旁白或屏幕信息: 观众要在这个镜头中了解什么
- 视觉主体和动作: 画面中必须出现什么
- 镜头用途: 开场、说明、演示、转场、证据或行动号召
- 连续性备注: 需要延续到下一镜头的外观、环境、灯光、运动方向和物体
删除重复表达同一观点的镜头。如果一条提示词包含多个地点、动作和镜头变化,就把它拆成更小的镜头。简短、聚焦的生成结果更容易评估和替换,也比在复杂段落中只保留一个可用瞬间更高效。
把提示词写成镜头简报
实用的 AI 视频提示词应描述镜头能看到和听到什么。Google 当前的 Veo 提示词指南建议先确定主体、动作和风格,再按需补充机位或运镜、构图、焦点、镜头效果和氛围等细节。
可以从下面的结构开始:
环境中的主体和动作。构图和运镜。灯光和视觉风格。仅在生成片段将单独使用时加入相关声音提示。
例如:
一个哑光黑色旅行杯在浅色石桌上缓慢旋转,晨光掠过杯身。中景产品镜头,镜头轻柔推进,浅景深,干净的商业广告灯光。旅行杯停下时伴有轻微的室内环境声和安静的陶瓷轻触声。
提示词要具体,但不要堆砌相互冲突的要求:
- 只给主体安排一个主要动作。
- 使用明确的影视语言描述运镜。
- 说明环境以及时间或灯光条件。
- 如果生成片段会单独发布,把必须出现的台词或声音写成独立句子。如果要用 Video Reel 组装,请把最终旁白或音乐制作成独立音频。
- 如果外观或动作是简报的一部分,请添加模型支持的参考素材,并检查结果是否真正遵循了关键属性。
- 如果文字必须准确,不要依赖运动镜头中生成的文字;发布前逐字检查所有可见内容。
每次生成并检查一个镜头
把审核通过的每份镜头简报分别交给 Video Generator。整组素材要保持统一的画面比例和重复出现的视觉细节。按镜头编号命名或整理输出,以便明确组装顺序。
根据简报逐项检查每个片段,不要只因为画面夺目就直接接受。检查以下问题:
- 是否出现了要求的主体、动作、环境和镜头方向?
- 人脸、产品、手、物体和背景在整个镜头中是否连贯?
- 开头能否自然衔接上一个镜头?
- 结尾是否适合剪切或转场?
- 如果片段要单独使用,是否出现了意外的文字、标志、物体或声音?
- 如果提供了参考素材,它是否影响了真正重要的属性?
只重新生成有问题的镜头,不要重做整段视频。如果提示词反复偏离目标,就简化动作或拆成两个镜头。关于不同模型支持的输入和路由规则,请参阅 AI 视频生成器对比;本文只聚焦制作流程。
组装通过审核的片段
使用 Video Reel按预定顺序放入通过审核的片段。该管线接收有序的视频片段,以及可选的旁白和背景音乐音频,然后渲染为一支视频。它只使用每个片段的视频流,不会保留其中嵌入的音频。所有最终需要的对白、配乐或其他声音,都必须通过独立的 Narration 和 Background Music 输入提供。Instructions 可以指导蒙太奇风格,Target Aspect 则让组装结果与计划的输出比例保持一致。
完整观看一次结果,检查节奏。单独看很精彩的片段,接在下一个镜头前仍可能显得过长。确认开头几秒是否交代了主体、每个镜头是否带来新信息,以及最后一个镜头是否给行动号召留出了足够的识别时间。
如果视频包含旁白,请使用原始配音文件或创建独立的旁白素材,并在最终组装前对照镜头顺序检查文案。画面变化应该支撑句意,而不是打断关键短语。
添加服务于剪辑的音乐
Music Generator会根据情绪或曲风描述和所需时长生成原创音轨。不要只写“励志音乐”之类的宽泛标签,应说明乐器、速度、能量和情绪走向。
需要保持旁白清晰时,请选择纯音乐方向,并说明音乐只是辅助性的底乐。把生成的音频作为 Video Reel 的 Background Music 输入,然后分别用耳机和手机扬声器试听组装后的结果。不要只根据音乐文件本身判断混音效果。
用字幕和水印完成制作
在画面和声音组装完成后,再添加发布所需的元素。
Captions需要成片和 SRT 字幕文件。先检查 SRT 中的名称、术语、标点、换行和时间码,再选择字幕样式与位置。字幕会烧录到视频画面并输出新的 MP4。关于分两步完成 SRT 字幕的流程,请参阅给视频添加字幕的完整指南。
在字幕和画面比例调整完成后,使用 Watermark。它接收成片和标志图片,并提供角落位置、大小、边缘距离和不透明度设置。在明亮和昏暗画面上都要检查标志,确保它不会遮挡字幕或主要主体。视频水印指南详细介绍了标志准备和位置选择。
发布前检查完成的 AI 视频
在目标设备和平台上从头到尾观看导出的视频,并确认:
- 开头能迅速说明主题。
- 每个镜头都在推进核心信息。
- 不同剪辑之间的视觉识别和运动方向足够连贯。
- 单独提供的旁白和音乐不会相互争抢。如果生成片段不经过 Video Reel 而直接发布,还要检查其原生场景音频。
- 字幕与口播一致且容易阅读。
- 水印清晰可见,又不会遮挡重要内容。
- 没有遗留意外文字、标志、人脸或画面瑕疵。
把脚本、提示词、参考素材、通过审核的片段、旁白、音乐、SRT 和未加水印的母版保存在一起。有了这份制作记录,就能替换某个镜头、本地化旁白或制作其他画面比例,而不必从头重做整支 AI 视频。
常见问题
制作 AI 视频最简单的流程是什么?
先确定核心信息和输出格式,把创意整理成脚本和分镜清单,再为每个镜头生成一个短片段。将通过审核的片段组装起来,添加旁白或音乐,最后按需加入字幕和水印。
AI 视频提示词应该包含哪些内容?
描述主体、动作、场景、构图、运镜、灯光和视觉风格。每条提示词只聚焦一个可以实现的镜头。只有在单独发布该片段时才需要描述声音;Video Reel 不会保留源片段中嵌入的音频,因此组装后的视频需要单独提供旁白或音乐。
一条提示词能生成完整的 AI 视频吗?
一条提示词可以生成短片段,但要稳定地制作多场景视频,最好先将其规划成独立镜头。逐个生成并检查镜头,再用 Video Reel 按顺序排列通过审核的片段。
可以给成片添加 AI 生成的音乐吗?
可以。Music Generator 能根据情绪或曲风描述生成音乐。使用 Video Reel 组装片段时,可将其音频输出添加为可选的背景音乐输入。
应该什么时候添加字幕和水印?
在视频片段和音频组装完成后添加。Captions 需要成片和 SRT 字幕文件,会把文字烧录到画面并输出新的 MP4;之后再添加水印,就能按照最终画面尺寸定位。