这套自动化剪辑工作流的核心是:把剪辑中的重复劳动拆成明确指令,交给 AI agent 按固定流程执行。作者以口播视频为例,拆解了从逐字稿到成片的 8 个步骤,最终实现“只需准备好文字内容,就能自动完成配音、分镜、生图、动效、字幕和封面”。
工作流拆解
1. 先准备好文字内容

- 核心前提:搭建自动化剪辑工作流,首要条件不是 AI 工具,而是预先准备好视频创作的本源——文字内容。
- 音画同步原理:视频中的卡通人物动作、Remotion 动画,都与字幕出现的节奏相匹配,实现音画同步。
- 所有生成内容都基于提前撰写好的逐字稿(口播稿)。
- 内容选题没跑通,就无法自动化制作出高质量视频。
选题验证
选题未验证前,不要急着自动化,否则只会放大返工成本。
选题未验证前,不要急着自动化,否则只会放大返工成本。
2. 配音:文字是利剑,声音是剑鞘

- 配音的重要性:文字内容是一把利剑,配音就是剑鞘,只有拥有完整配音,才能满足观众最重要的视听感受中的“听感”。
- 两种配音选择:
- 方案A(真人录制):真实感强,但时间成本更高。
- 方案B(TTS方案):采用成熟的文本转语音技术,更省时省力,可实现自动化。
- 本片方案:在 Codex 等 agent 中接入豆包 TTS 的 API,在工作流指令中明确指定使用豆包 TTS 方案。只需一段指令,即可将逐字稿内容转成指定人物音色,生成语气和情感表达不输真人的配音。
3. 分镜

- 分镜指令:在 Skill 指令中写清楚,后续生图过程中,将每个不重复的画面帧分别保存为单独的图片(PNG 或 JPG)。
- 分镜沉淀的意义:将不同画面帧沉淀成分镜,后续修改优化时,可以更精准地向 agent 提要求,实现精细到逐帧的修改。
分镜沉淀
分镜沉淀非常重要,千万不要图一时方便而放弃这一步。
分镜沉淀非常重要,千万不要图一时方便而放弃这一步。
4. 人物生图
- 人物形象生成:聚焦人物形象生成,可通过 Codex 自带的 Image 2 批量生成。
- 操作步骤:
- 将自己的真人照片交给 Codex,以此为基础生成一张卡通人物母图(如大头 Q 版卡通人物)。
- 母图生成并保存后,在 Skill 中写入指令:凡是涉及卡通人物形象场景的画面,都以这张母图为创作基础,继续延伸人物的表情、动作和场景。
- IP 稳定性:通过“母图锚定 + 动作延展 + 视角延展”,让 AI 稳定输出专属于个人 IP 的卡通人物形象(同一张脸、同一套服装)。
5. Remotion 动效演示页生成

- 动效生成方法:将提前准备好的 HTML/CSS 动效提示词写进 Skill,并对 agent 下达指令:在后续自动化剪辑过程中,都使用 Remotion 来生成以上写入 Skill 的动效。
- 动效驱动原理:利用 Remotion 的按帧驱动(
useCurrentFrame),生成带有律动感的动效演示页,使视频更具吸引力。
6. 输出带字幕的视频

- 字幕指令:在 Skill 中写入指令,输出视频时必须带有声画同步的字幕效果,并对关键词进行高亮处理;字幕带有背景边框,放置在视频底部。
- 自动化效果:后续创作视频时,只需提前准备好文字内容,即可通过这套 Skill 实现自动化剪辑。
7. 主题封面生图

- 封面生成指令:在工作流最后一步,根据逐字稿内容提炼出五个文字标题(每个不超过 10 个字),在选定其中一个标题后,输出一张以卡通人物母图形象为基础的 16:9 视频封面图。
8. 汇总成一套自动化剪辑工作流 Skill

通过以上七个步骤,将明确的指令汇总成一套自动化剪辑工作流 Skill。
知识小结
| 步骤 | 知识点 | 核心内容 | 操作要点/工具 | 难度系数 |
| 第一步 | 输出逐字稿 | 视频创作本源是文字内容,需提前撰写口播稿 | 选题需先跑通,否则无法自动化制作高质量视频 | ★★★☆☆ |
| 第二步 | 配音 | 听觉部分,可选择真人录制或 TTS 方案 | 接入豆包 TTS API,在指令中明确使用指定人物音色 | ★★☆☆☆ |
| 第三步 | 分镜 | 将每个不重复画面帧分别保存为单独图片(PNG/JPG) | 沉淀分镜便于后续逐帧修改优化,不可省略 | ★★★☆☆ |
| 第四步 | 人物生图 | 生成卡通人物母图,以真人照片为参考 | 使用 Codex Image2 批量生成,指令中指定母图为创作基础 | ★★★★☆ |
| 第五步 | Remotion 动效演示页 | 生成 HTML/CSS 动画演示页,增强律动感 | 将动效提示词写入 Skill,使用 Remotion 按帧驱动生成 | ★★★★☆ |
| 第六步 | 输出带字幕视频 | 必须包含声画同步字幕,关键词高亮处理 | 字幕带背景边框,放置在视频底部 | ★★☆☆☆ |
| 第七步 | 主题封面生图 | 根据逐字稿提炼 5 个标题(≤10 字),生成 16:9 封面图 | 以卡通人物母图为基础,选定标题后输出封面 | ★★★☆☆ |
配音方案对比
| 对比维度 | 真人录制方案 | TTS方案(豆包) |
| 时间成本 | 高(需录制、剪辑) | 低(自动化生成) |
| 音质表现 | 自然、情感丰富 | 语气和情感表达不输真人 |
| 适用人群 | 嗓音条件好的创作者 | 追求省时省力的创作者 |
| 自动化程度 | 低 | 高(可嵌入工作流) |
© 版权声明
THE END

![子比主题 – 文章标题前角标扫光样式[优化版]-小妖客栈](https://xykz.cn/wp-content/uploads/2025/02/20250219161210627-image.gif)










暂无评论内容