自动化剪辑工作流:从逐字稿到成片的 8 个关键步骤

  • 作者三尺剑妖
  • 发表于2026-08-28
  • 更新于2026-08-28
  • 该文章1,855 字
  • 阅读需7 分钟
  • 热度值25
  • 0 条评论

自动化剪辑工作流:从逐字稿到成片的 8 个关键步骤

这套自动化剪辑工作流的核心是:把剪辑中的重复劳动拆成明确指令,交给 AI agent 按固定流程执行。作者以口播视频为例,拆解了从逐字稿到成片的 8 个步骤,最终实现“只需准备好文字内容,就能自动完成配音、分镜、生图、动效、字幕和封面”。

工作流拆解

1. 先准备好文字内容

视频配图
  • 核心前提:搭建自动化剪辑工作流,首要条件不是 AI 工具,而是预先准备好视频创作的本源——文字内容。
  • 音画同步原理:视频中的卡通人物动作、Remotion 动画,都与字幕出现的节奏相匹配,实现音画同步。
  • 所有生成内容都基于提前撰写好的逐字稿(口播稿)。
  • 内容选题没跑通,就无法自动化制作出高质量视频。

2. 配音:文字是利剑,声音是剑鞘

视频配图
  • 配音的重要性:文字内容是一把利剑,配音就是剑鞘,只有拥有完整配音,才能满足观众最重要的视听感受中的“听感”。
  • 两种配音选择
  • 方案A(真人录制):真实感强,但时间成本更高。
  • 方案B(TTS方案):采用成熟的文本转语音技术,更省时省力,可实现自动化。
  • 本片方案:在 Codex 等 agent 中接入豆包 TTS 的 API,在工作流指令中明确指定使用豆包 TTS 方案。只需一段指令,即可将逐字稿内容转成指定人物音色,生成语气和情感表达不输真人的配音。

3. 分镜

视频配图
  • 分镜指令:在 Skill 指令中写清楚,后续生图过程中,将每个不重复的画面帧分别保存为单独的图片(PNG 或 JPG)。
  • 分镜沉淀的意义:将不同画面帧沉淀成分镜,后续修改优化时,可以更精准地向 agent 提要求,实现精细到逐帧的修改。

4. 人物生图

  • 人物形象生成:聚焦人物形象生成,可通过 Codex 自带的 Image 2 批量生成。
  • 操作步骤
  • 将自己的真人照片交给 Codex,以此为基础生成一张卡通人物母图(如大头 Q 版卡通人物)。
  • 母图生成并保存后,在 Skill 中写入指令:凡是涉及卡通人物形象场景的画面,都以这张母图为创作基础,继续延伸人物的表情、动作和场景。
  • IP 稳定性:通过“母图锚定 + 动作延展 + 视角延展”,让 AI 稳定输出专属于个人 IP 的卡通人物形象(同一张脸、同一套服装)。

5. Remotion 动效演示页生成

视频配图
  • 动效生成方法:将提前准备好的 HTML/CSS 动效提示词写进 Skill,并对 agent 下达指令:在后续自动化剪辑过程中,都使用 Remotion 来生成以上写入 Skill 的动效。
  • 动效驱动原理:利用 Remotion 的按帧驱动(useCurrentFrame),生成带有律动感的动效演示页,使视频更具吸引力。

6. 输出带字幕的视频

视频配图
  • 字幕指令:在 Skill 中写入指令,输出视频时必须带有声画同步的字幕效果,并对关键词进行高亮处理;字幕带有背景边框,放置在视频底部。
  • 自动化效果:后续创作视频时,只需提前准备好文字内容,即可通过这套 Skill 实现自动化剪辑。

7. 主题封面生图

视频配图
  • 封面生成指令:在工作流最后一步,根据逐字稿内容提炼出五个文字标题(每个不超过 10 个字),在选定其中一个标题后,输出一张以卡通人物母图形象为基础的 16:9 视频封面图。

8. 汇总成一套自动化剪辑工作流 Skill

视频配图

通过以上七个步骤,将明确的指令汇总成一套自动化剪辑工作流 Skill。

知识小结

步骤知识点核心内容操作要点/工具难度系数
第一步输出逐字稿视频创作本源是文字内容,需提前撰写口播稿选题需先跑通,否则无法自动化制作高质量视频★★★☆☆
第二步配音听觉部分,可选择真人录制或 TTS 方案接入豆包 TTS API,在指令中明确使用指定人物音色★★☆☆☆
第三步分镜将每个不重复画面帧分别保存为单独图片(PNG/JPG)沉淀分镜便于后续逐帧修改优化,不可省略★★★☆☆
第四步人物生图生成卡通人物母图,以真人照片为参考使用 Codex Image2 批量生成,指令中指定母图为创作基础★★★★☆
第五步Remotion 动效演示页生成 HTML/CSS 动画演示页,增强律动感将动效提示词写入 Skill,使用 Remotion 按帧驱动生成★★★★☆
第六步输出带字幕视频必须包含声画同步字幕,关键词高亮处理字幕带背景边框,放置在视频底部★★☆☆☆
第七步主题封面生图根据逐字稿提炼 5 个标题(≤10 字),生成 16:9 封面图以卡通人物母图为基础,选定标题后输出封面★★★☆☆

配音方案对比

对比维度真人录制方案TTS方案(豆包
时间成本高(需录制、剪辑)低(自动化生成)
音质表现自然、情感丰富语气和情感表达不输真人
适用人群嗓音条件好的创作者追求省时省力的创作者
自动化程度高(可嵌入工作流)
© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容