用 Codex + Remotion 实现直播切片自动化:把剪切片变成一条生产线
直播切片不是“让 AI 从逐字稿里挑 5 个高分段落”,而是把整场直播变成一套覆盖完整时间轴、每个判断可追溯、关键结果由人确认的制作流水线。
刷到六水老师@Clara_J_0529需要直播切片工作流的那条帖子后, 我发现评论区里大家对 AI 自动剪辑的兴趣很高。
周末在六水老师同意下,用她的直播录像做了一个直播切片工作流的 demo,也得到了六水老师的肯定。
六水老师对直播切片工作流 demo 的反馈
下面分享一下我在制作过程中的心得。
第一版的问题:只筛了 5 个预选区间
我第一版上来就犯了一个错误。

第一版工作流存在漏审风险
刚开始没想到六水老师的直播信息密度太大,以至于我最开始设置的是让系统给我做 5 个切片。
结果发现,因为我开始时的表述不准确,Codex 并没有遍历全部时间轴,选出所有满足评分的片段再排序,而是人工预选了 5 个子区间,再从中筛选出 5 个片段。
修改后,工作流覆盖完整时间轴并保留全部高分候选
最终,将近1 小时的直播录像粗筛出 33 个区间,按主题和 50% 时间重叠去重后保留 20 个候选片段。可见六水老师的直播信息密度确实很高,全程都有内容。
视频剪辑首先要确定基准时间轴
传统剪辑软件以时间轴为基础进行剪辑,AI 剪辑也一样要找到一条不变的时间轴。对于口播视频来说,这条基准时间轴就是原片和音频。
完整流程

四个角色如何分工
- Whisper.cpp:生成带时间码的逐字稿。
- Agent:理解、评分、记录证据、推荐候选与切点。
- 人:批准内容、切点、视觉和标题。
- Remotion:预览已经作出的决定并渲染视频。
工作流为什么必须有人参与
说个反常识的点,很多人认为工作流一定要做成一键出片等全自动形式才行,其实不然,工作流一定要有人参与进来。
人工参与的核心价值是:
- 内容价值不能只由分数决定。
- 切点会改变原话语义。
- 冷开场可能制造误导。
- 竖屏裁切可能遮挡人物和信息。
- 标题可能夸大实际内容。
把“高光”变成可量化的切片规则
直播切片最重要的一点,就是教会 AI 如何识别精彩片段。你需要把自己对精彩片段的理解,拆分、抽象成 AI 可以量化的规则。
这里我设置了口播精彩片段的判断标准。每个候选片段按以下 6 个维度评分,并保存证据:
- 内容完整度 30 分:单独观看能理解前因、观点和结论。
- 信息价值 20 分:包含方法、结论、案例、反常识或明确回答。
- 开头吸引力 20 分:前 3-5 秒存在问题、冲突、结果或强判断。
- 情绪与表达 10 分:表达集中、有态度、有明显情绪变化。
- 可剪辑性 10 分:起止点完整,没有切断词语或关键上下文。
- 平台适配度 10 分:能在目标时长内成立,字幕和画面可读。
这套规则需要根据视频类型进行相应修改,不能用一个模板覆盖所有内容。
为什么用 Remotion,而不是 HyperFrames
直播切片使用 Remotion,核心不是为了“动效更炫”,而是为了守住一条可审核的视频时间轴。
简单列一下两者的不同:

所以,Remotion 与 HyperFrames 不是谁更高级,而是分工不同:
- 直播切片、口播、录屏、字幕同步、可回放审核:Remotion 做主引擎。
- 不依赖真实素材的纯动画片段,例如片头、数据可视化、概念演示:HyperFrames 可以单独制作,最后作为一个已确认的视频素材交给 Remotion 拼入成片。
把一次剪辑沉淀成可复用工作流
完成工作流后,再让 Codex 沉淀这次可以复用的内容。例如,时间轴、审计和确认机制可以固定;裁切、字幕、节奏和模板则要根据视频类型制作多个版本。
最后把这些内容整理为模板规则,方便 Agent 下次工作时直接读取。
总结
真正值得自动化的,是转录、覆盖扫描、评分记录、派生母版和渲染。
不能交给自动化的,是内容价值、切点和最终效果的确认。
来源:@Jasper_Wei1 · 发布于 2026-07-20 23:39:18 · 原文链接