从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流

写作时间:2026年8月

最近开始做AI自媒体,因为之前基本没碰过视频剪辑,我发现自己一点镜头感都没有,一到视频拍摄就卡住。录完一条口播,光是听自己说了多少个"然后""就是""那个"就头大,更不要提剪辑画面了。

找人剪?一条三分钟口播加动画图解、B-roll、字幕,随便都是钱,更何况 AI 时代剪辑肯定不能自己来,对吧?

所以我花了大概 3 天的时间,用Claude把最近爆火的ChatCut蒸馏成skill,一点一点搭了一条ai 剪辑生产线。从录完口播到出成品,中间90%的工作交给AI。

下面不说概念,就说我实际踩了哪些坑、最后怎么跑通的、哪些你可以直接用。

先说结果,这条产线能干什么

我现在做一条口播视频的流程大概是这样的,

1. 对着手机讲2-5分钟(目前还是需要提词器,做不到脱稿)

2. 把视频丢给 codex,自动转录文字、标记口误、生成审核网页,我在网页上勾选要删的部分,这是

第1个需要人工的地方

3. 点一下导出FCPXML,口播的A-roll就剪好了

4. codex自动生成分镜表,每几秒该看什么、为什么要换画面、用什么素材,全写清楚,发到飞书文

档让我审核,这是第2个需要人工的地方

5. codex根据分镜表生成动画HTML,数字滚动、流程图解、关键词浮层,录屏就能当B-roll用,或者

把截图路径写到飞书文档中的评论,这是第3个需要人工的地方。为什么不做视频,主要还是为了

节省成本。

6. 合成出片

整套流程从转录到出分镜表,大概10-15分钟。后面的动画生成看复杂度,大概30-60分钟能跑完,主要是最近赛博义父 tibo 一直按重置键,用的人太多,导致 codex干活比较慢。我实际要动手的就三块,录口播、审分镜、录真实素材(截图/录屏),加起来大概 15-20 分钟。

发出去几条之后的数据分析

流程跑顺之后,我连着发了几条,抖音和视频号两个平台一起铺(同样的视频,小红书小眼睛只有1)。发了几天再看后台数据,几个数字挺出乎我意料。

1 触达根本不缺。视频不是"没人看见",抖音近7天的播放量超过同类作者93.95%,视频号超过74.5%。平台愿意给量,能刷到的人不少。

2 发的条数一多,有个数字把我之前的判断细化了。视频号后台能拆出一项"3秒以上播放率",我的是48%,超过同类21%,等于说开头那几秒其实留住了小一半人,没我想的那么糟。可完播率只有4.2%,平均播放时长10.6秒,片子明明有一分多钟,大部分人看到十来秒就走了。所以需要优化的地方不在开头,是3秒之后的中段,加上片子太长。光改开头钩子不够,得动刀片长和中段节奏。

我之前纠结的那些"动画够不够精致""配色好不好看",观众根本没看到那一步就走了。真正该改的是开头节奏和片长,不是画面品质。没数据的完美主义就是在浪费时间。

3 平台差异值得记一笔。同样一条片子,视频号的完播率和平均播放时长都比抖音明显好,平均时长还在往上走,比上周涨了25%。我猜是两边观众不一样,视频号的人更坐得住,另外视频号的观众熟人居多。所以接下来我打算分平台来,长一点、讲得深一点的放视频号,抖音这边砍短、把节奏提快。

4 互动是另一个短板。抖音的互动率1.6%,同类作者有9.1%,差一大截。我的片子基本没设计"看完扣个1""你怎么看"这类小钩子,观众看完就划走了。还有一条被限流了,但是用 ai 助手查了下没有问题,原因还得再研究下。

这件事是怎么开始的

这几天一个叫ChatCut的AI视频剪辑工具突然火了。它的卖点是"用自然语言指挥AI帮你剪视频"。你跟它说"把口误删掉",它就删,说"在这里加个图解",它就加。

第一眼看到挺兴奋,这不就是我想要的吗?

但小试了一下发现两个问题:

•它是云端产品,按积分收费。 生成一段5秒的视频要3个积分,一张图0.2-0.6个积分,音乐、配

音、MG动画也都要积分。一条稍微复杂点的视频,积分花销比找人剪还贵。最扯淡的是我试着剪

辑了一个 2 分多钟的视频,在导出的时候提示我积分不足需要充值,视频只能看不能用。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

•它的"剪辑判断"全靠prompt约束,没有代码级的门禁。它也会犯错,麻烦的是犯了错之后你很难

查出来在哪里。

但我没有白试。ChatCut的整个插件协议都是公开的,它跟AI的交互走的是MCP(Model Context Protocol),skill文件和工具定义都能看到。

我做了一件当时觉得有点疯的事,用Claude的Fable和最新的 GPT5.6 sol模型把它的架构全部分析了一遍。

README只是个入口,它的16个skill文件、40多个MCP工具定义、双宿主适配层,我一个个读完了。Claude Fable5是目前我用过分析代码最厉害的模型。我不是程序员,让我自己看那些JSX和JSON定义完全是天书,但Fable能把架构逻辑用我听得懂的中文解释清楚,然后把结果让 codex 再进行评估,交叉验证。

这次分析最有价值的发现有三个。

第一,ChatCut的口播清理分了两步。 先跑一个叫 clean_script 的工具做机械清理(固定口癖词表+静音压缩),然后必须重新读一遍再做语义编辑。"去口癖"和"判断这句话该不该留"是两回事,不能一口气做完。这个发现直接影响了我后来skill的设计。

第二,它的编辑界面是markdown文件,不是JSON。 口播转录的结果被物化成 timeline.md ,删词就是打删除线,挪句就是移动行,最后一个 apply_script 命令把改动落回时间线。这个"人类可读的中间格式"的思路,比直接操作JSON舒服太多了。

第三,它有一套"观众任务"框架。 每次换画面之前,都得先回答一个问题,观众此刻需要什么帮助。是要理解抽象概念,想看到关键数字,还是需要真实证据?答不出来就不换。这套思路后来成了我分镜skill的核心逻辑。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

另一块拼图:GitHub上的AI剪口播skill

拆完ChatCut之后我没有直接抄它,而是去找有没有现成能跑的口播处理工具。

在GitHub上翻到一个剪口播的skill,它做的事情很简单:

1. 调用火山引擎的语音识别API做转录,精度比剪映好不少

2. 用AI逐句分析哪些是口误、哪些是重录、哪些只是说话习惯

3. 生成一个网页,你可以在上面一句句试听、一键勾选删除

4. 导出FCPXML文件,拖进Final Cut Pro或剪映就是剪好的时间线

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

我把它装进Claude Code,试了一下,这东西真好用。它对口癖的判断有一套判据,"这个'然后'是垫话还是承担了顺序关系?删了会不会让前后句硬拼?拿不准就留。"它不会简单粗暴地把所有"然后""就是"全删掉,是一个个判断的。

但它只解决了口播清理这一步。剪完A-roll之后画面怎么做、分镜怎么规划、动画怎么生成,这些它都没解决。

把拼图拼起来

有了ChatCut的方法论和GitHub上的转录skill,剩下就是把它们串起来。

第一段:口播清理

录完口播 → 火山引擎转录 → AI分析口误 → 网页审核 → 导出FCPXML

这一段基本是现成的,装好skill跑就行。唯一踩的坑是火山引擎的模型API太多了,搞了半天才搞清楚。另外转录结果对方言和专业术语偶尔有误,需要在审核网页里手动改。

我自己试下来的体验,一条3分钟的口播,从开始处理到导出FCPXML,大概5-8分钟。 其中AI处理要2-3分钟,剩下的时间是我在网页上快速过一遍、确认没有误删。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

我实际在用的审核网页:196处AI预选,勾选确认后一键导出FCPXML

第二段:分镜规划(飞书表格审稿)

FCPXML导出之后,拿到的是一条剪好的A-roll时间线。下一步是规划画面,每几秒该看什么。

这一段我做了一个skill叫"口播分镜",核心逻辑来自ChatCut分析里提炼的"观众任务"框架。

简单说就是六种情况,对应不同画面处理:

观众此刻需要什么首选手段

没有明确需求留真人知道讲到哪了(章节感)小节标签

看到关键词/数字关键词浮层

理解抽象概念/流程图解动画

看到真实证据截图/录屏

视觉呼吸(节奏调节)景别变化

这张表看着简单,但确实帮我想通了一个一直纠结的事,到底什么时候该换画面。以前全凭感觉,现在有依据了。

以前我看别人的口播视频总觉得"画面好丰富",自己做的时候就乱加,这里加个图,那里放个截图,最后出来的效果既杂又乱。用了这套框架之后,每一次画面切换都有理由,没理由的就留真人。

分镜表长什么样? 以我实际做过的一条90秒口播为例,出来的是一张飞书表格:

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1
从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

这张表会自动生成到飞书文档里,我在飞书上审。哪一拍觉得不对,直接在飞书里写评论,AI收到评论后只改那一拍,不动其他的。

这套飞书审稿的做法,是从一个叫张咋啦的创作者那里学的。 她做video essay,分镜表就是一张飞书表格,每一栏写清楚画面方案、素材来源、待定事项,协作者在表格里直接审。我把这个思路迁移到了口播场景,效果很好,比在 codex/claude里发截图讨论清晰太多了。

第三段:动画生成

分镜表里标了"HTML动效"的,由另一个skill来生成,它把分镜表里的文字描述转成可录屏的16:9动画HTML。

举几个例子,

•"数字从0滚到 3" → 一段CSS动画,数字匀速滚到位后停住•"消息流压缩成一页报告" → 几个消息气泡从两侧飞入,最后聚合成一本"手册"

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

分镜表里生成的时间对比动画(GIF预览)

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

实际B-roll帧——嵌入真实剪映截图作为画中画

技术上这些动画都是纯HTML+CSS+GSAP(一个动画库),在浏览器里打开就能看到效果,录屏之后就是可以直接用的B-roll。

为什么不用Canva/剪映的动画模板? 两个原因,

1. 模板是死的,AI生成是活的。模板只能改文字和颜色,AI能根据你的内容定制布局、动画节奏、数

据展示方式

2. 一旦调好了风格,后面所有视频都能自动套用。第一次花时间多,之后每条视频的动画生成都是几

分钟的事

当然缺点也很明显,现阶段这些动画的视觉品质比不上真正的After Effects做出来的。 对我来说够用了,但如果你追求品牌级的精致度,这条路暂时实现不了

下面这张图是调试时的验证画面。之前有一版翻车了,动画标题直接压到抖音的头像区,发出去观众根本看不到关键信息。后来加了安全区参考框,检查文字有没有被平台UI挡住才算过关。这种坑不踩一次真想不到。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

验证通过——三列布局避开头像区,安全区标注清晰

花钱买来的教训

"A-roll一改,下游全废"

这是最贵的一条教训。口播剪完之后我又回去改了一句话的顺序,结果分镜表的时间点全错了。分镜是基于剪后时间线做的,你一动A-roll,所有拍的起止时间全变。

后来我把这条写成了硬规则,口播剪辑定稿之前,绝对不开始做分镜。 就像盖房子,地基不稳,上面盖得再漂亮也得拆。

给AI立规则,别只下指令

刚开始用的时候,我给AI的指令是"帮我规划分镜",出来的东西一塌糊涂。要么每句话都换画面(密得人头晕),要么该换的地方不换,不该换的地方乱换。

后来我发现ChatCut之所以好用,是因为它的skill文件里写满了各种判断规则。什么情况下该留真人、什么情况下必须上真实截图、什么情况下可以用动画,每一条都有判断的依据。

所以我也跟着要求,观众任务六分类、锚点词扫描规则(只许名词进入锚点,动词不行)、载体选择的最小手段梯。其实吧,这些规则就是画框,框里随便发挥,框外不许去。框画得越清楚,AI反而越不容易乱来。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

不要让AI生成的东西冒充真实素材

ChatCut的插件里有一句话很重要,AI生成的图片不进evidence角色。

就是说要放真东西的时候,产品截图、操作录屏这些,必须用真的。AI画的再像,观众看得出来不对劲。

我现在给自己定了一条规矩,要证明什么东西只用真实素材,AI生成的动画只管辅助理解和强调重点。

飞书审稿效率高很多

之前分镜的效果,要视频合成后才能看到,既浪费 token 又浪费时间。刚好看到张咋啦用飞书表格做分镜表,直接借用过来刚刚好,只不过她的方案是上下双屏,我的设计是用来写 A/B-roll。

换成飞书表格之后,每一拍的画面方案、素材缺口、修改意见全在一行里,一眼就能看到哪些OK、哪些需要改、改什么。AI处理评论之后只改被点名的地方,不动其他的。这条很重要,防止"改一个拆一片"。

普通人能不能复制?

先说门槛。

技术门槛比你想象的低,但不是零。 你不需要会写代码,但你需要会用ai工具,比如 codex/claude。

认知门槛比你想象的高。 最难的不是"怎么用工具",反而是"你要什么效果"。你得知道一条好视频长什么样、分镜节奏怎么把握、什么时候该上画面什么时候该留真人。这些AI替不了你,只能放大你已有的判断力。

时间门槛,第一次搭起来要花1-2天。 装环境、配API、调规则、跑第一条片子。之后每条视频就是一两个小时了。

额外费用门槛几乎为零。 火山引擎的语音识别有免费额度,Claude/codex用订阅套餐,飞书免费,HTML动画不花钱。跟外包剪辑比,这个成本可以忽略不计。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

火山引擎语音识别的订单记录,全部0元

什么样的人适合试?

•个人创作者,想做口播视频但卡在剪辑环节。 录完之后不知道怎么处理,也不想花钱找人剪•小团队,每月有稳定的内容输出需求。 一条视频省300-800块,一个月省几千块•对AI工具有基本使用经验。 不一定要会代码,但至少用过ChatGPT/Claude/Cursor之类的

踩过的坑

坑1:火山引擎注册。 需要企业认证或个人实名,api key 的使用也有点麻烦, 很反人类,即使你把文档丢给 ai,也需要花点时间。

坑2:时间轴不要混。 口播的原始录音有一个时间轴,剪辑后有另一个时间轴,两者可能差十几秒。分镜必须用剪后时间轴,用错了全片画面错位。我第一次做就犯了这个错,改了一整个晚上。

坑3: AI 的方案还是要去看,如果看不懂就让它给出解释,我的方法就是跟AI说,说人话。就像小排老师说的,claude 是 CEO,codex 是 CTO。一开始claude 做的方案,我直接丢给 codex 去执行,没认真看,导致后面慢慢路线就出现了偏离。

从口播到成片:我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流 配图1

坑4:不要一上来就追求完美。 我第一条视频用这套流程做了快一周,中间不停调规则,现在想想真是浪费时间,一个跟我一起做视频的圈友视频已经发了好多条了,我还一直在调试。一开始出来的东西肯定不如专业剪辑师,但够发了。发出去看数据,有数据再优化,没数据的完美主义就是在浪费时间。

下一步打算做什么

目前这条产线能相对稳定的出片,但还有几个方向想探索:

1. 音效层。 现在的视频是纯口播+背景音乐,没有转场音效、打字音效这些。这些细节对完播率影响

很大,但好的音效素材库还没建好。

2. ChatCut的云端剪辑我会接着盯。 虽然现在积分太贵不适合高频用,但它的实时协作和云端渲染能

力确实强。如果它以后降价了,我可能会把一部分本地流程搬过去。最新看到的是 chatcut 插件可

以在 claude 中使用,不涉及到 api 的不会消耗积分。

3. 把流程做成可分享的SOP。 现在还是"我自己能用"的状态,要让别人跟着搭起来,还得写更细的教

程。

写在最后

分析完架构我才明白,工具智不智能其实不关键,更重要的是背后那套判断规则。回头想想,最庆幸的一个决定是,没有直接抄ChatCut,先拆解它的思路,再自己搭。

ChatCut的16个skill文件、几万字的规则文档,这些才是它真正值钱的东西。模型会迭代,工具会过时,但"什么情况该怎么处理"这套判断,这个淘汰不掉。

我一开始就应该先拍5条视频发出去看数据,调产线的事往后放。 因为很多时候我纠结的"视觉品质"问题,观众根本不在意,他们在意的是内容有没有用、节奏是不是舒服。

所以我的建议是,先把手边的AI工具用熟,弄清楚自己做视频卡在哪一步,再来搭产线。 如果你录完视频不知道怎么处理,这篇文章里的流程拿去就能用。如果你连录都还没录,那先录起来,剪辑的事后面有的是办法解决。

最后说一下我对这套东西的定位。我做它,图的就是两件事,一个是把剪辑效率提上来,本来一条视频要折腾大半天,现在录完丢给 AI,人工部分只剩十几分钟;二是让 AI 剪出来的东西质量稳定,别这条行那条不行。它不是拿来跟专业剪辑师拼精致度的。

视频我也是最近才开始发,数据还少,谈不上什么经验,这套流程远没到定型。我现在就是把它当成一个会一直改的半成品,能提效、能稳定出片,对这个阶段的我就够了。哪里该继续优化,等数据多了自然会知道,不急着一步到位。

最后附上视频制作效果,陆续完善中,大家轻喷:

7.99 复制打开抖音,看看【阿甘玩 AI的作品】不懂代码,我也用Codex搭出了会自己长大的Obs… https://v.douyin.com/OZ6FgYpDJkw/ [email protected] pQX:/ 02/11 :1pm

相关阅读

© 版权声明
THE END
喜欢就支持一下吧
点赞11 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容