「把视频剪辑自动化」这句话底下盖着三件完全不同的活,而大部分失望都来自把它们混为一谈。先说清楚你指的是哪一件,这件事本身就占了一多半功夫。
三件活,一个说法
脚本式转换。ffmpeg、moviepy、一个 shell 循环。批量改尺寸、拼接、响度归一、把字幕烧进画面。确定性的,不涉及judgement,而且这条路已经跑了二十年。如果你要的只是这个,那你不需要模型。
一个会规划再执行的 harness。它读你的素材、提出一个剪法,你同意之后再动手。这是新出现的部分,也是本文要谈的部分。
驱动你已经装着的那套剪辑软件。Premiere、Resolve、Final Cut,走各自暴露出来的 API。这条路卡在厂商手里而不是卡在你的工具上:能自动化的范围,恰好等于人家脚本接口允许的范围,而这个范围会随版本变、也会在免费版与付费版之间变。
三件活失败的原因各不相同。一个擅长第一件的工具,并不自动擅长第二件。
剪辑师自己划的那条线
这个话题一起来,值得先读剪辑师自己怎么说——他们比营销话术精确得多。最近 r/VideoEditing 上一个关于 AI 剪辑的帖子里,最高赞的回答讲得很直白:你提供的价值是知道该剪什么,而不是会操作软件。在另一个 DaVinci Resolve 的帖子里,对「AI 被硬塞进剪辑工具」抱怨得最凶的那个人,没人问他,他自己就把线划出来了——转写、抠像、物体移除、音频清理、跟踪、无聊的重复活:没问题,只要省时间。
这就是一份能用的规格说明。机械层可以自动化;决定——剪什么、什么时候剪、哪条take撑得住这个瞬间——不能,而假装能的工具,产出的是你还得返工的东西。
先取证,再下刀
最常见的失败是直接朝结果提要求:「把这个剪成一条高光集锦」。模型没看过素材,它是在从你这句话里推结构。
修这个问题的那一步并不好看。在任何一刀之前,先把文件里真实存在的东西抽出来:
- 带时间戳的转写——多人说话时还要有说话人标注。
- 镜头边界——画面真正切换的位置。
- 静音区间——没人说话的段落,阈值由你定。
- 质量标记——爆音、曝光坏掉的段落、卡住的帧。
到这一步,剪辑表就从一次猜测变成了一次基于数据的决定;而更要紧的是,它可复核——你能在花渲染时间之前,先读一遍某个片段为什么被选中。
规划、批准、装配
把「能用的自动化」和「party trick」分开的第二件事是:计划必须是独立于执行的产物。
具体说:一次运行先产出一份剪辑决策表——每个片段、它的源文件、入点出点、上面叠了什么。你读这份表。批准之后才会有任何东西被渲染。这一拆带来三个后果。出错的代价是读一遍,不是渲一遍。这份表是可 diff 的,所以第二轮改的是四个片段,而不是全部重来。以及,当成片不对时,你分得清是计划错了还是执行错了——这是两种 bug、两种修法。
如果一个工具从提示词直接渲染、中间没有可复核的产物,那它自动化的是猜测,不是剪辑。
哪些自动化不了
- 叙事和品味。同一堆素材,两个剪辑师会讲出两个故事。这个差别就是这份工作本身。
- 任何需要感受现场的判断。哪条更好笑、哪个停顿配得上它的长度。
- 只交付音频、或只交付转写的活。值得明说,因为这是个常见的错配:视频产线不是转写服务,拿它当转写用,结果会比专门的工具差。
成本这件事,照实说
剪辑师提成本比提质量还早,而且他们是对的。任何模型驱动的东西都有单次运行成本,而长素材「看一遍」本身就很贵。把证据抽一次、在多轮之间复用,不只是更整洁——它基本就是「一个你会留下来的工作流」和「一个你在第一张账单之后就弃用的工作流」之间的差别。凡是确定性步骤能解决的地方,就用确定性步骤。
在 Orkas 里怎么跑
Orkas 自带 VideoStudio,它的顺序正好就是上面这套:先从素材取证,再出一份跨模态的剪辑决策表,然后过审批闸,最后确定性装配——画面、叠层、旁白、字幕、响度校验。它是开源的、跑在你自己机器上;而且同一个桌面端还驱动你已经装好的那些编码 CLI,所以一次剪辑运行和一次脚本运行是同一类任务,不是两个割裂的工具。场景走查见视频制作工作流用例。
它刻意不做的事:不交付只有音频或只有转写的产物,也不会在你批准计划之前渲染任何东西。