AI 视频的标价很容易查到——每秒几分钱,用轻量模型还更便宜。但月底账单上的数字,通常和它对不上。
差额在重试。2026 年公开的成本报道把成片估在每分钟 13 到 220 美元之间,并且明确点名了主导因素:迭代率,而不是每秒单价。一份调查发现 68% 的用户在项目中途就把额度用完了,因为他们预算的是想要的镜头,而不是拿到这些镜头所需的尝试次数。
尝试次数是怎么堆起来的
生成模型在镜头之间没有记忆。用同样的词描述同一个人两次,你会得到两个仅仅长得像的人。有人在多个工具上实测角色一致性,报告说每个镜头需要 15 到 20 次重生成才能拿到勉强能用的结果。复杂镜头——快速运动、多个角色、手部和面部——本身就有 30% 到 40% 的重生成率。
漂移的代价还有一层不容易察觉:当角色在序列中途变了样,而你在八个镜头之后才发现,你要修的不是一个镜头,而是要把断点之后的所有内容重新过一遍。
还有那些什么都没产出的尝试。Kling 用户报告高峰时段有 40% 到 60% 的失败率,供应商论坛里长期堆着「额度扣了、视频没有」的帖子。在大多数额度体系里,失败的生成和成功的生成扣同样的钱。
业界已经公认的做法
各类成本指南里反复出现的建议相当一致,与其当成技巧,不如当成一份清单来读:
- 花钱之前先给这次尝试报价。在第一次计费调用之前就知道镜头数和报价,而不是之后。
- 用便宜的东西先把构图定下来。一张静帧的成本只是视频渲染的零头,先在那里把画面锁定。
- 角色定义一次,之后复用同一份参考。每次都用文字重新描述一个人,正是漂移的来源;存下来的参考不会漂移。
- 镜头不需要的东西就别生成。起止画面几乎一样的镜头,不需要两个关键帧。
- 批次小一点。六个镜头带一个检查点,好过二十个镜头一个检查点都没有。
把它们变成默认行为,而不是靠自律
这份清单上的每一条,细心的人手动都能做到。难的是这五条要在周四下午、第四版返工、客户还等着的时候同时成立——而那恰恰是它们最容易失守的时刻。
这部分被做进了 Orkas 的视频 agent,让清单由流程来保证,而不是靠记性:
- 任何计费调用之前先报价。准确的镜头数和角色数,连同额度估算,摆到你面前等批准。不会自己悄悄铺开。
- 默认每条视频 6 个镜头、3 个角色的上限。超出的部分必须先提出并获得确认。
- 每个角色一个肖像锚点。只生成一次,之后锁定、不再重新生成。后续镜头按规则引用它:优先同机位的最近一帧,其次是更早的帧,最后才是仅用肖像。
- 关键帧按镜头变化程度来花。几乎静止的镜头只用一个关键帧,不用两个。
- 没有真正发到供应商的调用不计费。发出之前的本地失败不消耗任何额度。
这些都不能让第一次尝试每回都成——没有工具做得到,声称做得到的是在描述演示。它改变的是账单的形状:你付钱的那些尝试,是你事先点过头的。
这篇没有覆盖的部分
成本控制止于发布开始的地方。Orkas 能把一条视频从调研、脚本一路带到字幕、封面图和搜索可见性,但往各个平台发布这一步,仍然要你自己做。