“Automatizar a edição de vídeo” cobre três trabalhos diferentes, e boa parte da frustração com o tema vem de misturá-los. Ser específico sobre qual deles você quer dizer já é metade do trabalho.
Três trabalhos, uma expressão
Transformações via script. ffmpeg, moviepy, um laço de shell. Redimensionar uma pasta, concatenar, normalizar loudness, gravar legendas no vídeo. Determinístico, sem julgamento envolvido, e funciona há vinte anos. Se é só disso que você precisa, não precisa de um modelo.
Um harness que planeja e executa. Algo lê seu material, propõe uma edição e a executa depois que você concorda. É essa a parte nova, e é dela que este artigo trata.
Dirigir o editor que você já tem. Premiere, Resolve, Final Cut, pela API que cada aplicativo expõe. Aqui quem manda é o fabricante, não a sua ferramenta: dá para automatizar exatamente o que a superfície de scripting deles permite, e essa superfície muda entre versões e entre a edição gratuita e a paga.
Eles falham por motivos diferentes, e uma ferramenta boa no primeiro caso não é automaticamente boa no segundo.
A linha que os próprios editores traçam
Vale ler o que os editores dizem quando o assunto aparece, porque eles são mais precisos do que o marketing. A resposta mais votada em uma discussão recente no r/VideoEditing sobre edição com IA foi direta: o valor que você entrega é saber o que editar, não operar o software. Em uma discussão paralela sobre o DaVinci Resolve, quem mais reclamava da IA sendo empurrada para dentro das ferramentas traçou a própria linha sem que ninguém pedisse — transcrição, rotoscopia, remoção de objetos, limpeza de áudio, tracking, tarefas repetitivas e chatas: tudo bem, se economiza tempo.
Isso é uma especificação utilizável. A camada mecânica se automatiza. As decisões — o que cortar, quando cortar, qual take sustenta o momento — não, e uma ferramenta que finge o contrário produz trabalho que você terá de refazer.
Evidências antes dos cortes
A falha comum é pedir direto o resultado: “faça um compacto com os melhores momentos”. O modelo não viu o material; está inferindo estrutura a partir da sua frase.
A etapa que corrige isso não é glamourosa. Antes de qualquer corte, extraia o que de fato existe no arquivo:
- Transcrição com marcação de tempo — e identificação de quem fala, quando há mais de uma pessoa.
- Limites de cena — onde o plano realmente muda.
- Trechos de silêncio — onde ninguém fala, no limiar que você definir.
- Marcas de qualidade — áudio clipado, trechos mal expostos, quadros congelados.
Agora a lista de cortes é uma decisão sobre dados, não um palpite — e, o que importa mais, é revisável. Dá para ler por que um trecho foi escolhido antes de gastar tempo de render com ele.
Planejar, aprovar, montar
A segunda coisa que separa automação utilizável de truque de festa é que o plano é um artefato separado da execução.
Concretamente: a rodada produz primeiro uma lista de decisões de edição — cada trecho, seu arquivo de origem, seus pontos de entrada e saída, e o que acontece por cima. Você lê essa lista. Só depois de aprová-la algo é renderizado. Três consequências vêm dessa separação. Um erro custa uma leitura, não um render. A lista é um diff, então uma segunda passada muda quatro trechos em vez de refazer tudo. E quando a saída está errada, dá para saber se o plano estava errado ou se a execução estava — bugs diferentes, correções diferentes.
Se a ferramenta renderiza direto do prompt sem um intermediário revisável, ela automatizou o palpite, não a edição.
O que não se automatiza
- Narrativa e gosto. Dois editores com o mesmo material contam duas histórias diferentes. Essa diferença é o trabalho.
- Qualquer coisa que exija sentir a sala. Qual take é mais engraçado, qual pausa merece a duração que tem.
- Entregas só de áudio ou só de transcrição. Vale dizer com todas as letras porque é um desencaixe comum: um pipeline de vídeo não é um serviço de transcrição, e usar um como o outro dá um resultado pior do que a ferramenta dedicada daria.
A questão do custo, com honestidade
Os editores levantam isso antes de levantar qualidade, e têm razão. Tudo que é movido a modelo tem custo por rodada, e material longo é caro de olhar. Extrair evidências uma vez e reutilizá-las entre as passadas não é só mais organizado — é boa parte da diferença entre um fluxo que você mantém e um que abandona depois da primeira fatura. Prefira uma etapa determinística sempre que uma etapa determinística resolver.
Rodando no Orkas
O Orkas traz o VideoStudio, que funciona exatamente nesta ordem: evidências do material, depois uma lista de decisões de edição multimodal, depois um portão de aprovação, depois montagem determinística — imagem, sobreposições, narração, legendas, verificação de loudness. É open source e roda na sua máquina, e o mesmo desktop dirige as CLIs de código que você já tem instaladas, então uma rodada de edição e uma de script são o mesmo tipo de tarefa, não duas ferramentas separadas. O passo a passo do cenário está em o caso de uso de produção de vídeo.
O que ele deliberadamente não faz: entregar saída só de áudio ou só de transcrição, nem renderizar nada antes de você aprovar o plano.