Pular para o conteúdo
Mateus Castro

IA Aplicada a Negócios · 26 de março de 2026

Como Criei um Software de Edição de Vídeo com IA Sem Saber Programar (e Reduzi o Custo de R$100 para R$0,50 por Vídeo)

Mateus Castro mostra como criou um editor de vídeo automático com IA usando Claude Code, Whisper e Remotion — sem programar. Inclui prompt completo para replicar.

26 de março de 202614 min de leitura
Como Criei um Software de Edição de Vídeo com IA Sem Saber Programar (e Reduzi o Custo de R$100 para R$0,50 por Vídeo)

Eu gravava um vídeo em 5 minutos. A edição levava 2 horas, ou R$100,00 pago para o meu editor. Multiplica isso por 30 vídeos por mês: R$3.000 em edição, ou 60 horas de espera. Para um empresário que produz conteúdo todo dia, isso é um gargalo que mata consistência. E consistência, no digital, é tudo.

Então eu resolvi construir a solução. Não contratar alguém novo. Não assinar mais uma ferramenta. Construir, do zero, um sistema que edita vídeo automaticamente usando IA. O resultado: um software que recebe o vídeo bruto, transcreve o áudio, corta os silêncios, gera legendas estilo TikTok, cria ilustrações no momento certo e entrega o arquivo editado pronto para publicar. Custo por vídeo: menos de R$0,50.

Neste artigo eu vou te mostrar como funciona, a lógica por trás de cada decisão e, no final, o prompt completo para você replicar na sua máquina.

Por Que Decidi Construir em Vez de Contratar

Eu sou CEO da Doism Educação, escola de negócios focada em vendas e gestão. Produzir conteúdo é parte central da minha operação.

O problema não era o editor. Era o modelo. Depender de um terceiro para editar significa depender do tempo dele, da disponibilidade dele, do estilo dele. E quando você produz volume, qualquer gargalo externo vira problema de gestão.

Eu ensino há anos que todo processo que pode ser sistematizado, deve ser sistematizado. Estava na hora de aplicar isso na minha própria produção de conteúdo.

Vi um vídeo onde alguém usava o Remotion para gerar animações com IA. Uma pergunta ficou na cabeça: se a IA já transcreve áudio, já analisa texto e já gera imagem, por que não juntar tudo isso numa sequência que edita um vídeo do início ao fim? A resposta foi: nenhuma razão. Faltava só alguém conectar os pontos.

O Conceito que Torna Isso Possível: Pipeline de IA

Antes de entrar nas ferramentas, preciso te passar o conceito que muda tudo. Chama Pipeline.

Pipeline é uma sequência de etapas onde cada uma alimenta a próxima. Igual uma linha de montagem numa fábrica: cada estação faz uma coisa específica. Nenhuma faz tudo. O erro mais comum de quem começa a usar IA é procurar uma ferramenta que resolve tudo de uma vez. Essa ferramenta não existe. E quando existe, ela resolve tudo de forma medíocre. O que funciona é o seguinte: você entende o problema, quebra em etapas, escolhe a melhor IA para cada etapa, e conecta tudo numa sequência que flui sozinha.

É assim que eu monto qualquer sistema de IA nos meus clientes e na Doism:

  • Processo: o que precisa acontecer, em qual ordem
  • Ferramenta: qual IA resolve cada etapa
  • Supervisão: como você acompanha e ajusta o todo
O editor de vídeo que construí tem 6 etapas. Cada uma com uma ferramenta específica. E a única que depende de mim é a revisão antes de renderizar, e mesmo essa é opcional.

As 6 Etapas do Pipeline de Edição Automática

Etapa 1 — Normalização do Vídeo

Quando o arquivo bruto entra no sistema, a primeira coisa que acontece é uma conversão técnica. Câmeras modernas gravam em HEVC (H.265) para economizar espaço. O problema é que esse formato não se comporta bem em edição programática. O sistema converte automaticamente para H.264 com 30 frames por segundo e keyframe a cada 1 segundo. Isso é feito pelo FFmpeg, que já vem embutido no Remotion. Nenhuma instalação extra necessária.

Por que isso importa: Se você pular essa etapa, as legendas vão descolar do áudio em vídeos mais longos. É um detalhe técnico invisível que arruína tudo.

Etapa 2 — Transcrição com Whisper

Com o vídeo normalizado, o sistema extrai o áudio e manda para o Whisper, da OpenAI. O Whisper não transcreve só o texto. Ele transcreve com timestamp por palavra. Ele sabe que no segundo 3.2 você falou "o problema das vendas" e no segundo 5.8 você falou "é que ninguém tem processo". Essa informação de timing é a espinha dorsal do sistema. Sem ela, você não consegue sincronizar legenda, ilustração ou corte com precisão.

Custo: menos de R$0,03 por minuto de áudio. Um vídeo de 10 minutos custa menos de R$0,30.

Etapa 3 — Corte de Silêncios

Com a transcrição em mãos, o sistema analisa os intervalos entre as falas. Qualquer pausa maior que 0,8 segundo é marcada para corte. Porque silêncio em vídeo de conteúdo é morte: o algoritmo penaliza, o espectador avança.

Aqui tem um detalhe técnico que me custou muitos testes para resolver: quando você corta um silêncio do meio do vídeo, todo o conteúdo que vem depois se desloca para trás no tempo. O segundo 12 vira segundo 10. O sistema precisa recalcular todos os timestamps depois de cada corte, senão as legendas ficam fora de lugar. Esse recálculo é feito por código, não por IA. Código não erra aritmética. IA erra.

Etapa 4 — Análise Inteligente com Claude

Essa é a etapa mais sofisticada do pipeline. E a que mais separa esse sistema de qualquer ferramenta genérica do mercado. O Claude recebe a transcrição completa do vídeo e faz quatro coisas:

  • Identifica o formato narrativo (7 formatos possíveis)
  • Cria uma paleta de cores dinâmica para o vídeo
  • Define quais cenas criar e de que tipo
  • Posiciona cada cena no momento certo do vídeo
O sistema trabalha com 10 tipos de cena, cada uma com animação própria:
TipoDescriçãoQuando usar
A (FullScreen)Tela cheia com frase de impactoPara afirmações centrais do vídeo
B (LowerThird)Rosto full + texto embaixoPara apresentação e contexto
C+ (Split)Painel acima + rosto abaixoPara pontos com desenvolvimento
D (SplitVertical)Comparativo lado a ladoPara contrastes e comparações
E (Card)Card numerado com íconePara listas sequenciais
F (Message)Mensagem estilo WhatsAppPara simular conversas ou diálogos
G (Number)Número animado em destaquePara estatísticas e resultados
H (Flow)Fluxo de passos verticalPara processos e sequências
I (CTA)Call to action com palavra pulsantePara fechamento e convite
BONECOStick figures animadosPara situações e narrativas visuais

O Pulo do Gato

No início, eu pedia para a IA calcular em qual segundo cada cena devia aparecer. Ela errava. Porque "segundo 12.3 vezes 30 frames por segundo, menos 1.8 de silêncio cortado" é exatamente o tipo de conta que modelos de linguagem fazem de forma imprecisa.

A solução foi mudar a lógica completamente. Em vez de pedir para a IA calcular o tempo, eu peço para ela apontar. Mando a lista de legendas numeradas (0, 1, 2, 3...) e o Claude só diz: "a cena 1 começa na legenda 0, a cena 2 começa na legenda 5". Aí o código faz o cálculo exato de frames, porque código não erra conta.

Essa mudança sozinha resolveu o problema central de sincronização do sistema.

Etapa 5 — Montagem com Remotion

Agora o sistema sabe o que falar, quando falar e como mostrar. Falta transformar isso em vídeo.

O Remotion é uma biblioteca que permite criar vídeo usando código. Em vez de arrastar e soltar numa timeline, você define as camadas por instrução. O vídeo final é literalmente um sanduíche de 3 camadas:

  • Camada de baixo: o vídeo original com os silêncios cortados
  • Camada do meio: as cenas visuais, cada uma aparecendo e desaparecendo no momento certo, com animações spring
  • Camada de cima: as legendas estilo TikTok, palavra por palavra, com cor por sentimento (verde para positivo, vermelho para negativo)
O resultado parece que um editor profissional passou horas trabalhando. O processamento leva 2 minutos.

Etapa 6 — Revisão e Renderização

Quando o processamento termina, o vídeo não vai direto para exportação. Vai para uma tela de revisão.

Nessa tela há um preview em tempo real com todas as cenas listadas e uma timeline mostrando quando cada cena começa e termina. Se algo precisar de ajuste, há três caminhos:

  • Edição manual: clica na cena, muda texto, ícone ou cor
  • Refinamento com IA: escreve um prompt como "troca a cena 3 por um comparativo" e o sistema refaz só aquela parte
  • Geração de ilustração: cada cena pode ter uma imagem gerada por IA em 10 segundos via WaveSpeed
Quando está bom, um clique em renderizar gera o arquivo MP4 final.

Quanto Custa na Prática

ItemCusto por vídeo
Transcrição Whisper (10 min de áudio)~R$0,03
Análise Claude~R$0,10
Geração de imagens IA (opcional)~R$0,02 por imagem
Total sem imagens~R$0,13
Total com imagens~R$0,30 a R$0,50
Antes (editor humano)R$80 a R$100
Em 30 vídeos por mês: de R$3.000 para menos de R$15. E com tempo de entrega de minutos, não de dias.

As 3 Lições Que Valem Mais do que Qualquer Ferramenta

1. Você não precisa saber programar.

Eu não escrevi uma linha de código. Quem escreveu foi o Claude Code. Eu descrevi o que eu queria, ele programou. Quando dava erro, eu falava "tá dando erro aqui" e ele corrigia. É como ter um programador sênior disponível 24 horas, sem hora extra, sem ego.

2. A inovação não está na ferramenta. Está na orquestração.

Whisper já existia. Claude já existia. Remotion já existia. O que não existia era alguém conectando tudo isso numa sequência que resolvia um problema real de negócio. Essa habilidade — pensar em processo antes de pensar em tecnologia — é o que diferencia empresários que colhem resultado de IA dos que ficam testando ferramentas sem sair do lugar.

3. IA não substitui revisão humana. Ela libera você para o que só você sabe fazer.

O sistema acerta 90% das vezes. Os 10% que ele erra, um olhar humano pega em 30 segundos. O segredo não é confiar cegamente. É usar a IA para o trabalho pesado e reservar o seu tempo para o refinamento que exige julgamento.

Como Aplicar no Seu Negócio: A Mesma Lógica na Prática

Você não precisa construir um editor de vídeo para começar a usar essa lógica. Você precisa escolher um processo no seu negócio que hoje consome tempo e que tem etapas sequenciais claras.

  1. Mapeie o processo do início ao fim. Escreva cada etapa separada.
  2. Para cada etapa, pergunte: "essa etapa pode ser automatizada com uma IA que já existe?"
  3. Conecte as etapas. Teste a sequência. Ajuste o que não funciona.
  4. Coloque um humano na revisão. Não na execução.
Esse é o mesmo raciocínio que aplico nas consultorias da Doism com mais de 600 empresas atendidas. Processos comerciais, atendimento, follow-up, gestão de equipe. Em todos esses casos, a resposta começa pela mesma pergunta: qual é o pipeline?

Replicando o Sistema: Prompt Completo

Se você quer construir o mesmo sistema na sua máquina, aqui está o que você precisa e o caminho exato.

Pré-requisitos

  • Claude Code instalado (claude.ai/code) — grátis para começar
  • Node.js v20+ via nvm: nvm install 20 && nvm use 20
  • Chave API da OpenAI (para o Whisper) — platform.openai.com/api-keys
  • Chave API da Anthropic (para o Claude) — console.anthropic.com
  • Chave WaveSpeed (opcional, para geração de imagens) — wavespeed.ai

Stack Técnica do Sistema

TecnologiaVersãoFunção
Next.js14.2.21App Router + TypeScript (interface e APIs)
React18.3.1Interface
Remotion4.0.434 (FIXA)Renderização programática de vídeo
@remotion/player4.0.434Preview em tempo real
@anthropic-ai/sdk0.39.0Análise de conteúdo com Claude
openai4.77.0Transcrição com Whisper
Tailwind CSS3.4.1Estilo da interface

Instalação Passo a Passo

  1. Abra o Claude Desktop (requer assinatura Pro) e acesse a aba Code. Crie uma pasta vazia chamada "video-editor" e abra-a dentro do Claude Code.
  2. Instale a Skill do Remotion. Cole o comando de instalação no terminal (disponível em remotion.dev) e envie: "Por favor, faça o setup do remotion skill para mim". Permita todas as ações e escolha instalação global.
  3. Cole o prompt abaixo no Claude Code e deixe ele trabalhar.

O Prompt Completo

Quero que você construa um SaaS completo de edição automática de vídeo com IA. O sistema recebe um vídeo bruto, transcreve com Whisper, analisa o conteúdo com Claude, gera cenas visuais animadas e renderiza o vídeo final com Remotion.

STACK TÉCNICA

  • Next.js 14.2.21 (App Router, TypeScript)
  • React 18.3.1
  • Remotion 4.0.434 (VERSÃO FIXA — não use outra)
  • @remotion/player 4.0.434
  • @anthropic-ai/sdk 0.39.0
  • openai 4.77.0
  • Tailwind CSS 3.4.1
  • uuid 11.0.5
ARQUITETURA GERAL

O app tem 2 projetos separados:

  1. video-editor/ — Next.js app (interface + API)
  2. video-editor/remotion/ — Remotion isolado (composições de vídeo)
PIPELINE DE PROCESSAMENTO (6 etapas)
  1. Upload — Usuário sobe MP4 + prompt opcional
  2. Normalização — Converte HEVC para H.264 CFR 30fps
  3. Transcrição — Whisper API transcreve áudio para SRT com timestamps
  4. Análise — Claude analisa conteúdo, identifica formato narrativo, cria paleta de cores, define cenas
  5. Revisão — Usuário vê preview, edita cenas, gera ilustrações IA
  6. Render — Remotion renderiza vídeo final MP4
FORMATO DO VÍDEO
  • 1080x1920 (9:16 vertical)
  • 30 FPS
  • Fonte: Sora (Google Fonts) pesos 400/600/700/800
SISTEMA DE TIMING (startLeg)

A IA NÃO calcula frames manualmente. Usa startLeg: o ÍNDICE da legenda onde cada cena começa. O código converte índice em frame exato via convertScenesFromLegendaIndex().

INSTRUÇÕES PARA O CLAUDE CODE

  1. Crie toda a estrutura de pastas conforme especificado
  2. Instale as dependências para ambos os projetos
  3. Design: dark mode premium (fundo #050508, acentos dourados #FFB800)
  4. Glass morphism, gradients sutis e animações suaves
  5. Editor com preview lateral + lista de cenas + timeline embaixo
  6. Cada tipo de cena com seu próprio componente Remotion com animações spring
  7. Legendas estilo TikTok (palavra-por-palavra, cor por sentimento)
  8. Video route com suporte a HTTP Range Requests
  9. Crie o .env.local.example com as variáveis necessárias
  10. Configure o dev server na porta 3333
Construa o projeto completo, funcional e pronto para uso.

Após o Claude Terminar

Crie o arquivo .env.local na raiz do projeto:

OPENAI_API_KEY=sua-chave-openai-aqui
ANTHROPIC_API_KEY=sua-chave-anthropic-aqui
CLAUDE_API_KEY=sua-chave-anthropic-aqui
WAVESPEED_API_KEY=sua-chave-wavespeed-aqui

Depois rode:

npm install
cd remotion && npm install && cd ..
npm run dev

Acesse http://localhost:3333 e suba seu primeiro vídeo.

Perguntas Frequentes

Preciso de um computador potente?

Não. O sistema roda em notebook comum. A renderização usa apenas CPU e consome pouca memória comparado a softwares de edição tradicionais.

Funciona com qualquer tipo de vídeo?

Funciona melhor com vídeos verticais (9:16) de câmera parada ou levemente móvel. Vídeos com muito movimento de câmera podem ter resultado visual menos preciso nas cenas sobrepostas.

E se o Claude Code cometer erros durante a construção?

Isso é normal e faz parte do processo. Quando der erro, cole a mensagem de erro no chat do Claude Code e escreva "corrija esse erro". Ele identifica e corrige. Em projetos assim, é comum precisar de 3 a 5 ciclos de correção antes de tudo rodar limpo.

Posso usar para outros idiomas além do português?

O Whisper suporta mais de 50 idiomas. O sistema funciona em qualquer idioma que o Whisper transcrever. As legendas e cenas seguem o mesmo idioma do áudio.

Conclusão

Construir esse sistema me ensinou algo que ensino há anos mas vivi na prática de uma forma nova: processo antes de tecnologia.

A tecnologia não resolveu meu problema. O processo resolveu. A tecnologia foi o instrumento.

Qualquer empresário que entender isso, vai usar IA de um jeito que seus concorrentes vão demorar anos para alcançar. Não porque tenha mais dinheiro ou mais equipe. Porque parou para pensar em sequência antes de sair clicando em ferramenta.

Se você chegou até aqui, já sabe mais sobre construção de pipelines de IA do que 95% dos empresários brasileiros.

A pergunta que fica: qual processo no seu negócio você vai automatizar primeiro?


Mateus Castro é Especialista em IA aplicada a Processos Comerciais e Gestão de Pessoas. Fundador e CEO da Doism Educação, já atendeu mais de 600 empresas, treinou mais de 1.200 vendedores e gerou mais de R$50 milhões em resultados para seus clientes.

Referências

Voltar ao Blog
Compartilhar: