Voltar para as análises
Registros de Build8 min de leitura

LLMs Não Editam Vídeos: Por Que o Harness e as Ferramentas do Agente Importam

Seu LLM não está editando vídeo; ferramentas como FFmpeg estão. Entender a diferença entre o modelo, o harness e as ferramentas é fundamental para construir agentes de IA.

Toby 4 de outubro de 2026

O LLM não está editando o seu vídeo. O ffmpeg que está. Cada corte, junção e sobreposição é uma chamada de ferramenta emitida por um harness de agente, e o modelo no loop está fazendo trabalho de raciocínio, não trabalho de arquivo. Se você já viu alguém online afirmar que WAN, LTX, ou qualquer outro modelo de vídeo está "editando" o material diretamente, essa pessoa está achatando três componentes muito diferentes em um só. Aqui está a arquitetura, na ordem em que realmente executa.

Os Três Componentes Que as Pessoas Continuam Misturando

Quando um agente produz um vídeo finalizado, três coisas precisaram acontecer, e elas não são a mesma coisa. No ciclo de hype atual, os departamentos de marketing tendem a agrupar tudo isso sob a bandeira de "O Modelo", mas isso é um mal-entendido fundamental da stack de engenharia. Para construir algo que realmente funcione — especialmente em um nicho como tech fitness onde a precisão importa — você precisa separar essas responsabilidades.

  • Um LLM: Decide onde o texto deve ir, quais devem ser os cortes, e o que instalar. Ele fornece a capacidade de raciocínio.
  • Um Harness: Mantém o objetivo vivo, segura a memória, roda os loops e despacha o trabalho. Este é o estado persistente.
  • Um Conjunto de Ferramentas: Geralmente ffmpeg somado a qualquer outra coisa disponível na máquina local, que de fato moveu os bytes. Estas são os músculos.

Esse último ponto é o que quebra a maioria dos argumentos online. O LLM não tem um botão de "cortar este clipe". Ele tem uma descrição de ferramenta para o ffmpeg, e emite um comando. O shell executa o comando. Os pixels mudam. O modelo nunca tocou no arquivo. Ele apenas sugeriu uma sequência de texto que, quando executada por um computador, resultou em uma alteração no arquivo.

Um Mapa Compacto De Quem Faz O Quê

Componente Papel na Stack O Que Ele Realmente Produz
LLM Decide e planeja Chamadas de ferramentas, comandos de instalação, raciocínio do próximo passo
Harness Mantém o objetivo, a memória e o loop A persistência e a orquestração do agente
Ferramentas (ffmpeg, codecs, scripts, CLIs) Executa no sistema local As mutações reais de arquivo, renderização, encode, splice
APIs / MCPs Interface com os dados Leituras e escritas estruturadas contra serviços externos

Se você não lembrar de mais nada: o LLM fala, o harness lembra, e as ferramentas fazem.

A Analogia Do Coração, Não Do Cérebro

O modelo mental mais comum está errado. As pessoas chamam o LLM de "cérebro" do agente. Ele não é.

O LLM é mais parecido com um coração. Sem ele, o sangue não flui. Com ele, todo o resto pode se mover. Mas um coração não tem objetivos. Não tem um plano. Ele bombeia.

Isso importa porque a analogia não é apenas poética. A capacidade do modelo define um teto para a velocidade com que o agente inteiro pode se mover, da mesma forma que o débito cardíaco limita quanto trabalho o resto do corpo consegue sustentar. Se o LLM é lento para produzir o próximo token, o harness trava e as ferramentas ficam ociosas. Um modelo local rodando em uma única máquina, com uma contagem pequena de parâmetros, não vai bombear a mesma vazão que um modelo de fronteira na nuvem em hardware de inferência de alto desempenho.

Na minha própria configuração, o modelo é distribuído em três máquinas, com o GX10 cuidando da fase de prefill, pesada em computação, antes de distribuir a geração. Mesmo um modelo pequeno roda muito rápido nessa configuração. No entanto, se eu tentasse carregar um modelo local mais pesado — como o GLM 4.7 ou o Minimax 25 — no mesmo pool de memória, ele ou falharia ao carregar ou se arrastaria a poucos tokens por segundo. Esse é o coração não bombeando o suficiente. As ferramentas e o harness podem ser perfeitos, mas se a bomba é fraca, o agente vai parecer não responsivo e desajeitado.

Por que o Harness é o Cérebro

Um dos pesquisadores fundadores dos LLMs fez a versão mais clara desse argumento, e é a parte que acho que a maioria das pessoas deixa passar. Um LLM, por si só, não pode ter um objetivo. A predição do próximo token não é um objetivo; é uma probabilidade estatística. Um objetivo persistente, de longa duração e que se estende por várias horas não é algo que emerge de uma única passagem forward de um transformer. O LLM não tem um conceito inerente de "eu quero terminar essa edição.".

O harness tem. Um harness (como OpenClaw ou wrappers customizados em Python) pode receber um objetivo, reter esse objetivo em um banco de dados ou janela de contexto, manter uma estrutura de memória, executar loops, se recuperar de erros e manter o agente apontado para o mesmo alvo através de muitas chamadas individuais de ferramentas. Esse é um comportamento parecido com o de um cérebro, e ele vive no código do harness, não nos pesos do modelo.

As empresas que tentam fazer do próprio LLM o cérebro vão falhar. Não acho que Anthropic ou OpenAI acreditem internamente que o modelo é o cérebro. O erro está na comunidade de usuários, onde o LLM parece tão humano em conversação que projetamos o restante da cognição sobre ele. Mas conversação é a coisa mais fácil para ele. Planejamento de longo horizonte contra um mundo externo é uma fera completamente diferente.

Como as Ferramentas Realmente São na Prática

Quando você pede a um agente para navegar em um site ou editar um vídeo, o harness geralmente não tem um navegador ou codificador de vídeo embutidos.

Instead, the agent might take a screenshot of the current state, read the pixels back through a multimodal model, reason about where the cursor should go, and then issue mouse-move and click calls to the operating system. Every one of those steps is a tool call against the local system.

The same is true for video. If you point an agent at a stack like Fable or Codecs, it is going to pull down dependencies to your machine. It installs Git repos, codecs, encoder binaries, and sometimes a full model checkpoint. The video does not appear because a chatbot typed it into existence. The video appears because the harness decided to call ffmpeg with a complex string of arguments—filters, bitrates, and timestamps—and ffmpeg did the heavy lifting of crunching the pixels.

A Conexão com a Tecnologia Fitness: Speediance e Além

A primeira vez que isso ficou claro para mim foi quando apontei uma assinatura do Google Gemini de nível gratuito para o OpenClaw bem no começo. Pedi que ele construísse a primeira versão do meu sistema de rastreamento de fitness. Eu não escrevi uma única linha de código. O harness decidiu o que instalar, e o LLM, através do harness, começou a emitir chamadas de ferramentas: ele clonou repositórios do GitHub, baixou o cliente de API do Garmin Connect, configurou o fluxo de dados e instalou as bibliotecas que faltavam na minha máquina local.

Nada disso foi "um LLM editando um arquivo." Foi um harness conduzindo um loop de planejamento, um modelo gerando o próximo comando correto e um toolchain local executando-o. Isso traz duas grandes conclusões para a tecnologia de fitness:

  1. O sistema local faz parte do produto: Se você bloquear instalações ou privar a máquina de memória, o agente falha. O agente é uma entidade full-stack, não apenas uma janela para um chatbot na nuvem.
  2. A API é a fronteira: Ferramentas fazem trabalho de arquivo, mas APIs e MCPs (Model Context Protocol) fazem trabalho de dados. A Speediance está lançando uma API ainda este ano para os dados dos equipamentos deles, o que é uma mudança enorme. Uma vez que existir uma API limpa para hardware de academia, o harness pode integrar um treino, puxar os dados das séries e raciocinar sobre eles. O LLM ainda não "edita" seu treino; o agente chama a API para atualizar seus registros com base no raciocínio.

Escolhendo o Modelo Mental Certo

Quando você se depara com uma afirmação como "este LLM edita vídeo", substitua os componentes reais e veja se a afirmação ainda se sustenta. Se o LLM está fazendo a edição, qual ferramenta ele está chamando? Se ele está chamando o ffmpeg, então o ffmpeg está editando o vídeo. Se não há ferramenta, não há edição—há apenas uma descrição em texto de como uma edição poderia ser.

A versão mais limpa do argumento também é a mais curta: modelos de vídeo não estão editando arquivos diretamente; o FFmpeg e outras chamadas de ferramentas é que fazem o trabalho, e a harness fornece ao agente objetivos, memória, loops e capacidade prática. Uma vez que você separa essas três peças, o restante do stack de agentes de IA, incluindo as partes que eventualmente tocarão seus dados de treinamento, se torna muito mais fácil de entender.

Este é um corte editado por tópicos da livestream mais longa. O argumento completo, incluindo o passo a passo com captura de tela da configuração do GX10, está no YouTube: LLMs Não Editam Vídeos. Ferramentas e Harnesses Editam.

#Agentes de IA#Harnesses#FFmpeg#Tool Calling#OpenClaw#Speediance API