Volver a los análisis
Bitácora de desarrollo8 min de lectura

Los LLM no editan vídeos: por qué importan el harness del agente y las herramientas

Tu LLM no edita vídeo; herramientas como FFmpeg sí lo hacen. Comprender la diferencia entre el modelo, el harness y las herramientas es clave para construir agentes de IA.

Toby 4 de octubre de 2026

El LLM no está editando tu vídeo. ffmpeg lo está haciendo. Cada corte, empalme y superposición es una llamada a herramienta emitida por un harness de agente, y el modelo en el bucle está haciendo trabajo de pensamiento, no trabajo de archivos. Si has visto a alguien en internet afirmar que WAN, LTX o cualquier otro modelo de vídeo está «editando» metraje directamente, está aplastando tres componentes muy diferentes en uno solo. Esta es la arquitectura, en el orden en que realmente se ejecuta.

Los tres componentes que la gente sigue mezclando

Cuando un agente produce un vídeo terminado, tres cosas tuvieron que ocurrir, y no son lo mismo. En el ciclo de hype actual, los equipos de marketing tienden a agrupar todo esto bajo el estandarte de «El Modelo», pero eso es un malentendido fundamental de la pila de ingeniería. Para construir algo que realmente funcione —especialmente en un nicho como la tecnología del fitness donde la precisión importa— tienes que separar estas responsabilidades.

  • Un LLM: Decide dónde debe ir el texto, cuáles deben ser los cortes y qué hay que instalar. Proporciona la capacidad de razonamiento.
  • Un Harness: Mantiene vivo el objetivo, retiene la memoria, ejecuta los bucles y despacha el trabajo. Este es el estado persistente.
  • Un conjunto de herramientas: Normalmente ffmpeg más cualquier otra cosa que haya en la máquina local, realmente movió los bytes. Estos son los músculos.

Ese último punto es el que rompe la mayoría de las discusiones en internet. El LLM no tiene un botón de «cortar este clip». Tiene una descripción de herramienta para ffmpeg y emite un comando. El shell ejecuta el comando. Los píxeles cambian. El modelo nunca tocó el archivo. Simplemente sugirió una cadena de texto que, al ser ejecutada por un ordenador, provocó un cambio en el archivo.

Un mapa compacto de quién hace qué

Componente Rol en la pila Qué produce realmente
LLM Decide y planifica Llamadas a herramientas, comandos de instalación, razonamiento del siguiente paso
Harness Mantiene el objetivo, la memoria y el bucle La persistencia y orquestación del agente
Herramientas (ffmpeg, códecs, scripts, CLIs) Ejecuta en el sistema local Las mutaciones reales del archivo, renderizado, codificación, empalme
APIs / MCPs Interfaz con los datos Lecturas y escrituras estructuradas contra servicios externos

Si no recuerdas nada más: el LLM habla, el harness recuerda y las herramientas hacen.

La analogía del corazón, no la del cerebro

El modelo mental más común es erróneo. La gente llama al LLM el «cerebro» del agente. No lo es.

El LLM se parece más a un corazón. Sin él, la sangre no fluye. Con él, todo lo demás puede moverse. Pero un corazón no tiene objetivos. No tiene un plan. Bombea.

Esto importa porque la analogía no es solo poética. La capacidad del modelo establece un techo para la velocidad a la que todo el agente puede moverse, del mismo modo que el gasto cardíaco limita cuánto trabajo puede sostener el resto del cuerpo. Si el LLM es lento produciendo el siguiente token, el arnés se detiene y las herramientas quedan inactivas. Un modelo local ejecutándose en una sola máquina, con un número pequeño de parámetros, no bombeará el mismo rendimiento que un modelo frontier en la nube sobre hardware de inferencia de alto rendimiento.

En mi propia configuración, el modelo está distribuido entre tres máquinas, con la GX10 manejando la fase de prefill, que es la más pesada computacionalmente, antes de distribuir la generación. Incluso un modelo pequeño se ejecuta muy rápido en esta configuración. Sin embargo, si intentara cargar un modelo local más pesado—como GLM 4.7 o Minimax 25—en el mismo grupo de memoria, o bien no se cargaría o avanzaría a unos pocos tokens por segundo. Eso es el corazón sin bombear lo suficiente. Las herramientas y el arnés pueden ser perfectos, pero si la bomba es débil, el agente se sentirá lento y torpe.

Por qué el arnés es el cerebro

Uno de los investigadores fundadores de los LLM hizo la versión más limpia de este argumento, y es la parte que creo que la mayoría de la gente se salta. Un LLM, por sí solo, no puede tener un objetivo. La predicción del siguiente token no es un objetivo; es una probabilidad estadística. Un objetivo persistente de varias horas y de formato largo no es algo que surja de un solo pase hacia adelante del transformer. El LLM no tiene un concepto inherente de "quiero terminar esta edición".

El arnés sí lo tiene. A un arnés (como OpenClaw o envoltorios personalizados en Python) se le puede dar un objetivo, retener ese objetivo en una base de datos o en la ventana de contexto, mantener una estructura de memoria, ejecutar bucles, recuperarse de errores y mantener al agente apuntando al mismo objetivo a lo largo de muchas llamadas individuales a herramientas. Eso es un comportamiento similar al del cerebro, y vive en el código del arnés, no en los pesos del modelo.

Las empresas que intentan convertir al propio LLM en el cerebro fracasarán. No creo que Anthropic ni OpenAI crean internamente que el modelo sea el cerebro. El error vive en la comunidad de usuarios, donde el LLM se siente tan humano en la conversación que proyectamos el resto de la cognición sobre él. Pero la conversación es lo más fácil para él. La planificación a largo plazo contra un mundo externo es una bestia completamente distinta.

Cómo son realmente las herramientas en la práctica

Cuando le pides a un agente que navegue por un sitio web o edite un vídeo, el arnés normalmente no tiene un navegador o codificador de vídeo integrado.

En su lugar, el agente podría hacer una captura de pantalla del estado actual, leer los píxeles a través de un modelo multimodal, razonar sobre dónde debería ir el cursor y, a continuación, emitir llamadas de movimiento del ratón y clic al sistema operativo. Cada uno de esos pasos es una llamada a una herramienta contra el sistema local.

Lo mismo ocurre con el vídeo. Si diriges un agente a un stack como Fable o Codecs, va a descargar dependencias a tu máquina. Instala repositorios de Git, códecs, binarios de codificación y, a veces, un checkpoint completo de modelo. El vídeo no aparece porque un chatbot lo escribiera para que existiera. El vídeo aparece porque el harness decidió llamar a ffmpeg con una cadena compleja de argumentos: filtros, tasas de bits y marcas de tiempo, y ffmpeg hizo el trabajo pesado de procesar los píxeles.

La conexión con la tecnología del fitness: Speediance y más allá

La primera vez que esto me hizo clic fue cuando dirigí una suscripción de nivel gratuito de Google Gemini a OpenClaw muy al principio. Le pedí que construyera la primera versión de mi sistema de seguimiento de fitness. No escribí una sola línea de código. El harness decidió qué instalar, y el LLM, a través del harness, empezó a emitir llamadas a herramientas: clonó repositorios de GitHub, descargó el cliente API de Garmin Connect, conectó el flujo de datos e instaló las bibliotecas que faltaban en mi máquina local.

Nada de eso fue «un LLM editando un archivo». Fue un harness dirigiendo un bucle de planificación, un modelo generando el siguiente comando correcto y una cadena de herramientas local ejecutándolo. Esto tiene dos conclusiones importantes para la tecnología del fitness:

  1. El sistema local es parte del producto: si bloqueas las instalaciones o privas a la máquina de memoria, el agente falla. El agente es una entidad full-stack, no solo una ventana a un chatbot en la nube.
  2. La API es la frontera: las herramientas hacen trabajo de archivos, pero las API y los MCP (Model Context Protocol) hacen trabajo de datos. Speediance va a lanzar una API a finales de este año para los datos de sus equipos, lo cual supone un cambio enorme. Una vez que exista una API limpia para el hardware del gimnasio, el harness puede integrar un entrenamiento, obtener los datos de las series y razonar sobre ellos. El LLM sigue sin «editar» tu entrenamiento; el agente llama a la API para actualizar tus registros basándose en el razonamiento.

Elegir el modelo mental adecuado

Cuando veas una afirmación como «este LLM edita vídeo», sustituye los componentes reales y comprueba si la afirmación sigue siendo válida. Si el LLM está haciendo la edición, ¿qué herramienta está llamando? Si está llamando a ffmpeg, entonces es ffmpeg quien está editando el vídeo. Si no hay herramienta, no hay edición: solo hay una descripción textual de cómo podría ser una edición.

La versión más limpia del argumento es también la más corta: los modelos de vídeo no editan archivos directamente; FFmpeg y otras llamadas a herramientas son las que hacen el trabajo, y el harness proporciona al agent objetivos, memoria, bucles y capacidad práctica. Una vez que se separan esas tres piezas, el resto de la pila de agentes de IA, incluidas las partes que terminarán tocando tus datos de entrenamiento, resulta mucho más fácil de razonar.

Este es un corte editado por temas del livestream más extenso. El argumento completo, incluido el recorrido con captura de pantalla de la configuración del GX10, está en YouTube: Los LLM no editan vídeos. Lo hacen las herramientas y los harnesses.

#Agentes de IA#Harnesses#FFmpeg#Llamadas a herramientas#OpenClaw#Speediance API