LLMs bearbeiten keine Videos: Warum die Agent-Umgebung und die Werkzeuge entscheidend sind
Ihr LLM bearbeitet kein Video; das tun Werkzeuge wie FFmpeg. Den Unterschied zwischen Modell, Umgebung und Werkzeugen zu verstehen, ist der Schlüssel zum Aufbau von KI-Agenten.
Das LLM bearbeitet dein Video nicht. ffmpeg tut es. Jeder Schnitt, jede Verbindung und jedes Overlay ist ein Tool-Aufruf, der von einem Agent-Harness ausgegeben wird, und das Modell in der Schleife verrichtet Denkarbeit, keine Dateiarbeit. Wenn du online jemanden gesehen hast, der behauptet, dass WAN, LTX oder ein anderes Videomodell Footage direkt „bearbeitet", dann fasst diese Person drei sehr unterschiedliche Komponenten in einer zusammen. Hier ist die Architektur, in der Reihenfolge, in der sie tatsächlich abläuft.
Die drei Komponenten, die die Leute ständig verschmelzen
Wenn ein Agent ein fertiges Video produziert, müssen drei Dinge geschehen, und sie sind nicht dasselbe. Im aktuellen Hype-Zyklus neigen Marketingabteilungen dazu, all das unter dem Banner „Das Modell" zusammenzufassen, aber das ist ein grundlegendes Missverständnis des Engineering-Stacks. Um etwas zu bauen, das tatsächlich funktioniert – besonders in einer Nische wie Fitness-Tech, wo Präzision zählt – musst du diese Belange trennen.
- Ein LLM: Entscheidet, wo Text platziert werden soll, wie die Schnitte aussehen sollen und was installiert werden soll. Es liefert die Reasoning-Fähigkeit.
- Ein Harness: Hält das Ziel am Leben, verwaltet den Speicher, führt die Schleifen aus und verteilt die Arbeit. Dies ist der persistente Zustand.
- Ein Satz Tools: Üblicherweise ffmpeg plus alles andere, was auf dem lokalen Rechner vorhanden ist, hat tatsächlich die Bytes verschoben. Dies sind die Muskeln.
Dieser letzte Punkt ist derjenige, der die meisten Online-Argumente bricht. Das LLM hat keinen „Schneide diesen Clip"-Knopf. Es hat eine Tool-Beschreibung für ffmpeg und gibt einen Befehl aus. Die Shell führt den Befehl aus. Die Pixel ändern sich. Das Modell hat die Datei nie angefasst. Es hat lediglich eine Zeichenkette vorgeschlagen, die bei Ausführung durch einen Computer zu einer Dateiänderung führte.
Eine kompakte Übersicht, wer was macht
| Komponente | Rolle im Stack | Was es tatsächlich produziert |
|---|---|---|
| LLM | Entscheidet und plant | Tool-Aufrufe, Installationsbefehle, Reasoning für den nächsten Schritt |
| Harness | Hält das Ziel, den Speicher und die Schleife | Die Persistenz und Orchestrierung des Agenten |
| Tools (ffmpeg, Codecs, Skripte, CLIs) | Führt auf dem lokalen System aus | Die tatsächlichen Dateimutationen, Rendering, Encoding, Spleißen |
| APIs / MCPs | Schnittstelle zu Daten | Strukturierte Lese- und Schreibvorgänge gegen externe Dienste |
Wenn du dir sonst nichts merkst: Das LLM spricht, das Harness erinnert sich, und die Tools handeln.
Die Herz-Analogie, nicht die Gehirn-Analogie
Das häufigste mentale Modell ist falsch. Die Leute nennen das LLM das „Gehirn" des Agenten. Das ist es nicht.
Das LLM ist eher ein Herz. Ohne es fließt kein Blut. Mit ihm kann sich alles andere bewegen. Aber ein Herz hat keine Ziele. Es hat keinen Plan. Es pumpt.
Das ist wichtig, weil die Analogie nicht nur poetisch ist. Die Kapazität des Modells setzt eine Obergrenze dafür, wie schnell der gesamte Agent agieren kann, genauso wie das Herzzeitvolumen begrenzt, wie viel Arbeit der Rest des Körpers aufrechterhalten kann. Wenn das LLM langsam das nächste Token erzeugt, kommt das Harness zum Stillstand, und die Werkzeuge bleiben untätig. Ein lokales Modell, das auf einer einzelnen Maschine mit einer kleinen Parameteranzahl läuft, wird nicht denselben Durchsatz pumpen wie ein Frontier-Cloud-Modell auf Hochleistungs-Inferenz-Hardware.
Auf meinem eigenen Setup ist das Modell auf drei Maschinen verteilt, wobei die GX10 die rechenintensive Prefill-Phase übernimmt, bevor die Generierung verteilt wird. Selbst ein kleines Modell läuft in dieser Konfiguration sehr schnell. Wenn ich jedoch versuchen würde, ein schwereres lokales Modell – wie GLM 4.7 oder Minimax 25 – in denselben Speicherpool zu laden, würde es entweder gar nicht laden oder mit wenigen Tokens pro Sekunde kriechen. Das ist das Herz, das nicht genug pumpt. Die Werkzeuge und das Harness können perfekt sein, aber wenn die Pumpe schwach ist, wird sich der Agent träge und unbeholfen anfühlen.
Warum das Harness das Gehirn ist
Einer der Gründungsforscher der LLMs hat die sauberste Version dieses Arguments vorgebracht, und es ist der Teil, den die meisten Leute meiner Meinung nach überspringen. Ein LLM kann für sich genommen kein Ziel haben. Die Vorhersage des nächsten Tokens ist kein Ziel; sie ist eine statistische Wahrscheinlichkeit. Ein langfristiges, ausdauerndes, mehrstündiges Ziel entsteht nicht aus einem einzelnen Transformer-Forward-Pass. Das LLM hat kein inhärentes Konzept von „Ich möchte diese Bearbeitung abschließen.".
Das Harness hingegen schon. Ein Harness (wie OpenClaw oder benutzerdefinierte Python-Wrapper) kann ein Ziel erhalten, dieses Ziel in einer Datenbank oder einem Kontextfenster speichern, eine Speicherstruktur halten, Schleifen ausführen, sich von Fehlern erholen und den Agenten über viele einzelne Werkzeugaufrufe hinweg auf dasselbe Ziel ausgerichtet halten. Das ist gehirnähnliches Verhalten, und es lebt im Harness-Code, nicht in den Gewichten des Modells.
Die Unternehmen, die versuchen, das LLM selbst zum Gehirn zu machen, werden scheitern. Ich glaube nicht, dass Anthropic oder OpenAI intern glauben, dass das Modell das Gehirn ist. Der Fehler liegt in der Nutzergemeinschaft, wo das LLM in Gesprächen so menschlich wirkt, dass wir den Rest der Kognition darauf projizieren. Aber Konversation ist das Einfachste für es. Langfristige Planung gegen eine externe Welt ist eine völlig andere Bestie.
Wie die Werkzeuge in der Praxis tatsächlich aussehen
Wenn du einen Agenten bittest, eine Website zu navigieren oder ein Video zu bearbeiten, hat das Harness normalerweise keinen eingebauten Browser oder Video-Encoder.
Stattdessen macht der Agent möglicherweise einen Screenshot des aktuellen Zustands, liest die Pixel über ein multimodales Modell zurück, überlegt, wo der Cursor hingehen soll, und gibt dann Mausbewegungs- und Klickaufrufe an das Betriebssystem aus. Jeder dieser Schritte ist ein Tool-Aufruf gegen das lokale System.
Das Gleiche gilt für Video. Wenn Sie einen Agenten auf einen Stack wie Fable oder Codecs ausrichten, wird er Abhängigkeiten auf Ihre Maschine herunterladen. Er installiert Git-Repos, Codecs, Encoder-Binärdateien und manchmal einen vollständigen Modell-Checkpoint. Das Video erscheint nicht, weil ein Chatbot es in die Existenz getippt hat. Das Video erscheint, weil das Harness entschieden hat, ffmpeg mit einer komplexen Zeichenkette von Argumenten aufzurufen – Filter, Bitraten und Zeitstempel – und ffmpeg die schwere Arbeit der Pixelberechnung übernommen hat.
Speediance und die Fitness-Tech-Verbindung darüber hinaus
Das erste Mal, als das bei mir Klick machte, war, als ich ein Google-Gemini-Abo der kostenlosen Stufe sehr früh auf OpenClaw ausrichtete. Ich bat es, die erste Version meines Fitness-Tracking-Systems zu erstellen. Ich habe keine einzige Zeile Code geschrieben. Das Harness entschied, was installiert werden soll, und das LLM begann über das Harness, Tool-Aufrufe auszugeben: Es klonte GitHub-Repositories, lud den API-Client von Garmin Connect herunter, verband den Datenfluss und installierte die fehlenden Bibliotheken auf meiner lokalen Box.
Nichts davon war „ein LLM, das eine Datei bearbeitet". Das war ein Harness, das eine Planungsschleife antreibt, ein Modell, das den richtigen nächsten Befehl generiert, und eine lokale Toolchain, die es ausführt. Dies hat zwei wichtige Erkenntnisse für die Fitness-Technologie:
- Das lokale System ist Teil des Produkts: Wenn Sie Installationen blockieren oder der Maschine den Speicher entziehen, schlägt der Agent fehl. Der Agent ist eine Full-Stack-Entität, nicht nur ein Fenster in einen Cloud-Chatbot.
- Die API ist die Grenze: Tools erledigen Dateiarbeit, aber APIs und MCPs (Model Context Protocol) erledigen Datenarbeit. Speediance bringt später in diesem Jahr eine API für ihre Gerätedaten auf den Markt, was eine massive Verschiebung darstellt. Sobald es eine saubere API für Fitnessstudio-Hardware gibt, kann das Harness ein Training einbinden, die Satz-Daten abrufen und darüber nachdenken. Das LLM „bearbeitet" dein Training immer noch nicht; der Agent ruft die API auf, um deine Aufzeichnungen basierend auf Überlegungen zu aktualisieren.
Das richtige mentale Modell wählen
Wenn Sie eine Behauptung wie „dieses LLM bearbeitet Video" sehen, ersetzen Sie die tatsächlichen Komponenten und prüfen Sie, ob die Behauptung noch hält. Wenn das LLM die Bearbeitung durchführt, welches Tool ruft es auf? Wenn es ffmpeg aufruft, dann bearbeitet ffmpeg das Video. Wenn es kein Tool gibt, gibt es keine Bearbeitung – es gibt nur eine textbasierte Beschreibung dessen, wie eine Bearbeitung aussehen könnte.
Die sauberste Version des Arguments ist auch die kürzeste: Videomodelle bearbeiten nicht direkt Dateien; FFmpeg und andere Werkzeugaufrufe erledigen die Arbeit, und das Harness-Gerüst verleiht dem Agenten Ziele, Speicher, Schleifen und praktische Fähigkeiten. Sobald man diese drei Teile auseinanderhält, lässt sich der Rest des KI-Agenten-Stacks, einschließlich der Teile, die letztendlich Ihre Trainingsdaten berühren werden, deutlich einfacher durchdenken.
Dies ist ein themenbezogener Ausschnitt aus dem längeren Livestream. Das vollständige Argument, einschließlich des Bildschirmaufnahme-Walkthroughs der GX10-Einrichtung, ist auf YouTube zu finden: LLMs bearbeiten keine Videos. Das erledigen Werkzeuge und Harnesses.