Fable ist zurück: Warum die Harness von Claude Code Open-Source-Modelle übertrifft
Toby erklärt, warum Fable offenen Modellen weiterhin überlegen ist, wie die Harness von Claude Code eine rekursive Schleife erzeugt und warum der Vergleich von LLMs ohne Werkzeuge fehlerhaft ist.
Nach einem kurzen Verschwinden von der Spitze der Bestenliste ist Fable zurück – und meiner Erfahrung nach bleibt es der absolute Goldstandard für KI-gestützte Entwicklung. Doch während die Debatten auf Twitter und Reddit weiter toben, ist mir ein grundlegendes Missverständnis aufgefallen, wie diese Tools bewertet werden. Ist Fable besser als Cursor oder die neuesten Open-Source-Modelle? Die direkte Antwort lautet ja, aber nicht nur wegen der Modellgewichte. Fable gewinnt aufgrund der Claude Code-Harness.
Ich habe unzählige Beiträge gesehen, die behaupten, Open-Source-Modelle wie MiniMax M3 seien „genauso gut" wie Fable. Nach monatelanger täglicher Nutzung mit mehreren Modellen, lokalen Setups und cloudbasierten Agenten kann ich Ihnen definitiv sagen: Das sind sie nicht. Der Unterschied liegt nicht nur in der Kernintelligenz, sondern im gesamten System, das diese Intelligenz umgibt. Wenn Sie ein Modell vergleichen, ohne dessen Harness zu vergleichen, gelangen Sie zu fehlerhaften Schlussfolgerungen.
Das direkte Urteil: Fable dominiert weiterhin
Lassen Sie mich völlig klarstellen, wo ich stehe, nachdem ich Fable sowohl vor seiner Abwesenheit als auch seit seiner Rückkehr ausgiebig genutzt habe: Dieses Modell ist bahnbrechend gut. Wenn ich es einmal anweise, liefert es vollständige Feature-Sets basierend auf diesem einzelnen Prompt. Es schreibt Tests mit hoher Qualität und bemerkenswert wenigen Fehlern. Es ist der beeindruckendste Sprung in der KI-gestützten Entwicklung, den ich bis heute gesehen habe.
Um meine Worte in die Tat umzusetzen: Seit Fables Rückkehr habe ich bereits 52% meines verfügbaren Kontingents verbraucht – was die Hälfte meiner gesamten Modellnutzung über alle Plattformen hinweg ausmacht. Das sollte Ihnen alles sagen, was Sie wissen müssen, wohin mein Vertrauen geht, wenn ich tatsächlich Arbeit zu erledigen habe.
Der Harness-Unterschied: LLM vs. System
Das kritische Konzept, das in der Debatte „Modell A vs. Modell B" immer wieder übersehen wird, ist die Unterscheidung zwischen einem LLM und einem Harness. Ein Large Language Model (LLM) ist die zentrale Intelligenz-Engine. Der Harness ist das agentische System, das es umgibt – er ermöglicht Tool-Aufrufe, verwaltet rekursive Schleifen und koordiniert komplexe Dateioperationen.
Wenn jemand MiniMax M3 in einem Tool wie Hermes mit Fable in Cursor vergleicht, führt er keinen fairen Test durch. Er vergleicht zwei völlig unterschiedliche Architekturansätze:
- MiniMax M3 + Hermes: Hermes nutzt eine rekursive Lernschleife. Während es Anfragen stellt, lernt es und passt sich an, aufbauend auf dem, was das LLM selbst leisten kann. Hermes ist in seiner agentischen Entwicklung weiter als viele Standard-IDE-Erweiterungen.
- Fable + Cursor: Obwohl Cursor eine ausgezeichnete IDE ist, wurde es ursprünglich als eher traditionelles Coding-Tool entwickelt.
Es fehlen oft die fortschrittlichen, tief integrierten Harness-Fähigkeiten, die Fable in einer Kommandozeilen-Umgebung wirklich glänzen lassen.
Dies ist kein A/B-Vergleich von Modellen; es ist ein Vergleich von Systemen. Und genau jetzt ist das Claude Code-Harness das überlegene System.
Fables Geheimnis: Die Claude Code-Rekursionsschleife
Was Fable innerhalb des Claude Code-Harness auf einem höheren Niveau arbeiten lässt, ist seine rekursive Fähigkeit. Hier passiert genau das, wenn du in meinem aktuellen Workflow die Eingabetaste drückst:
- Informationsbeschaffung: Du gibst einen Prompt ein, und Fable beginnt sofort, alle verfügbaren Informationen lokal aus deiner Codebasis zu sammeln.
- Lokale Werkzeugausführung: Es führt zahlreiche Werkzeugaufrufe lokal aus und fördert Daten zutage, die ein Standard-Chat-Fenster niemals sehen würde.
- Token-lastiger Kontext: Es sendet all diese synthetisierten Informationen mit einer beträchtlichen Anzahl von Tokens zurück in die Cloud, um sicherzustellen, dass der Kontext perfekt ist.
- Ergebnisgenerierung: Es gibt ein hochwertiges Ergebnis zurück, das auf diesem tiefen Kontext basiert.
- Validierung: Es überprüft und validiert das Ergebnis anhand der bestehenden Codebasis, bevor es finalisiert wird.
Wenn du Fable in Cursor verwendest, verpasst du diese vollständige rekursive Schleife. Du verlierst die spezifischen Validierungsschritte, die Fable „magisch" erscheinen lassen. Deshalb beschweren sich Benutzer, die das Modell nur über eine einfache Benutzeroberfläche nutzen, oft über Qualitätsverluste, während diejenigen, die den CLI-Agenten verwenden, durchgehend hervorragende Ergebnisse sehen.
Warum lokale Modelle nicht aufgeholt haben
Ich bin ein großer Verfechter lokaler Hardware. Meine aktuelle Entwicklungsumgebung ist robust und verfügt über einen M3 Ultra mit 96GB RAM sowie einen DGX Spark (ASOS G's GX10), der in meine Exo-Konfiguration eingebunden ist. Ich betreibe Qu3 Coder über diese Systeme hinweg mit unglaublich schneller Kommunikation. Ich liebe MiniMax M3 und habe mich lautstark über seine Stärken geäußert; ich betreibe es sogar innerhalb meiner Hermes-Agenten.
Jedoch ersetzen die lokalen Modelle selbst mit 96GB lokalem Speicher und Hochgeschwindigkeits-Verbindungen nicht die Cloud-basierte Leistung und das ausgeklügelte Harness von Fable. Selbst wenn die Gewichte von MiniMax M3 vollständig für den lokalen Betrieb verfügbar werden, wird eine Standard-VS-Code-Erweiterung nicht die enge Integration von Claude Code erreichen. Die Engineering-Stunden, die Anthropic in die Interaktion zwischen Fable und seinen Werkzeugen investiert hat, sind der unsichtbare Burggraben.
Wer sollte welches Werkzeug wählen?
Die Entscheidung, wo du deine Abonnement-Dollar ausgibst, hängt vollständig von deinem Workflow und deinem technischen Komfortniveau ab.
Wähle Fable + Claude Code, wenn:
- Du ein professioneller Entwickler bist, der vollständige Funktionen aus einzelnen Prompts ausliefern muss.
- Du dich in einer terminalbasierten Agentenumgebung wohlfühlst.
- Du Genauigkeit und rekursive Selbstkorrektur einer traditionellen GUI vorziehst.
- Du bereit bist, die $200-Prämie für die höchste verfügbare „Trefferquote" bei der Codegenerierung zu zahlen.
Wähle Cursor + Open-Source/Standard-Modelle, wenn:
- Du eine GUI-zentrierte Erfahrung mit traditionellem IDE-Gefühl bevorzugst.
- Du an kleineren Skripten oder Frontend-Anpassungen arbeitest, bei denen ein vollständiger rekursiver Agent überdimensioniert ist.
- Du die Kosten niedrig halten musst und die Flexibilität bevorzugst, zwischen GPT-4o, Claude 3.5 Sonnet und lokalen Modellen zu wechseln.
Das endgültige Urteil
Fable bleibt das beste Modell, das ich je verwendet habe. Seine Rückkehr hat keine der Verschlechterungen gezeigt, die von anderen in der Community berichtet wurden, hauptsächlich weil ich mich weigere, es ohne sein vorgesehenes Harness zu verwenden. Wenn du für mehrere KI-Abonnements bezahlst und dich fragst, wo du konsolidieren sollst, ist meine Antwort klar: Fable innerhalb von Claude Code ist die Investition wert.
Ich würde fast jedes andere Werkzeug in meinem Kit fallen lassen—einschließlich meiner eigenen Multi-Model-Routing-Projekte—, um diese Kombination ausschließlich zu verwenden, wenn die Preisgestaltung stabil bleibt. Der Unterschied zwischen dem Lesen über Modellqualität und dem Erleben der Effizienz eines High-End-Harness ist der Unterschied zwischen dem Spielen mit einem Spielzeug und der Nutzung eines professionellen Werkzeugs. Hör auf, die Gewichte zu vergleichen, und fang an, die Ergebnisse des gesamten Systems zu vergleichen.