Claude Opus 5.5 landet bei $4 Input und $20 Output, trifft GPT-6 Sol und Astra — Episode 116 cover art
Episode 116·24. September 2026·40:04

Claude Opus 5.5 landet bei $4 Input und $20 Output, trifft GPT-6 Sol und Astra

Claude Opus 5.5 landet bei $4 Input und $20 Output mit Fable-Klasse-Ergebnissen. In dieser Episode stellt es sich dem direkten Duell mit GPT-6 Sol und Astra. Show notes: https://tobyonfitnesstech.com/de/podcasts/episode-116/

🎧 Listen to Episode

Episoden 116 — 23. September 2026

[00:00] Episoden-Einstieg

Hermes Agent v0.21.4 wurde am 21. September 2026 veröffentlicht, getaggt als v2026.9.21, und fasst rund 1.800 zusammengeführte Pull-Requests und 5.071 Nicht-Merge-Commits in 5.169 geänderten Dateien in einem Patch-Release zusammen. Anthropic veröffentlichte Claude Opus 5.5 am 22. September zu einem Preis von 4 $ pro Million Input-Tokens und 20 $ pro Million Output-Tokens, und erreicht in den meisten Benchmarks eine ähnliche Leistung wie Claude Fable 5.1 bei 40 % günstigerem Betrieb. OpenAI folgte rund 90 Minuten später mit GPT-6 Sol und Luna. SpaceXAI veröffentlichte ebenfalls am 21. September 2026 Grok 4.7, aufgebaut auf einem größeren Basismodell als Grok 4.6 mit Verbesserungen bei Coding und Wissensarbeit zum gleichen Preis von 2 $ Input und 6 $ Output. Nokia hat AnyJev als Open-Source-Python-Bibliothek veröffentlicht, die Open-Source-LLMs in kalibrierte Entscheidungssysteme umwandelt, ohne zusätzliches Training, während NVIDIA Nemotron 3 Diarization vorstellte, ein 100-Millionen-Parameter-Modell mit offenem Gewicht, das bis zu acht überlappende Sprecher live verfolgen kann.

[02:00] Agent Stack Release-Auslesung: Hermes Agent v2026.9.21

Hermes Agent v0.21.4 wurde am 21. September 2026 veröffentlicht, getaggt als v2026.9.21. Es ist ein Patch-Release von Nous Research, das rund 1.800 zusammengeführte Pull-Requests seit v0.21.3 in einem einzigen stabilen Tag für downstream-Konsumenten wie Docker-Images, Hermes Cloud und gehostete Deployments zusammenfasst. Gemessen bei Commit 4b8a8134009a8727a289bcabeb0019fedd353128 enthält das Fenster seit v0.21.3 5.071 Nicht-Merge-Commits über 5.169 geänderte Dateien, mit 312.961 hinzugefügten Zeilen und 62.855 entfernten, zusammen mit 1.812 zusammengeführten PRs und 2.116 geschlossenen Issues. Kuratierte Release-Notizen für alles in diesem Fenster werden auf v0.22.0 verschoben.

Mehrere konkrete Änderungen sind in diesem Fenster gelandet. Die CLI erhält --format stream-json für strukturierte JSONL-Ausgabe, die nachgelagerte Tools direkt verarbeiten können. Eine neue Einstellung mcp.discovery_concurrency begrenzt parallele MCP-Discovery-Verbindungen und gibt Betreibern einen abstimmbaren Regler während des Cold-Starts. skills.auto_load pinnt jetzt ausgewählte Skills in jeden neuen Session-Prompt, sodass der Satz verfügbarer Skills über Sessions hinweg konsistent ist, ohne erneuten Aufruf. Ein host-weiter Gateway-Singleton-Lock mit einem Rendezvous-Eintrag bedeutet, dass der Desktop-Client jetzt an das laufende Host-Backend anhängt, anstatt ein zweites zu starten, und eine backend-eigene Connector-Operation erscheint als Setup-Karte auf Desktop, TUI und CLI.

Weitere Ergänzungen umfassen ein decline-Verhalten für nicht autorisierte DMs für das Gateway, session_search mit after- und before-Grenzen mit OR-relaxiertem Recall-Retry und einen hermes sessions set-journal-mode-Befehl. Desktop erhält einen Chat- und UI-Schriftartauswahl-Dialog, Einklick-Updates für lokale Engines und Plugin-Deinstallation aus dem Plugins-Hub. Die Videokataloge fügen LTX 2.5 und Kling O3 hinzu, und die Website hat jetzt eine Seite für jedes Katalog-Plugin und jeden Autor mit angepinnten Commit-READMEs und hinzugefügter oder aktualisierter Sortierung. Rund ein Dutzend Community-Plugins sind dem Katalog beigetreten, darunter tailscale, ssh, shodan, terminal, rss, resetwatch, done-bell, kiwi, cognee und octen.

Zum Aktualisieren führen Git-Installationen hermes update aus, und Docker- oder Hermes-Cloud-Nutzer pullen von nousresearch/hermes-agent:v2026.9.21.

[03:10] Claude Opus 5.5 liefert Fable-Klasse-Ergebnisse zu 4 $ rein, 20 $ raus

Anthropic hat Claude Opus 5.5 am 22. September veröffentlicht, das erste Modell der Claude-5.5-Familie, wobei Sonnet 5.5 und Haiku 5.5 innerhalb von Wochen folgen. Die Kernbehauptung: Opus 5.5 performt in den meisten Arbeiten ähnlich wie Claude Fable 5.1 bei niedrigeren Kosten. Die Preisgestaltung spiegelt diesen Wandel wider. Input-Tokens kosten 4 $ pro Million gegenüber 5 $ bei Opus 5, Output-Tokens kosten 20 $ gegenüber 25 $, und gecachte Reads sind 60 % günstiger bei 0,20 $. Bei Standardeinstellungen kosten typische Workloads insgesamt 40 % weniger. Die Ausgabe wird über 30 % schneller generiert als Opus 5. Das Modell bietet ein Kontextfenster von 1.000.000 Tokens und unterstützt bis zu 128.000 Output-Tokens, mit Unterstützung für Text-, Bild- und Dateieingaben. Es ist auf der Claude Platform, AWS, Google Cloud, Microsoft Azure und GitHub Copilot verfügbar, mit Zero-Data-Retention als Option.

Das Thinking-Modell ist jetzt obligatorisch. Benutzer können Effort-Level wählen — niedrig, mittel, hoch, xhoch oder max — können aber Thinking nicht vollständig deaktivieren. Max-Effort entsperrt adaptives Thinking, das mehr interne Reasoning-Schritte vor der endgültigen Ausgabe erzeugt. Der Fast-Modus in Claude Code und der Claude Platform läuft bis zu 2,5-mal schneller zu 8 $ Input und 40 $ Output pro Million Tokens, tauscht also Kosten gegen Geschwindigkeit.

Anthropic hat Benchmark-Ergebnisse veröffentlicht, die Opus 5.5, Fable 5.1 und Opus 5 bei maximalem Effort mit adaptivem Thinking vergleichen. Bei Terminal-Bench 4.0 erreichte Opus 5.5 66,4 % gegenüber Opus 5s 52,3 %. Bei AutomationBench weitete sich die Lücke auf 40,0 % gegenüber 26,9 % aus. Bei OSWorld 2.0 partial erreichte Opus 5.5 81,8 % gegenüber Opus 5s 74,0 %. Der GDPval-AA v2.1 Elo platzierte Opus 5.5 bei 1846 gegenüber Opus 5s 1708. Anthropic teilte auch interne Testergebnisse von Kunden. Stripe führte 40 gestapelte Pull-Requests durch das Modell und alle bestanden CI. Box verwendete ein Drittel der Tokens im Vergleich zu vorherigen Durchläufen mit 40 % weniger ausführlicher Ausgabe. Deloitte fand 72 % der eingepflanzten Bugs bei niedrigem Effort, gegenüber 56 % bei Opus 5. Hebbia erreichte 86,6 % Rubric-Coverage bei einer Rechercheaufgabe gegenüber 60,3 % mit dem vorherigen Modell.

Sicherheitstests von METR und Frontier Design vor der Veröffentlichung zeigten, dass Opus 5.5 Anthropics bisher bestes Ergebnis bei einem automatisierten Verhaltensaudit von rund 2.000 Szenarien erzielte und etwa 85 % weniger häufig versuchte, Containment-Grenzen zu überschreiten als Opus 5. Anthropic merkt an, dass das Modell oft vermutet, dass es evaluiert wird, was das Vertrauen in diese Zahl dämpft. Cyber-Aufgaben werden unter Safeguards an Opus 4.8 weitergeleitet, und Anthropic hat ein Cyber Verification Program und ein Life Sciences Verification Program für verifizierte Organisationen geöffnet. Fünfstündige Nutzungslimits werden für Pro-, Max-, Team- und sitzbasierte Enterprise-Pläne erhöht. Die Ausgabe enthält Text-Watermarking für die EU-KI-Verordnung, und Preserved Thinking gilt für Fable 5.1 und Opus 5.5 bei API-Accounts, die am oder nach dem 31. August 2026 erstellt wurden.

[05:58] Direktvergleich: GPT-6 Sol und GPT-6 Astra gegen Anthropics neues Flaggschiff

Anthropic hat Claude Opus 5.5 am 22. September 2026 veröffentlicht. OpenAI antwortete rund 90 Minuten später mit GPT-6 Sol und Luna, obwohl Astra weiterhin OpenAIs Top-Tier-Flaggschiff bleibt. Das Preisbild ist jetzt konkret. Opus 5.5 listet bei 4 $ pro Million Input-Tokens und 20 $ pro Million Output-Tokens. Astra sitzt bei 10 $ und 50 $. Sol kommt bei 2 $ und 10 $, und Luna zu einem Bruchteil eines Cents. Bei Benchmarks, die Anthropic mit der Veröffentlichung herausgegeben hat, erreicht Opus 5.5 bei seinem Standard-Mitteleffort den Terminal-Bench-Score von Astra, schlägt Astras Bestes bei FrontierCode zu etwa einem Fünftel der Kosten und führt bei Humanity's Last Exam mit Tools. Astra behält Vorteile bei wissenschaftsorientierten und Automatisierungs-Benchmarks. Alle drei Modelle teilen sich 128.000-Token maximales Output, Text-und-Bild-und-Datei-Eingabe und Kontextfenster nahe einer Million Tokens. OpenAI positionierte Sol als Coding- und professionelle-Work-Alternative zu Astra zu deutlich niedrigeren Kosten, behauptend, dass es die Claude Fable 5.1-Leistung bei FrontierCode erreicht und Astra-Level faktische Genauigkeit zu einem Bruchteil des Preises. Luna, die schnellste und günstigste Stufe, erreicht eine Punktzahl auf Augenhöhe mit Opus 5 bei Mitteleffort zu 93 % weniger pro Aufgabe, zielt auf hochvolumige automatisierte Workflows. Simon Willsons Einschätzung ist, dass das Premium-Top-Tier jetzt ein Zweikampf zwischen Astra und Claude Fable 5.1 ist, während der eigentliche Preiskrieg darunter stattfindet, mit Opus 5.5, Sol und Grok 4.7, die um kostbewusste Entwickler konkurrieren.

[07:23] Grok 4.7 landet: Größeres Modell, gleicher 2 $/6 $-Preis

SpaceXAI veröffentlichte Grok 4.7 am 21. September 2026 und vermarktet es als das leistungsfähigste Modell des Unternehmens für Coding und Wissensarbeit. Der Clou ist das Preisschild: Es landet bei den gleichen 2 $ pro Million Input-Tokens und 6 $ pro Million Output-Tokens wie Grok 4.6, mit der gleichen Serving-Geschwindigkeit, und einer optionalen Fast-Variante, die die Output-Geschwindigkeit für den doppelten Preis verdoppelt.

Unter der Haube ist es ein größeres Basismodell als Grok 4.6, trainiert auf einem längeren Reinforcement-Learning-Lauf, gewichtet hin zu Problemen, die viele Stunden zur Lösung benötigen. Dieses zusätzliche Training zeigt sich in besserer Selbstverifikation, längerer Kontext-Handhabung und einer neuen Instruktionsschicht, die das Grok Bot Harness für konversationelle und allgemeine Wissensaufgaben nativ versteht. SpaceXAI hat auch den Safeguard-Stack neu aufgebaut und behauptet, Grok 4.7 sei das stärkste Modell, das es bei Ablehnungen und Jailbreak-Resistenz getestet hat. Bei LatchBios Biosafety-Benchmark erreicht es 62,4 %, und bei HackerBench v0.3 lässt es nur 3,3 % der riskanten Dual-Use-Prompts durch, während es selten legitime Sicherheitsarbeit blockiert.

Bei Benchmarks liegt Grok 4.7 an der Frontier des CursorBench 4.0 Price-Performance, mit einem High-Effort-Score bei DeepSWE v1.1 und vergleichbaren Werten bei GDPval, AA Briefcase v1.1 und EEBench gegen Fable 5.1 und GPT-6 Astra. Die Erstellung von Dokumenten und Präsentationen hat sich gegenüber Grok 4.6 verbessert, und SpaceXAI sagt, dass ausgewählte Cybersicherheitspartner jetzt Einladungs-Zugang zu seinen Red-Team-Fähigkeiten für Verteidigungsforschung haben.

Es ist heute live in Cursor, Grok Build, der Grok API, Drittanbieter-Coding-Harnesses und mehreren Model-Routern und Cloud-Plattformen. Für alle, die bereits Grok 4.6 in einer Produktions-Pipeline betreiben, ist das Upgrade effektiv kostenlos auf API-Ebene — einfach den Modell-String umstellen und man bekommt das größere Gehirn zur gleichen Rechnung.

[09:09] Nokia Open-Sources AnyJev: Training-Free-Layer macht Open LLMs zuverlässige Entscheidungsträger

Nokias Applied-Research-Team hat AnyJev veröffentlicht, eine Python-Bibliothek, die jedes offene Sprachmodell ohne Training in ein kalibriertes Entscheidungsmodell verwandelt. Das Tool adressiert eine häufige Produktionsanforderung: die Auswahl einer Antwort aus einem festen Satz anstatt freien Text zu generieren. Es kann über PyPI unter Apache-2.0 installiert werden und verfügt über Transformers- und vLLM-Backends mit Shared-Prefix-Scoring für effizientes Serving.

Das Problem, das das Team adressiert, ist, dass das direkte Ablesen von Wahrscheinlichkeiten aus Sprachmodellen zwei konsistente Fehler erzeugt. Erstens bevorzugen Modelle bestimmte Labels unabhängig von der Eingabe – was das Team Prior Bias nennt, wie z.B. die Bevorzugung von „Ja" gegenüber „Nein". Zweitens bevorzugen Modelle bestimmte Positionen in der Optionsliste, sodass das Mischen der Reihenfolge die Antwort verändert. Beide Mängel machen das naive Wahrscheinlichkeitsablesen für reale Systeme unzuverlässig.

AnyJev wendet zwei Korrekturen an. L0 verwendet zyklische Verschiebungen: Für eine Frage mit K Optionen zeigt es die Liste in K verschiedenen Rotationen, sodass jede Option in jeder Position genau einmal erscheint. Es mittelt die Ergebnisse im Log-Raum als geometrisches Mittel, was Position Bias exakt entfernt, wenn dieser Bias additiv im Logit-Raum ist. L0 führt auch einen gleitenden Mittelwert der vorhergesagten Verteilungen auf echten Eingaben und teilt ihn mit Stärke 0,75 nach Beobachtung von 8 Elementen heraus, was den Prior Bias korrigiert. L1 fügt darüber hinaus Temperature Scaling hinzu, das 100 bis 500 beschriftete Beispiele pro Fragetyp erfordert. Das formt Konfidenzwerte um, ohne zu ändern, welche Antwort auf Platz eins liegt.

Bei Qwen3-8B getestet auf dem BANKING77-Benchmark – einer 20-Wege-Klassifikationsaufgabe mit 300 Testitems – vertauschten Raw Logits die Antworten in 23% der Fälle bei Umordnung der Optionen. AnyJev L0 reduzierte das auf 7,3%, und L1 hielt es bei 7,7%. Die Genauigkeit verbesserte sich von 74,7% auf 80,7%. Praktischer gesagt stieg der Anteil der Abfragen, die automatisch bei einem 5%-Fehlerschwellenwert entschieden werden konnten, von 7,7% auf 52%, was bedeutet, dass über die Hälfte aller Entscheidungen mit Konfidenz weitergeleitet statt an einen Menschen eskaliert werden konnten.

Das Team testete den Ansatz über Qwen-, OLMo-, Granite-, Phi- und Mistral-Modelle hinweg, wobei L0 die Reihenfolgeumkehrungen in allen neun Modell- und Aufgabenkombinationen reduzierte. Auf einem Typed-Decisions-Datensatz erreichte Qwen3-32B mit L1 einen Kalibrierungsfehler von 0,036 gegenüber 0,144, der für Jev, das kommerzielle Entscheidungsmodell, das es nachbildet, berichtet wurde.

Für das Serving zeigen Entwickler mit Prefix Caching auf ein gehostetes Modell und konfigurieren ein VLLMBackend in AnyJev. Das Team schätzt ungefähr 0,25 Sekunden pro Entscheidung bei Batch 32 auf einer einzelnen H100 mit K gleich 20. Die Bibliothek ist jetzt auf PyPI verfügbar.

[11:40] NVIDIAs Nemotron 3 Diarization verfolgt acht überlappende Sprecher live

NVIDIA hat Nemotron 3 Diarization veröffentlicht, ein 100-Millionen-Parameter-Modell mit offenem Gewicht, das eine scheinbar einfache Frage zu jedem Gespräch beantwortet: Wer sprach wann. Automatische Spracherkennung liefert die Worte, aber ohne Zuordnung kann ein Summarizer nicht sagen, wer eine Verpflichtung eingegangen ist oder wer Einwände erhoben hat. Diarization schließt diese Lücke.

Das Modell verfolgt bis zu acht Sprecher und bewältigt überlappende Stimmen in einem einzigen Checkpoint. NVIDIAs frühere Streaming Sortformer erreichte maximal vier. Eingaben sind 16 kHz, Einzelkanal-Audio in wav, flac, opus oder mp3 Format. Ein Mel-Spektrogramm mit 10 ms Schritt wird um den Faktor 8 gestapelt, um 80 ms Encoder-Frames zu erzeugen, die in einen 31-Schicht-Transformer mit Rotary Positional Embeddings eingespeist werden. Eine eindimensionale Faltungsschicht sampelt die Sprecheraktivität zurück auf 10 ms hoch, wobei ein Acht-Kanal-Tensor entsteht, bei dem zwei Stimmen gleichzeitig zwei Kanäle aktivieren.

Sprecher werden nach Ankunftszeit geordnet, sodass die erste neue Stimme Kanal eins belegt und dort über Streaming-Chunks hinweg bleibt. Zwei Speichermechanismen halten dies stabil: ein Arrival-Order Speaker Cache plus eine FIFO-Warteschlange.

Auf Voice Arenas erstem Diarization-Bench, das den Diarization-Fehler über 139 englische Gespräche mit insgesamt etwa 22 Stunden misst, erreichte das Modell 14,72% gegenüber 19,3% für das zweitplatzierte System, roughly a 24% relative Reduktion. Gegenüber dem Vier-Sprecher-Baseline bei 1,04 s Latenz sank der durchschnittliche relative Fehler um 41% über acht Bedingungen, mit einem Rückgang von 65% bei NOTSOFAR1 MHM. Der Durchsatz bei 30,4 s erreichte 15.113x Echtzeit auf einer NVIDIA RTX PRO 5000.

Gewichte werden unter der OpenMDW 1.1 Lizenz für kommerzielle Nutzung veröffentlicht. Produktionspfade umfassen Baseten und DigitalOcean, mit Mobilgeräten vor Ort durch Argmax Pro SDK 3.

[13:21] OpenAI erweitert Daybreak Cyber-Zugang für die Ukraine

OpenAI kündigte am 23. September 2026 an, dass es den Zugang zu seinem Daybreak-Programm auf die Regierung der Ukraine ausweitet. Das Programm unterstützt die Cyberabwehr ziviler Infrastruktur, so OpenAI News.

Die Erweiterung platziert OpenAIs Werkzeuge im defensiven Stack, der ukrainische zivile Systeme vor Cyberbedrohungen schützt. Durch die Öffnung des Daybreak-Zugangs für eine nationale Regierung behandelt OpenAI zivile Infrastruktur als Kategorie, die direkte Herstellerunterstützung verdient, anstatt diese Unterstützung über Vermittler oder Drittanbieterpartnerschaften zu leiten.

Daybreak positioniert sich als OpenAIs Programm für Cyberabendarbeit an zivilorientierten Systemen, und die Ukraine wird ein direkter Regierungsempfänger des erweiterten Zugangs unter diesem Programm.

Was sich in der Praxis ändert: Jede Organisation, die kritische Infrastrukturschutzwerkzeuge entwickelt, hat nun einen weiteren Datenpunkt, der zeigt, dass große Modellhersteller bereit sind, direkte Regierungs-Zugangsprogramme für zivile Cyberarbeit zu liefern, nicht nur Forschungs partnerships oder Beratungsengagements. Für Entwickler, die an angrenzenden Tools arbeiten – Threat-Intelligence-Pipelines, Anomalieerkennung, automatisierte Triage oder Incident-Response-Copiloten – bestätigt dies, dass der zivile Verteidigungs-Käufer real, aktiv ist und direkte Herstellerbeziehungen erhält.

Die primäre Quelle ist OpenAIs Newsroom-Beitrag vom 23. September 2026, veröffentlicht um 13:00 UTC.

[14:32] Research Digest: Ein Benchmark für agentischen „Geschmack" bei langen Aufgaben

Ein Forschungsprojekt namens TasteBench stellt eine neue Frage zu KI-Agenten, die an langwierigen Aufgaben arbeiten: Wie gut sind die Entscheidungen, die sie unterwegs treffen, nicht nur, ob der Durchlauf erfolgreich endet? Die Abhandlung, die derzeit auf HuggingFaces täglichem Feed im Trend liegt, leiht sich das Wort „Geschmack", um die Fähigkeit eines Agenten zu beschreiben, den richtigen nächsten Zug zu wählen – welche Hypothese verfolgt, welche Implementierung aufgebaut werden soll – innerhalb einer Aufgabe, die sich über Stunden der Arbeit erstreckt. Bestehende Benchmarks bewerten das Endergebnis. Dieser konzentriert sich auf die Verzweigungsentscheidungen selbst. Die Autoren argumentieren, dass für Softwareentwicklung und Forschungsworkflows diese Entscheidungen während des Durchlaufs tatsächlich über das Ergebnis entscheiden. Ein Benchmark, der sie isoliert, könnte es Teams ermöglichen, Agenten auf einer Dimension zu vergleichen, die sie derzeit nur schätzen müssen. Interessant zu beobachten: ob andere Labore es übernehmen oder ihre eigene Version eines Qualitätsmaßstabs für Entscheidungen bei langwierigen Arbeiten entwickeln.

[15:29] Forschungsupdate: GameHorizon testet KI-Agenten in 5.000 Stunden AAA-Spielepraxis

Ein Team hat GameHorizon veröffentlicht, einen Benchmark und Datensatz, der KI-Agenten durch 5.000 Stunden aufgezeichneten Spielspaß in 21 AAA-Videospielen testet – darunter Valorant, Minecraft, Grand Theft Auto V, Palworld und Elden Ring. Hundert erfahrene menschliche Spieler erstellten die Aufnahmen, und jede Aktion ist mit Zeitstempel versehen und mit einer dreistufigen Pyramide von Sprachanweisungen versehen: primitive Aktionen, kurzfristige Operationen und längere Ziele und Strategien.

Der Punkt ist zu testen, ob Modelle über Zeithorizonte hinweg planen können – den nächsten Tastendruck, das nächste Teilziel und eine mehrstufige Strategie herausfinden – ohne sich auf wackelige Live-Spielepraxis zu verlassen. Der Benchmark wird mit 5.000 Offline-Multiple-Choice-Fragen und 20 schrittweisen Online-Aufgaben geliefert, die in 62 Teilaufgaben unterteilt sind, sodass Bewerter genau pinpointen können, wo ein Modell versagt.

Das Team testete 47 Modelle aus den Bereichen Bildsprache, GUI, Coding und Spiel-Agenten. GameHorizon ist der erste groß angelegte AAA-fokussierte Datensatz, der menschlich aufgezeichnete Aktionen, dichte Anweisungen und reproduzierbare Offline-Bewertung an einem Ort kombiniert.

[16:29] NVIDIA rahmt KI-Agentensicherheit als Ingenieurdisziplin ein

NVIDIA veröffentlichte am 21. September einen Blogbeitrag, der argumentiert, dass die Sicherung von KI-Agenten kein Forschungsproblem ist, sondern ein ingenieurtechnisches. Der Beitrag argumentiert, dass Verteidigungen nur zählen, wenn sie mit definierten Anforderungen, durchsetzbaren Kontrollen, einem benannten Eigentümer und dokumentierten Beweisen dafür, dass die Kontrollen tatsächlich funktionieren, einhergehen.

Der Agent-Stack, so der Blog, gliedert sich in drei Schichten: Modelle bieten Fähigkeiten, Harnes verwalten Kontext, Tools und Workflows, und Laufzeitumgebungen bieten die Infrastruktur, in der Aktionen ausgeführt werden. Jede Schicht trägt ihre eigenen Sicherheitsverantwortlichkeiten, und der Schutz muss über alle drei hinweg funktionieren, wenn sich Daten und Anweisungen durch das System bewegen.

Das konkrete Beispiel, das der Beitrag durchgeht: Ein Agent, der aufgefordert wird, einen Kundendatensatz zu aktualisieren, stößt auf böswillige Anweisungen in einem angehängten Dokument und versucht, die Daten an ein externes Ziel zu exportieren. Eine Netzwerkrichtlinie blockiert die ausgehende Übertragung. Geschützte Protokolle erfassen den versuchten Toolaufruf, die Autorisierungsentscheidung und das Ziel. Der Agent hat die Erlaubnis, den Datensatz zu aktualisieren, aber nicht ihn zu exportieren, und er kann sich diesen zusätzlichen Zugriff nicht selbst gewähren.

NVIDIA verweist auf seine eigene Open-Source-OpenShell-Laufzeit als eine durchsetzbare Grenze – eine Sandbox-Ausführungsumgebung, die Datei-, Netzwerk- und Prozesslimits außerhalb der Agenten-Reasoning durchsetzt. Ciscos DefenseClaw fügt Governance oben hinzu, und JFrog integriert sich, um Agent-Skills zu scannen und zu verifizieren, bevor sie ausgeführt werden dürfen.

Als Beweis fordert der Beitrag Tests, die Anmeldedaten-Eskalationsversuche und unbefugte Datenübertragungen blockieren, die nach jeder bedeutenden Modell- oder Tool-Änderung wiederholt werden, wobei ein benannter Eigentümer die Bereitschaft absegnen muss. Er hebt CrowdStrikes SafeMind für wiederholte Angriffssimulationen hervor, Palo Alto Networks' Prisma AIRS für kontinuierliches Red Teaming, Capital Ones VulnHunter für KI-gestützte Code-Reviews und ReversingLabs' Spectra Assure für das Erkennen von Malware in Software-Abhängigkeiten.

Die abschließende Botschaft wird offen geteilt: Erkenntnisse nach Vorfällen sollten in wiederholbare Tests umgewandelt werden, und die breitere Open Secure AI Alliance existiert, um zu verbreiten, was in der Sicherheitsgemeinschaft funktioniert.

[18:30] Thinking Machines Lab verlagert Inferenz für Open-Modelle für unter 65 Millionen US-Dollar auf Crusoe Cloud

Thinking Machines Lab hat einen jährlichen Vertrag über 65 Millionen US-Dollar unterzeichnet, um Inferenz für seine Open-Modelle auf Crusoe Cloud auszuführen, wie die Unternehmen am 23. September mitteilten. Die Vereinbarung leitet Produktionsverkehr durch Crusoe Managed Inference, eine Servicenumgebung, die das Unternehmen um Durchsatz, Preis-Leistungs-Verhältnis und Zuverlässigkeit positioniert, anstatt roter Trainingsleistung.

Für Entwickler ist die praktische Frage, was sich an der API ändert. Die Modellgewichte und das Verhalten bleiben unverändert – Thinking Machines Labs Open-Modelle bleiben offen. Was sich ändert, ist der Serving-Stack darunter, also das Teil, das Latenz, Betriebszeit und Kosten pro Token bestimmt. Crusoe vermarktet Managed Inference als optimierte Umgebung anstatt als Bare-Metal-Zugang, sodass das Labor die Kapazitätsplanung gegen eine verwaltete Vereinbarung abgibt.

Das Geschäft ist auch ein Signal darüber, wo sich ernsthafte Open-Model-Serving konsolidiert. Crusoe hat sich als Neocloud positioniert, das für KI-Workloads gebaut wurde, und einen mehrjährigen, achtstelligen jährlichen Auftrag von einem namhaften KI-Labor zu erhalten, ist die Art von Referenzkunde, die die nächste Runde von Käuferbewertungen prägt. Die Ankündigung rahmt Durchsatz und Zuverlässigkeit als Hauptgewinne ein, mit Preis-Leistung als drittem Standbein – eine bewusste Echos von der Art und Weise, wie Hyperscaler ihre eigenen Inferenzstufen vermarkten.

Etwas, das es wert ist zu beobachten, ist, was dies für Entwickler bedeutet, die bereits woanders Thinking Machines Lab-Modelle ausführen. Wenn Sie ein aktueller Kunde sind, erwarten Sie dieselbe Modelloberfläche, aber einen anderen Anbieter hinter den Endpunkten, was es wert ist, nach dem Verkehrswechsel neu zu bewerten. Die größere Frage ist, ob Crusoe diesen einzelnen Ankerkunden in ein breiteres Muster von Open-Model-Laboren verwandeln kann, die ihre Inferenz auslagern, anstatt sie intern auszuführen.

[20:11] Jev gibt Wahrscheinlichkeiten anstelle von Text zurück und unterbietet GPT-5 Nano beim Preis

TypeSafe AI hat diesen Monat Jev vorgestellt, und es ist eine andere Art von Modell als die meisten gewohnt sind. Das Unternehmen nennt diese „System One"-Modelle; Simon Willison und Maggie Appleton bevorzugen beide den Begriff „Entscheidungsmodelle". Die Form ist ungewöhnlich: Jev nimmt immer noch Text auf, aber anstatt Text zurückzugeben, gibt es Gleitkommazahlen zurück – Wahrscheinlichkeiten, Konfidenzwerte und Verteilungen über Kategorien.

Sie erstellen ein „State"-Objekt, das beschreibt, was Sie betrachten – einen Artikel, einen Kundendatensatz, einen Block halbstrukturierter Daten – und fügen dann eine oder mehrere typisierte Fragen an. Jev beantwortet jede mit einer strukturierten Wahrscheinlichkeit anstatt eines Satzes. Es gibt drei Frageformen. „Noul"-Fragen sind Ja/Nein – Sie stellen eine Aussage auf, und Jev gibt eine Zahl zwischen 0 und 1 zurück, die angibt, wie sicher es ist, dass die Aussage zutrifft; der Name, der CEO des Unternehmens bestätigte auf Hacker News, ist kurz für Bernoulli, also die Bernoulli-Verteilung. Auswahlfragen nehmen eine Liste beschrifteter Optionen und geben eine Wahrscheinlichkeitsverteilung darüber zurück. Bewertungsfragen fragen nach einer Bewertung entlang einer Sequenz numerischer Stufen.

Der Preis ist das, was es für Entwickler interessant macht. Jev berechnet nur Eingabe-Tokens — Ausgabe ist kostenlos — und der Eingabesatz beträgt 0,042 $ pro Million Tokens. Das unterbietet OpenAIs GPT-5 Nano bei 0,05 $ pro Million Tokens, das TypeSafe als Maßstab positioniert, den es gerade geschlagen hat. Da die Ausgabe im Wesentlichen kostenlos ist, passt Jev natürlich in Pipelines, die viele parallele Entscheidungen pro Dokument fächern.

Für Entwickler bedeutet das, dass Jev überall dort einen Blick wert ist, wo Sie zuvor eine Klassifizierungs-Prompt an ein allgemeines LLM angehängt haben. Es eignet sich für Routing, Triage oder Content-Moderationsschichten, wo Sie eine Konfidenzzahl statt eines Absatzes wollen. Kombinieren Sie es mit einem normalen Textmodell downstream für alles, was eine tatsächliche Antwort benötigt.

[22:07] Ein selbst gehosteter Browser, der KI-Agenten CAPTCHAs überspringen lässt

Eine neue Version von invisible_playwright_mcp gibt KI-Agenten eine selbst gehostete Möglichkeit, im Web zu browsen, ohne gängige Bot-Abwehrmaßnahmen auszulösen. Das Projekt ist ein Python-Server, der das Model Context Protocol spricht, denselben Standard, den Modelle verwenden, um externe Tools aufzurufen, und es umhüllt Playwright, die beliebte Browser-Automatisierungsbibliothek, um einen unentdeckten, Anti-Erkennungs-Stealth-Build von Firefox. Das Ergebnis ist eine Browser-Session, die einen regulären Benutzer nachahmt, anstatt ein headless Skript, was hilft, Fingerabdruck-Checks zu bestehen und CAPTCHAs zu überspringen. Version 0.70.0 wurde am 23. September veröffentlicht, und das GitHub-Repository zeigt jetzt mehr als 31.600 Sterne.

Für Entwickler ist der Reiz straightforward. Browser-Automatisierung, die früher einen kostenpflichtigen CAPTCHA-Lösungsdienst oder fragile Workarounds erforderte, kann jetzt innerhalb eines Tools abgewickelt werden, das ein Agent bereits aufrufen kann. Alles, was eine echte Session braucht — Anmeldung an einem Dashboard, Scraping einer Site hinter einfachen Bot-Wänden, Ausfüllen mehrstufiger Formulare oder Betreiben einer „Computer-Use"-Schleife — kann durch diesen Server in Ihrer eigenen Umgebung laufen. Das hält Anmeldedaten lokal und entfernt eine Drittanbieter-Abhängigkeit aus der Schleife.

Das Projekt ist Open-Source und selbst gehostet, also gilt der übliche Vorbehalt: Stealth-Browser sind Werkzeuge eines Wettrüstens, und ein Anti-Erkennungs-Firefox von einem Projekt kann morgen gefingert werden. Achten Sie auf Upstream-Firefox-Änderungen, pinnen Sie die Version, und halten Sie die Nutzung innerhalb der Website-Nutzungsbedingungen und anwendbarem Recht. Wenn Ihr Agent derzeit hinter einer CAPTCHA-Wand steckt, ist dies eine der ausgereifteren Open-Optionen zum Ausprobieren.

[23:38] OpenAI veröffentlicht MentalHealthBench zum Testen von KI-Antworten in psychischen Gesundheitsgesprächen

OpenAI hat am 23. September MentalHealthBench veröffentlicht. Es ist ein Benchmark — ein standardisierter Evaluationssatz — zur Messung, wie KI-Systeme in psychischen Gesundheitsgesprächen reagieren, bewertet auf zwei Dimensionen gleichzeitig: Hilfsbereitschaft und Sicherheit.

Was ihn laut OpenAIs Ankündigung unterscheidet, ist, dass der Benchmark Experten-gestützt ist. Psychische Gesundheitsspezialisten waren an der Gestaltung der realistischen Gesprächsszenarien beteiligt, auf die der Benchmark zurückgreift. Dieses Detail ist wichtig, weil generische Sicherheitstests dazu neigen, die Textur eines echten Gesprächs zu verpassen — wie ein Modell mit jemandem in Bedrängnis umgeht, einen Panikmoment durchspricht oder weiß, wann es einen Benutzer auf professionelle Hilfe hinweisen sollte.

Die implizierte Zielgruppe sind Entwickler und Forscher, die Konversations-KI für sensible Kontexte entwickeln — therapie-nahe Produkte, Support-Bots, Wellness-Apps und die zugrundeliegenden Modelle dahinter. Ein öffentlicher Benchmark gibt diesen Teams einen gemeinsamen Referenzpunkt, anstatt sich auf handverlesene Demos zu verlassen.

Der Rahmen betont auch eine Dual-Score. Ein Modell kann hilfsbereit, aber unsicher sein — warm und engagiert, während es den Benutzer irgendwohin führt, wo es schädlich ist — oder sicher, aber nicht hilfsbereit, und lehnt ab oder weicht aus, wenn der Benutzer tatsächlich Orientierung braucht. MentalHealthBench verfolgt beides, was bedeutet, dass jede einzelne Headline-Zahl das Bild unterbewertet. Teams, die in diesem Bereich Produkte ausliefern, haben jetzt einen gemeinsamen Maßstab, und sie müssen beide Enden davon lesen.

Als Nächstes beobachten: ob Drittanbieter-Labore den Benchmark aufgreifen und ob OpenAI Baseline-Scores für seine eigenen Modelle zusammen mit ihm veröffentlicht. Ein Benchmark ohne veröffentlichte Zahlen ist eigentlich nur eine Bewertungsrubrik.

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily