
GPT-6 Astra knackt ein 2005er Enigma, während Mistral ein 675B Apache 2.0-Flaggschiff veröffentlicht
Mistral veröffentlicht ein 675B Open-Weight-Modell unter Apache 2.0. Außerdem liefert das Unternehmen Devstral 2 2512 für langlebige Coding-Agents aus. Show notes: https://tobyonfitnesstech.com/de/podcasts/episode-117/
🎧 Listen to EpisodeEpisode 117 — 25. September 2026
[00:00] Episode-Einstieg
Hermes Agent v2026.9.24 wurde am 24. September 2026 als einzelnes stabiles Artefakt veröffentlicht, getaggt als v0.21.5 und konsolidiert rund 460 zusammengeführte Pull-Requests seit v0.21.4, für Docker-Images, Hermes Cloud und gehostete Bereitstellungen. Mistral folgte mit Devstral 2 2512, einem 123-Milliarden-Parameter Open-Weight-Coding-Modell für langlebige Software-Engineering-Assistenten, und listete Mistral Large 3 2512 auf OpenRouter — ein 675-Milliarden-Parameter Sparse-Mixture-of-Experts-Design mit 41 Milliarden aktiven Parametern unter Apache 2.0. OpenAIs GPT-6 Astra knackte autonom eine 1941er Wehrmachtsnachricht der Enigma, bezeichnet als MVUEH, die seit ihrer öffentlichen Veröffentlichung 2005 jedem kryptanalytischen Versuch widerstanden hatte. Anthropics Claude Opus 5.5 wurde innerhalb von GitHub Copilot mit einem 1M-Token-Kontextfenster geöffnet, und Ando kam aus dem Stealth-Modus mit einem Slack-Konkurrenten heraus, der so aufgebaut ist, dass KI-Assistenten ihre eigenen Identitäten und Posteingänge erhalten.
[02:00] Agent Stack Release-Auslesung: Hermes Agent v2026.9.24
Hermes Agent getaggt v0.21.5 am 24. September 2026 unter dem Release-Tag v2026.9.24. Der Herausgeber beschreibt es als einen Patch, der rund 460 zusammengeführte Pull-Requests seit v0.21.4 in ein einzelnes stabiles Artefakt für downstream-Konsumenten zusammenfasst — Docker-Images, Hermes Cloud und gehostete Bereitstellungen. Gemessen bei Commit f97608f178d1ffeca59860195ab7da295f7c8e5f, enthält das Fenster 1.610 Nicht-Merge-Commits über 4.828 geänderte Dateien, mit etwa 164.000 hinzugefügten Zeilen und 149.000 entfernten. Der vollständige kuratierte Bericht zu Highlights und Funktionsbereichen seit v0.21.0 wird auf v0.22.0 verschoben.
Die Notizen markieren mehrere Bereiche, die im Fenster gelandet sind. Auf dem Desktop umfasst dies eine Plugin-SDK-Welle mit einer Composer-Draft-API, Sitzungsliste und Zeilendekoration-Slots, Seitenleisten-Nav-Einstellungen, Model-Pill-Label-Anbieter, typisierte Settings/Skills/Toolset/Profile-Brücken, eine sandboxed Embed-Primitive, einen Appearance-Settings-Slot und eine öffentliche Event-Bridge für Plugin-Backends. Ein Simple/Advanced-Interface-Modus steht neben einer Connectors-Seite, die den MCP-Tab ersetzt, mit einem „Jetzt verbinden"-Pfad für MCP-Server eines frisch installierten Plugins und Onboarding, das Katalog-Plugins neben Connectors anbietet. Die französischen, deutschen und spanischen Desktop-Kataloge sind vollständig vorhanden, und eine RTL/LTR-Textrichtungs-Einstellung kommt hinzu. Die Composer- und Settings-Picker akzeptieren benutzerdefinierte Modelleinträge, Funktionstasten- und Diktier-Sprachkurzbefehle sind verdrahtet, und der Host-Multiplexer erhält pro Profil Stopp/Start/Neustart mit einer gateway.standalone-Option, um ein Profil zu deaktivieren.
Auf der CLI und TUI zeigt eine Live-Dock die stehenden /goal- und gereihten Prompts; Webhook-Zustellungen werden jetzt in die Ziel-Chat-Sitzung gespiegelt; gehostete -desktop-Images enthalten Bot Screen; und das Kanban-Board erhält einen zweispaltigen Ticket-Modul mit Markdown-Aufgabentext. Die Nous- und OpenRouter-Kataloge nehmen GPT-6 Sol/Terra/Luna und Claude Opus 5.5 auf. Offizielle Plugins erscheinen für Blender Lab und die NVIDIA- und Broadcast-Apps. Eine lange Strecke heißer Pfad-Performancearbeit berührte Konfigurationsladung, die Tool-Registry, Gateway-Nachrichtenbehandlung und den Modell-Picker, und Dutzende von Community-Plugins traten dem Katalog bei.
Für Update-Pfade verweist der Herausgeber Benutzer auf hermes update für Git-Installationen oder ein erneutes Ausführen des Installer-One-Liners; Docker- und Hermes-Cloud-Images werden aus nousresearch/hermes-agent:v2026.9.24 erstellt.
[03:19] Mistral's Devstral 2 2512 zielt auf langlebige Coding-Assistenten
Mistral hat Devstral 2 2512 veröffentlicht, und das Highlight ist die Größe. Es ist ein 123-Milliarden-Parameter Open-Source-dichter Transformer, der direkt auf agentisches Coding abzielt, die Kategorie von Softwarearbeit, bei der eine KI nicht nur eine Frage beantwortet, sondern eine mehrstufige Aufgabe durch Dateiänderungen, Tool-Aufrufe und Verifizierungsrunden durchführt.
Der praktische Hebel ist das Kontextfenster. Devstral 2 2512 akzeptiert 262.144 Tokens in einem einzigen Durchlauf. Das ist groß genug, um einen erheblichen Codebase plus einen langen Thread vorheriger Agent-Aktionen zu halten, ohne den Workflow zu zwingen, zusammenzufassen oder den Verlauf zu verwerfen. Für Entwickler ist das wichtig, weil der übliche Fehlermodus für langlebige Coding-Assistenten darin besteht, den Faden dessen zu verlieren, was sie taten; ein größeres Fenster verschiebt diesen Fehler weiter heraus.
Die Verteilung ist unkompliziert. Das Modell ist live auf OpenRouter unter dem Identifier mistralai/devstral-2512, sodass jeder, der bereits Anfragen über diesen Marketplace leitet, einen Assistenten darauf richten kann, ohne neue Infrastruktur aufzubauen. Mistral positioniert es als eine State-of-the-Art Open-Weight-Option für Software-Engineering-Assistenten, die Art von Arbeit, die weitgehend auf geschlossene Systeme standardmäßig eingestellt war.
Für Entwickler ist die interessante Frage, ob ein vollständig offener dichter Transformer in dieser Größenordnung bei echten Assistentenläufen gegen geschlossene Coding-Modelle bestehen kann, wo die Arbeit Tool-Nutzung, Fehlerbehebung und lange Aufgabenketten beinhaltet. Achten Sie auf unabhängige Benchmarks auf echten Repositories anstatt auf isolierten Coding-Rätseln.
[04:46] Mistral bringt ein 675B Open-Weight-Flaggschiff unter Apache 2.0 heraus
Mistral hat Mistral Large 3 2512 auf OpenRouter gelistet und nennt es das bisher fähigste Modell des Unternehmens. Das Modell verwendet eine Sparse-Mixture-of-Experts-Architektur: 41 Milliarden Parameter aktivieren pro Token von 675 Milliarden insgesamt, was bedeutet, dass die Rechen- und Speicherkosten für den Betrieb viel näher an der 41B-Zahl liegen als an den vollen 675B. Das Kontextfenster beträgt 262.144 Tokens, groß genug, um ein langes Dokument oder eine sizable Codebase in einem einzigen Prompt zu halten, ohne aggressives Chunking.
Der bemerkenswerte Detail ist die Lizenz. Mistral Large 3 2512 wird unter Apache 2.0 ausgeliefert, was kommerzielle Nutzung, Weiterverteilung und Modifikation mit Attribution erlaubt. Das ist ungewöhnlich permissiv für ein Frontier-Tier Open-Weight-Release und entfernt viel von der rechtlichen Reibung, die Teams zu kleineren oder stärker eingeschränkten Modellen treibt, wenn sie selbst hosten, feintunen oder kommerzielle Produkte darauf aufbauen wollen.
Für Entwickler ist die praktische Frage, ob das Modell seinen Ansprüchen gerecht wird, sobald unabhängige Evaluationen zirkulieren. Die aktuelle OpenRouter-Listung bietet Kontextlänge, Architekturdetails und die Lizenz, und das ist das Bild jetzt. Bis Benchmark-Zahlen eintreffen, ist dies das Open-Weights-Flaggschiff, das es wert ist, gegen das zu evaluieren, was Sie zuvor betrieben.
[06:01] GPT-6 Astra löst Enigma-Nachricht, die Kryptanalytiker seit 2005 widerstand
Seit mehr als zwei Jahrzehnten saß eine Enigma-Nachricht von der Ostfront auf einer öffentlichen Forschungsseite ungelöst. Am 15. September 2026 richtete Kryptograph Carter Leffen OpenAIs GPT-6 Astra auf das Crypto Cellar Research-Archiv ungeknackter Kriegsnachrichten und bat es, sie zu knacken. Das Modell wählte den vielversprechendsten Kandidaten, MVUEH, eine 1941er Wehrmachtsnachricht, die seit 2005 jedem Versuch widerstanden hatte, und knackte sie in etwa zwei Tagen.
Die Arbeit war fast vollständig die des Modells. GPT-6 Astra bemerkte, dass MVUEH wahrscheinlich Klartext mit einer anderen Nachricht desselben Tages teilte, Nr. 173 SIPVX, die Alex Shovkoplyas 2017 geknackt hatte. Es schrieb dann Python- und C++-Code für einen Enigma-Simulator und eine Bomben-artige Suche, verankert am wiederholten Ortsnamen „ROSENOW ROSENOW" als Crib. Der recovered Schlüssel unterschied sich vollständig vom täglichen Schlüssel, der von anderen Nachrichten vom 10. Juli 1941 verwendet wurde: die Walzenordnung war 253 statt der üblichen 512, und Enigmas linkes Rad drehte über dem 72. Buchstaben, eine seltene Komplikation, die frühere menschliche Versuche nicht durchdrungen hatten. Der ursprüngliche Geheimtext enthielt auch Transkriptionsfehler, die frühere Entschlüsselungen durcheinandergebracht hatten.
Das Modell legte auch Verweise auf Bände der Deutschen Bundesarchive offen, RS 3-3/20a und RS 3-3/63b, die realen Beständen entsprechen, aber nicht auf der Crypto Cellar-Website aufgelistet waren. Frode Weierud, der erfahrene Kryptanalytiker, der das Archiv betreibt, sagte, dass das Finden dieser Verweise mehrere Wochen dauerte, und nannte das Verhalten des Modells „wie ein sehr professioneller Kryptanalytiker und Archivarbeiter".
Die Geschichte erzielte einen Hacker News-Score von 733, nachdem sie am 23. September über OpenAI News veröffentlicht wurde. Für Entwickler liegt die Erkenntnis weniger in der Kryptographie als vielmehr darin, was ein agentisches Modell tun kann, wenn es ein offenes Forschungsthema und einen öffentlichen Datensatz erhält: einen Thread auswählen, eigene Tools erstellen und eine Untersuchung von Anfang bis Ende durchführen.
[07:58] Claude Opus 5.5 landet in GitHub Copilot für agentisches Coding
Anthropics Claude Opus 5.5 ist jetzt in GitHub Copilot auswählbar und gibt Abonnenten direkten Zugang zum führenden Reasoning-Modell des Unternehmens über ihren Editor. Der GitHub-Blog positioniert es für agentisches Coding, langlebige agentische Aufgaben und Wissensarbeit.
Das Hauptmerkmal ist eine Konfiguration mit „adaptivem Reasoning, maximalem Aufwand, standardmäßigem Fallback": Das Modell denkt standardmäßig intensiv nach und fällt auf leichtere Antworten zurück, wenn es angemessen ist. Eine nicht-reasoning Variante könnte ebenfalls existieren. Eingaben akzeptieren Text und Bilder, Ausgaben sind Text, und das Kontextfenster erstreckt sich auf 1 Million Token – etwa 1.500 Seiten 12-Punkt-Arial – groß genug, um einen gesamten Codebase oder eine mehrstündige Sitzung in einem einzigen Prompt zu halten.
Im Intelligence Index v4.3.2 von Artificial Analysis, der zehn Evaluationen kombiniert, darunter AA-Briefcase, Terminal-Bench 4.0, SciCode und Humanity's Last Exam, erreicht Opus 5.5 einen Wert von 58 bei einem Median von 26. Die Hacker News-Ankündigung von GitHub erhielt am selben Tag 331 Upvotes. Der Kompromiss ist Ausführlichkeit und Preis: Das Modell gab während des Index-Durchlaufs 260 Millionen Token aus (Median 88 Millionen), die Preisgestaltung liegt bei 4 $ pro Million Eingabe-Token und 20 $ pro Million Ausgabe-Token, und eine durchschnittliche Index-Aufgabe kostet 5,98 $. Ein 95-prozentiger Cache-Rabatt mildert die Rechnung für wiederholte Prompt-Präfixe ab.
Für Entwickler liegt der praktische Wandel in der Reichweite. Lange Refactorings, mehrstufige agentische Coding-Abläufe und gemischte Text- und Bildaufgaben – das Kombinieren eines Screenshots mit einer Codeänderung, zum Beispiel – laufen jetzt innerhalb von Copilot, ohne Tools wechseln zu müssen. Was als nächstes zu beobachten ist, ist, ob Anthropic die nicht-reasoning Variante veröffentlicht, deren mögliche Existenz Artificial Analysis anzeigt, da ein günstigeres Geschwistermodell dieses Modell zum täglichen Treiber machen würde, anstatt zu einem Spezialisten.
[09:39] Ando kommt aus dem Stealth-Modus mit einem Slack-Rivalen für Menschen und KI-Agenten
Ando, ein Startup gegründet von Sara Du, kam am Donnerstag aus dem Stealth-Modus mit einer Team-Messaging-App heraus, die sich als vollständiger Slack-Ersatz positioniert – aber mit KI-Agenten als gleichberechtigte Teammitglieder behandelt, anstatt als angehängte Bots.
Die Plattform gibt jedem Agenten seine eigene Identität und sein eigenes Postfach, mit Channels, Direktnachrichten, Gruppenkonversationen und sogar live transkribierten Anrufen. Agenten können Channels durchsuchen, entscheiden, welchen sie beitreten, in Konversationen eintreten, ohne getaggt zu werden, und menschlichen Kollegen von sich aus Nachrichten schicken, wenn sie etwas für wichtig halten. Keine Genehmigungen erforderlich.
Du kam auf die Idee, nachdem sie 2025 Unternehmen beim Aufbau von MCP-Servern geholfen hatte. Menschen fragten ständig, wie sie Agenten von innerhalb von Slack aus nutzen könnten, und die Reibung – das Hin- und Herschieben von Nachrichten, das Einspeisen von Kontext in Agenten, das Verbrennen von Tokens – wies auf ein tieferes Designproblem hin. Slack und Teams wurden für eine Welt gebaut, die beginnt, an uns vorbeizuziehen, sagte sie. Das größere Problem in ihrer Darstellung sind „Meat Proxies" – Menschen, die die Ausgabe ihres Agenten an den Rest des Unternehmens weiterleiten.
Ando sammelte 20 Millionen Dollar an Pre-Seed- und Seed-Finanzierung von Accel, Index Ventures und Emergence, um mehr Leute einzustellen und „mehr Tokens zu verbrennen". Kunden aus Software, Immobilien und Finanzen aus 15 Ländern nutzen es bereits, obwohl die meisten Teams klein sind.
Ein konkretes Beispiel für das, was sich ändert: Du beschrieb einen Agenten, der bemerkte, dass zwei separate Channels dasselbe Problem diskutierten. Ohne gefragt zu werden, holte er alle in einen Gruppenchat, legte den gemeinsamen Kontext dar und schlug eine Entscheidung vor. Agenten könnten Menschen besser verwalten, weil sie viel mehr Nachrichten in kürzerer Zeit verarbeiten können, sagte sie.
Es ist kein unumstrittenes Feld. Slack hat seinen Bot als Agenten neu aufgebaut, Microsoft hat Copilot in Teams eingewoben, und Jack Dorseys kürzlich gestartetes Buzz richtet sich an Entwickler. Aber Du sieht Raum für etwas, das von Grund auf für KI gebaut wurde, anstatt nachträglich angepasst.
[11:38] Fastinos 340M Open Decision Model führt Agent Guardrails auf CPU aus
Das Modell ist für die kleinen, aber teuren Entscheidungen gebaut, die in jedem KI-Agenten stecken – die „welches Tool soll ich verwenden", „ist das sicher", „in welche Kategorie gehört das" Momente. Fastino Labs nennt es GLiNER2.5-Decide, ein Open-Weight-Entscheidungsmodell mit 340 Millionen Parametern, veröffentlicht am 24. September.
Anstatt Text zu generieren, geben Sie ihm Inhalte plus ein Schema typisierter Fragen, und es liefert strukturierte Antworten zurück. Jede Antwort wird mit einer Wahrscheinlichkeitsverteilung, einem Konfidenzwert und Durchführbarkeitsmarkierungen geliefert. Schemata können Regeln über Fragen hinweg ausdrücken, sodass eine Erkennung an einem Ort ein Urteil an einem anderen erzwingen kann.
Das Guardrail-Beispiel zeigt, warum das wichtig ist. Unabhängig decodiert, markierte das Modell einen Prompt-Injection-Angriff mit 0,82 Konfidenz und kennzeichnete gleichzeitig dieselbe Prompt als sicher bei 0,52. Gemeinsame Dekodierung wendet eine Regel an, die erfordert, dass jede erkannte Schädigung ein unsicheres Urteil erfordert, was die Antwort auf safety=unsafe und harm_type=prompt_injection zusammenführt. Nachgelagerter Code hat nun ein konsistentes Signal zum Blockieren.
Es ist ein nicht-generativer Klassifikator, aufgebaut auf einem DeBERTa-v3-large Encoder und feinabgestimmt von gliner2-large-v1. Gewichte werden unter Apache 2.0 ausgeliefert; Installation ist pip install gliner2, und es läuft auf CPU, GPU oder vollständig luftdicht. Fastino bietet auch gehostete Inferenz über seine GLiNER API an.
Fastinos interner Suite, Fast Decisions, umfasst 5.100 Beispiele über 17 Datensätze. GLiNER2.5-Decide erreichte durchschnittlich 60,1% exakte Übereinstimmung, führte die Suite auf 9 von 17 Datensätzen und schlug ein 4-Milliarden-Parameter Qwen 3.5-Klassen-Baseline um etwa 2,6 Punkte. Bei Support-Intent erzielte es 75,3%.
Latenz bei Batch-Größe eins mit einem 15-Label-Schema: 167 Millisekunden p50 auf einem 48-Kern-Xeon, 38 Millisekunden auf einer V100. Zwei Geschwister vervollständigen die Familie — ein 1B-Variant bei 59,6% und ein 287M mehrsprachiges Modell bei 56,7%.
[13:22] Black Forest Labs bringt FLUX 3 Action heraus: Ein 7B-Roboter-Hirn
Black Forest Labs hat FLUX 3 Action herausgebracht, ein 7-Milliarden-Parameter-Modell mit offenen Gewichten, das Robotern sagt, was sie tun sollen, indem es sich vorstellt, was passieren wird. Es liest Kamerabilder, den aktuellen Zustand des Roboters und eine Textanweisung ein, und generiert dann zukünftige Videobilder und den nächsten Abschnitt von Roboterbewegungen in einer einzigen gemeinsamen Vorhersage. Auf dem RoboLab-120-Leaderboard, das 120 Tischaufgaben in Simulation testet, erreicht FLUX 3 Action eine Aufgabenerfolgsrate von 42,92% und liegt damit vor NVIDIAs Cosmos 3 Nano bei 36,8%, trotz der deutlich kleineren Grundarchitektur. Das praktische Geschwindigkeitsbild macht dies interessant. Cosmos 3 Nano benötigt etwa 4,7-mal mehr Verarbeitungszeit als π0.5 pro Sekunde Roboterbewegung auf einer B200. FLUX 3 Action schließt diese Lücke mit einer kleineren Architektur und Guidance-Destillation. Der Basis-Checkpoint läuft 1,52 bis 3,95-mal schneller als Cosmos 3 Nano in FP8 auf Workstation- und Rechenzentrum-GPUs, und die schrittgedestillte Variante läuft bis zu 2,28-mal schneller als π0.5 auf derselben Hardware. Der Kompromiss besteht darin, dass Basis- und Guidance-Destilled-Checkpoints 2,13 Sekunden Bewegung pro Aufruf vorhersagen gegenüber 1,0 Sekunde für π0.5, sodass der Geschwindigkeitsvorteil von Ihrer Hardware und davon abhängt, wie viel Bewegung Ihre Aufgabe benötigt. Der Speicherbedarf ist das entscheidende Kriterium für die Bereitstellung. Die vollständige DROID-Richtlinie benötigt etwa 32 GB GPU-Speicher in BF16 auf einer H200. Mit FP8-Quantisierung und Text-Encoder-Offload passt sie auf eine 24-GB-Karte. Black Forest Labs hat das Modell auch in Hugging Face LeRobot integriert und unterstützt NVIDIA Jetson für Edge-Szenarien. Auf realer Hardware führte eine blinde Auswertung mit Positronic Robotics auf einem Franka-Arm 30 Versuche über 10 DROID-Aufgaben durch. FLUX 3 Action schloss 28 von 30 Versuchen ab. Cosmos 3 Nano erzielte 27, DreamZero 20 und π0.5 nur 13. Teams können das Modell mit eigenen Demonstrationen feintunen. Black Forest Labs veröffentlichte ein DROID-Rezept und ein SO-101-LoRA-Rezept, die eine Greif-und-Platzier-Fertigkeit zeigen, die aus etwa 200 Beispielen gelernt wurde. Die Gewichte, der Code und die Rezepte werden unter der FLUX Kommunity License veröffentlicht, die nicht-kommerzielle Nutzung erlaubt.
[15:29] Oracle beruft sich auf Höhere Gewalt bei New Mexico KI-Rechenzentrum
Oracle stellt einen finanziellen Schutzschild um eine seiner größten KI-Infrastrukturwetten auf. Das Unternehmen sandte eine Höhere-Gewalt-Mitteilung an den Entwickler von Project Jupiter, einem massiven Rechenzentrum, das in New Mexico von einer Einheit von Blue Owl Capital gebaut wird. Die Klausel erlaubt es Oracle, Zahlungen zu verzögern, wenn die Anlage ihr Ziel verfehlt, bis 2028 online zu gehen. Oracle versucht nicht, als Hauptmieter auszusteigen — es sichert seine Verpflichtungen ab, während das Projekt auf öffentlichen Widerstand und behördliche Rückschläge stößt.
Die Rahmung ist für jeden wichtig, der den KI-Ausbau beobachtet. Höhere-Gewalt-Klauseln leben normalerweise im Hintergrund für Naturkatastrophen oder Versorgungsschocks, daher signalisiert es, wie viel finanzielles Risiko auf jeder Megawatt Kapazität lastet, wenn ein Cloud-Mieter eine auf einem aktiven Standort geltend macht. Wenn Oracle sich darauf vorbereitet, dass Project Jupiter über 2028 hinausgleitet, möchte das Unternehmen Handlungsoptionen bei seinen Kapitalausgaben, anstatt ein binäres Liefern-oder-Kündigen-Ergebnis.
Das Projekt hat bereits Widerstand und Genehmigungsreibung erfahren, und eine 2028-Frist beginnt unrealistisch auszusehen, wenn Strom, Regulierung und Lieferketten gleichzeitig gegen einen Bauherrn arbeiten. Oracles Absicherung signalisiert Blue Owl auch ruhig: Der Anker-Mieter möchte Flexibilität, nicht unbedingt eine Neuverhandlung des Mietvertrags selbst.
Die praktische Lektüre ist unkompliziert. Kapazitäts-Roadmaps sind Verträge, bevor sie Beton sind, und diese Mitteilung ist eines der ersten öffentlichen Anzeichen dafür, dass ein Hyperscaler seine eigenen Verpflichtungen so behandelt. Beobachten Sie, ob andere Mieter bei ähnlichen Projekten zu demselben Schutz greifen, wenn ihre Zeitpläne wanken.
[17:06] Könnte Monkey Islands Grog wirklich eine Tasse in 35 Sekunden auflösen? Ein Chemiker modelliert es.
Ein Chemiker an der Universität Groningen hat tatsächlich die Mathematik zu einem der berühmtesten Rätsel des Gamings durchgeführt: ob der Grog in The Secret of Monkey Island wirklich eine Zinntasse in 35 Sekunden durchfressen könnte. Die in das Journal of Geek Studies veröffentlichte Abhandlung behandelt das Verhalten des Spiels als inverses Problem, beginnt mit der beobachteten Korrosionsrate und arbeitet rückwärts, um zu schätzen, was die Flüssigkeit enthalten müsste.
Der Autor, affiliated mit dem ENTEG Institute in der Fakultät für Naturwissenschaften und Ingenieurwesen, verwendete die 2009 Special Edition, die über Steam verteilt wurde, und stoppte die Lebensdauer der Tasse mit einer Stoppuhr auf etwa 35 Sekunden. Er nahm an, dass die Tasse aus Zinn bestand, modelliert als reines Zinn, mit einer 2mm Wandstärke, die als Näherungswert gewählt wurde, weil das Spiel keine Maße angibt. Von dort aus schätzte er das erforderliche Protonenangebot, um diese Wand innerhalb der beobachteten Zeit zu durchlöchern.
Er stimmte dann diese Anforderung mit den in der Dialogbox des Spiels aufgelisteten Grog-Zutaten ab: Schwefelsäure, Batteriesäure, Petroleum, Propylenglykol, künstliche Süßstoffe, Rum, Aceton, Rot Nr. 2, Achsenfett, Peperoni und das mysteriöse SCUMM. Die Abhandlung kommt zu dem Schluss, dass Schwefelsäure und Batteriesäure die Korrosion plausibel antreiben könnten, während die meisten anderen Zutaten entweder unwahrscheinlich sind, Zinn direkt anzugreifen, oder die Dinge tatsächlich verlangsamen würden, indem sie die Metalloberfläche beschichten. Der Autor beschreibt das Modell als semi-quantitativ und stellt fest, dass keine der aufgelisteten Komponenten die leuchtend grüne Farbe erklärt, die der Grog im Spiel annimmt.
Der Beitrag erhielt eine Hacker News-Bewertung von 137, ein passender Beweis dafür, dass selbst ein Point-and-Click-Adventure von 1990 ein echtes Chemieproblem beherbergen kann, wenn sich jemand die Mühe macht, es ernst zu nehmen.
[18:50] KI, die in DNA denkt, erweitert die Bio-Sicherheitsgrenze
Radical Numerics, ein neues Unternehmen, das von Forschern gegründet wurde, die zuvor die genomischen Sprachmodelle Evo und Evo-2 am Arc Institute aufgebaut haben, skaliert diese Fähigkeiten auf eine breitere Palette biologischer Probleme. Diese früheren Modelle generierten vollständige Bacteriophagen-Genome von Grund auf, und die synthetisierten Viren erwiesen sich im Labor als funktional. Jetzt treibt das Team, geleitet von CEO Eric Nguyen, genomische Sprachmodelle über DNA hinaus in RNA und Proteine, und nutzt die Tatsache, dass DNA-Sequenzen natürliche Marker für Gene und die Sequenzen enthalten, die Proteine kodieren. Diese eingebaute Struktur ermöglicht es demselben Modell, mehrere biologische Sprachen zu verarbeiten, bevor es jemals auf 3D-Proteinstruktur, Epigenetik oder natürliche Sprache trainiert wird. In einem disclosed Experiment zeigte Radical Numerics ein Modell, das RNA-Aptamere progressiv mit Leistungswerten verbesserte, und bat es dann, die Trajektorie eigenständig fortzusetzen. Das Modell reproduzierte höherbewertete Sequenzen, die ihm nicht gezeigt worden waren, was darauf hindeutet, dass es nicht nur Mustererkennung, sondern aktive Optimierung in der DNA-Sprache gelernt hat. Das Team argumentiert, dass dieselben Fähigkeiten, die schnelleres Impfstoff- und Therapeutikum-Design vorantreiben, auch für die Verteidigung relevant sind. Da Frontier-KI-Labors Bio-Sicherheit neben Cybersicherheit als Top-Bedenken identifizieren, ist die Frage, ob Verteidiger schnell genug handeln können. Radical Numerics wettet darauf, die Grenzen stärker voranzutreiben, anstatt zurückzuhalten. Das Unternehmen umfasst Michael Poli, formerly a founding scientist at Liquid AI, als Chief AI Scientist; Stefano Massaroli, a former postdoc with Yoshua Bengio and founding team member at Liquid AI, als President; und Armin Thomas, einen ehemaligen Stanford-Postdoc, der mit Chris Ré zusammenarbeitete, als CTO. Ein Punkt zum Beobachten: wie sich die cross-modale Generalisierung in genomischen Sprachmodellen in Pathogenerkennungs- und Impfstoffentwicklungs-Toolchains sowohl als defensive Vermögenswerte als auch als potenzielle Angriffsflächen-Bedenken entwickelt.
[20:38] Research digest: Forscher trainieren Videomodelle, um versteckte Objekte wie Menschen zu verfolgen
Ein Artikel, der im täglichen Research-Feed von HuggingFace trending ist, stellt eine überraschend einfache Frage: Verstehen heutige Videogenerierungsmodelle — die KI-Systeme, die bewegte Szenen synthetisieren — tatsächlich Objektpermanenz, das alltägliche Gefühl, dass Dinge weiter existieren, wenn man sie nicht sehen kann? Die Autoren argumentieren, dass Videomodelle ein natürlicher Kandidat für die Untersuchung menschlicher physischer Intelligenz sind, da neuere Versionen begonnen haben, aufgetauchte Reasoning-Fähigkeiten zu zeigen. Aber als sie diese Modelle untersuchen, stellt sich heraus, dass die Kernpriors weitgehend fehlen. Ihr vorgeschlagener Fix ist WROP, ein neues Trainingsdataset, das auf denselben Arten von physischen Intuitionen aufgebaut ist, die ein Säugling in seinen ersten Lebensmonaten entwickelt. Das Dataset soll Weltmodelle lehren, Objekte über Verdeckungen und Wiedereintritte konsistent zu halten, sodass ein generiertes Video sich an den Ball erinnert, der hinter dem Stuhl gerollt ist. Das breitere Ziel sind Weltmodelle, die über physische Szenen ähnlicher wie Menschen reasonieren, mit Auszahlungen für Robotik, Simulation und jedes System, das vorhersagen muss, was mit Dingen passiert, die kurz aus dem Blickfeld verschwinden.
[21:42] Research digest: KI-Coding-Agents übertreffen handgebaute Roboterplaner
Roboterplanung ist schwierig, weil Auswahl dessen, was zu tun ist, wo zu greifen und wie zu bewegen, miteinander verwickelt sind. Ingenieure schreiben diese Planer normalerweise von Hand, was Monate dauert. Eine neue Studie fragte, ob KI-Coding-Agents stattdessen die Arbeit erledigen könnten.
Den Agents, einschließlich Claude Code und Codex, wurden eine Aufgabenbeschreibung und Simulator-Zugriff gegeben. Sie schrieben Programme, keine Ein-Schuss-Antworten sondern wiederverwendbare Algorithmen, innerhalb eines festen Budgets. Die eingefrorenen Programme wurden dann auf ungesehenen Instanzen getestet.
Über simulierte Umgebungen aus zwei Robotik-Benchmarks hinweg übertrafen die Agenten alle Alternativen. Die mittlere Erfolgsquote lag bei 56% bis 95%, während handentwickelte Planer 47% bei der Teilmenge erreichten, für die sie verfügbar waren. Die Agenten hielten auch随着物品种类数量增加而保持良好表现 stand, in dem Bereich, in dem klassische Planer normalerweise scheitern.
Die Erkenntnis: Robotik-Teams, die damit feststecken, individuelle Planungscode zu pflegen, haben jetzt eine funktionierende Abkürzung. Richten Sie einen Agenten auf einen Simulator, lassen Sie ihn iterieren, frieren Sie das Programm ein, liefern Sie es aus. Der Engpass verlagert sich von Ingenieursstunden auf Rechenbudget.
[22:43] OpenAI veröffentlicht MentalHealthBench zur Bewertung von psychischen Gesundheits-KI-Antworten
OpenAI hat am 23. September MentalHealthBench veröffentlicht, einen Benchmark, der mit Input von psychischen Gesundheitsexperten entwickelt wurde, um zu bewerten, wie hilfreich und sicher KI-Systeme in realistischen Gesprächen zur psychischen Gesundheit sind. Das Ziel ist es, Entwicklern, Forschern und Modell-Anbietern einen gemeinsamen Maßstab zu geben, um das Verhalten von Assistenten in einem Bereich zu bewerten, in dem generische Genauigkeitswerte am Punkt vorbeigehen.
Standard-Benchmarks neigen dazu zu messen, ob ein Modell eine faktische Frage korrekt beantwortet hat. Gespräche über psychische Gesundheit sind anders: Eine Antwort kann faktisch korrekt sein und trotzdem schädlich, abweisend oder gefährliches Verhalten fördernd sein. OpenAIs Framing positioniert den Benchmark als Schließung dieser Lücke, mit Fokus darauf, ob ein Modell hilfreich antwortet und gleichzeitig sichere Grenzen einhält, einschließlich zu wissen, wann es escalieren oder professionelle Hilfe empfehlen sollte, anstatt zu improvisieren.
Die Szenarien in MentalHealthBench sind realistische Gesprächssituationen, die Nutzer tatsächlich an KI-Assistenten herantragen, geformt von Praktikern statt von rein synthetischen Testautoren. Diese Expertenbeteiligung ist der Kernmechanismus: Die Menschen, die professionell in der psychischen Gesundheitsarbeit tätig sind, entscheiden, wie eine gute Antwort in jedem Austausch aussieht, sodass der Benchmark das Verhalten so bewertet, wie es ein Kliniker tun würde, nicht wie es ein Multiple-Choice-Test tun würde.
Für Entwickler ist die praktische Auswirkung eine vergleichbare Punktzahl für die Qualität psychischer Gesundheitsantworten. Ein Team, das einen KI-Wellness-Coach, eine therapeutisch angegliederte Tagebuch-App oder einen Triage-Chatbot herausbringt, kann nun auf ein dokumentiertes Benchmark-Ergebnis verweisen, anstatt sich auf Eindrücke oder cherry-picked Demos zu verlassen. Die Veröffentlichung signalisiert auch, dass domänenspezifische Sicherheitsbewertung zu einer Standarderwartung in sensiblen Bereichen wird, nicht zu einem nachträglichen Patch nach dem Launch.
Ein Aspekt, den es zu beobachten gilt, ist, ob andere Labore und unabhängige Bewerter den Benchmark übernehmen, ihn forken oder konkurrierende Versionen entwickeln, da der Bewertungsmaßstab eines einzelnen Anbieters nur so nützlich ist, wie ihn die breitere Gemeinschaft behandelt.