जीपीटी-6 एस्ट्रा ने 2005 के एनिग्मा को तोड़ा जब मिस्ट्रल ने 675B Apache 2.0 फ्लैगशिप जारी किया — Episode 117 cover art
Episode 117·28 सितंबर 2026·45:39

जीपीटी-6 एस्ट्रा ने 2005 के एनिग्मा को तोड़ा जब मिस्ट्रल ने 675B Apache 2.0 फ्लैगशिप जारी किया

मिस्ट्रल ने Apache 2.0 पर 675B ओपन-वेट मॉडल जारी किया। इसने लंबे समय तक चलने वाले कोडिंग एजेंटों के लिए Devstral 2 2512 भी भेजा। Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-117/

🎧 Listen to Episode

एपिसोड 117 — 25 सितंबर, 2026

[00:00] एपिसोड परिचय

Hermes Agent v2026.9.24 24 सितंबर, 2026 को जारी किया गया, एक एकल स्थिर आर्टिफैक्ट के रूप में, v0.21.5 पर टैग किया गया, और v0.21.4 के बाद से लगभग 460 मर्ज की गई पुल रिक्वेस्ट को समेकित करते हुए, Docker इमेज, Hermes Cloud, और होस्टेड डिप्लॉयमेंट के लिए। Mistral ने उसके बाद Devstral 2 2512 जारी किया, एक 123-बिलियन-पैरामीटर ओपन-वेट कोडिंग मॉडल जो लंबे चलने वाले सॉफ्टवेयर इंजीनियरिंग एजेंटों को लक्षित करता है, और OpenRouter पर Mistral Large 3 2512 को सूचीबद्ध किया—एक 675-बिलियन-पैरामीटर स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स डिज़ाइन जिसमें Apache 2.0 के तहत 41 बिलियन सक्रिय पैरामीटर हैं। OpenAI का GPT-6 Astra ने स्वायम रूप से एक 1941 जर्मन आर्मी एनिग्मा संदेश को तोड़ा, जिसे MVUEH नाम दिया गया, जो 2005 में सार्वजनिक रूप से पोस्ट किए जाने के बाद से हर क्रिप्टएनालिटिक प्रयास का विरोध करता रहा था। Anthropic का Claude Opus 5.5 GitHub Copilot के अंदर 1M-टोकन संदर्भ विंडो के साथ खुला, और Ando स्टील्थ से बाहर आया एक Slack प्रतिस्पर्धी के साथ जो इतना बनाया गया है कि AI एजेंटों को अपनी पहचान और इनबॉक्स मिले।

[02:00] एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.9.24

Hermes Agent को 24 सितंबर, 2026 को v2026.9.24 रिलीज टैग के तहत v0.21.5 पर टैग किया गया। प्रकाशक इसे एक पैच के रूप में वर्णन करता है जो v0.21.4 के बाद से लगभग 460 मर्ज की गई पुल रिक्वेस्ट को एकल स्थिर आर्टिफैक्ट में रोल अप करता है डाउनस्ट्रीम उपभोक्ताओं के लिए—Docker इमेज, Hermes Cloud, और होस्टेड डिप्लॉयमेंट। commit f97608f178d1ffeca59860195ab7da295f7c8e5f पर मापा गया, विंडो में 4,828 बदली गई फाइलों में 1,610 नॉन-मर्ज कमिट हैं, लगभग 164,000 लाइनें जोड़ी गईं और 149,000 हटाई गईं। v0.21.0 से हाइलाइट्स और फीचर क्षेत्रों को कवर करने वाला पूर्ण करेटेड राइटअप v0.22.0 के लिए स्थगित है।

नोट्स कई क्षेत्रों को फ्लैग करते हैं जो विंडो में उतरे। डेस्कटॉप पर, इसमें एक प्लगइन SDK वेव शामिल है जो एक कंपोज़र ड्राफ्ट API, सेशन-लिस्ट और रो-डेकोरेशन स्लॉट, साइडबार नेव प्रेफ़्स, मॉडल-पिल लेबल प्रोवाइडर, टाइप्ड सेटिंग्स/स्किल्स/टूलसेट्स/प्रोफाइल ब्रिज, एक सैंडबॉक्स्ड एम्बेड प्रिमिटिव, एक अपीयरेंस-सेटिंग्स स्लॉट, और प्लगइन बैकएंड के लिए एक पब्लिक इवेंट ब्रिज को कवर करती है। एक सिम्पल/एडवांस्ड इंटरफ़ेस मोड एक कनेक्टर्स पेज के साथ बैठता है जो MCP टैब की जगह लेता है, एक "कनेक्ट नाउ" पथ के साथ एक ताज़ा इंस्टॉल किए गए प्लगइन के MCP सर्वर के लिए और ऑनबोर्डिंग जो कनेक्टर्स के बगल में कैटलॉग प्लगइन की पेशकश करता है। फ्रेंच, जर्मन, और स्पेनिश डेस्कटॉप कैटलॉग पूर्ण शिप्पेड होते हैं, और एक RTL/LTR टेक्स्ट-डायरेक्शन सेटिंग आती है। कंपोज़र और सेटिंग्स पिकर्स कस्टम मॉडल एंट्री स्वीकार करते हैं, फंक्शन-की और डिक्टेशन वॉइस शॉर्टकट वायर्ड हैं, और होस्ट मल्टीप्लेक्सर प्रति-प्रोफाइल स्टॉप/स्टार्ट/रेस्टार्ट के साथ एक gateway.standalone विकल्प प्राप्त करता है ताकि किसी प्रोफाइल को बाहर करना हो।

CLI और TUI पर, एक लाइव डॉक स्थायी /goal और कतारबद्ध प्रॉम्प्ट दिखाता है; वेबहुक डिलीवरी अब टारगेट चैट सेशन में मिरर करती हैं; होस्टेड -desktop इमेज में बॉट स्क्रीन शामिल है; और कानबान बोर्ड एक मार्कडाउन टास्क टेक्स्ट के साथ दो-कॉलम टिकट मॉडल प्राप्त करता है। Nous और OpenRouter कैटलॉग GPT-6 Sol/Terra/Luna और Claude Opus 5.5 उठाते हैं। Blender Lab और NVIDIA ऐप और ब्रॉडकास्ट ऐप्स के लिए ऑफिशियल प्लगइन आते हैं। हॉट-पाथ परफॉर्मेंस वर्क का एक लंबा स्ट्रेच कॉन्फिग लोडिंग, टूल रजिस्ट्री, गेटवे मैसेज हैंडलिंग, और मॉडल पिकर को छूता है, और दर्जनों कम्युनिटी प्लगइन कैटलॉग में शामिल हुए।

अपडेट पाथ के लिए, प्रकाशक git इंस्टॉल के लिए hermes update या इंस्टॉलर वन-लाइनर को फिर से चलाने की ओर इंगित करता है; Docker और Hermes Cloud इमेज nousresearch/hermes-agent:v2026.9.24 से बनती हैं।

[03:19] Mistral का Devstral 2 2512 लंबे चलने वाले कोडिंग एजेंटों को लक्षित करता है

Mistral ने Devstral 2 2512 जारी किया है, और हेडलाइन साइज है। यह एक 123-बिलियन-पैरामीटर ओपन-सोर्स डेंस ट्रांसफॉर्मर है जो सीधे एजेंटिक कोडिंग को निशाना बनाता है, सॉफ्टवेयर वर्क की उस श्रेणी में जहां एक AI केवल एक प्रश्न का उत्तर नहीं देता बल्कि फाइल एडिट्स, टूल कॉल्स, और सत्यापन राउंड के माध्यम से एक मल्टी-स्टेप टास्क को आगे बढ़ाता है।

व्यावहारिक लीवर है संदर्भ विंडो। Devstral 2 2512 एक ही पास में 262,144 टोकन स्वीकार करता है। यह एक पर्याप्त कोडबेस के साथ-साथ पूर्व एजेंट क्रियाओं के एक लंबे थ्रेड को रखने के लिए पर्याप्त है बिना वर्कफ़्लो को सारांशित करने या इतिहास छोड़ने के लिए मजबूर किए। बिल्डर्स के लिए, यह मायने रखता है क्योंकि लंबे समय चलने वाले कोडिंग एजेंटों के लिए सामान्य विफलता तरीका उनके क्या कर रहे थे उसके थ्रेड को खोना है; एक बड़ी विंडो उस विफलता को और आगे ढकेलती है।

वितरण सीधा है। मॉडल OpenRouter पर mistralai/devstral-2512 पहचानकर्ता के तहत लाइव है, इसलिए कोई भी जो पहले से उस मार्केटप्लेस के माध्यम से अनुरोध रूट कर रहा है वह नए इन्फ्रास्ट्रक्चर को खड़ा किए बिना उस पर एक एजेंट इंगित कर सकता है। Mistral इसे सॉफ्टवेयर इंजीनियरिंग एजेंटों के लिए अत्याधुनिक खुले-वेट विकल्प के रूप में स्थिति दे रहा है, वह काम जो बड़े पैमाने पर बंद सिस्टम में डिफ़ॉल्ट हो गया है।

बिल्डर्स के लिए, दिलचस्प सवाल यह है कि क्या इस पैमाने पर एक पूर्णतः खुला घना ट्रांसफॉर्मर वास्तविक एजेंट रन पर बंद कोडिंग मॉडलों के खिलाफ अपना बना सकता है, जहां काम में टूल उपयोग, त्रुटि रिकवरी और लंबे टास्क चेन शामिल हैं। अलग-थलग कोडिंग पहेलियों के बजाय वास्तविक रिपॉजिटरी पर स्वतंत्र बेंचमार्क देखें।

[04:46] Mistral ने Apache 2.0 पर 675B खुला-वेट फ्लैगशिप शिप किया

Mistral ने OpenRouter पर Mistral Large 3 2512 सूचीबद्ध किया है, इसे कंपनी का अब तक का सबसे सक्षम मॉडल बताया है। मॉडल एक विरल मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर का उपयोग करता है: प्रति टोकन 41 अरब पैरामीटर सक्रिय होते हैं कुल 675 अरब में से, जिसका मतलब है कि इसे चलाने की कंप्यूट और मेमोरी लागत 675B के बजाय 41B के आंकड़े के बहुत करीब है। संदर्भ विंडो 262,144 टोकन है, एक लंबे दस्तावेज़ या एक बड़े कोडबेस को बिना आक्रामक चंकिंग के एक प्रॉम्प्ट में रखने के लिए पर्याप्त है।

उल्लेखनीय विवरण लाइसेंस है। Mistral Large 3 2512 Apache 2.0 के तहत आता है, जो एट्रिब्यूशन के साथ वाणिज्यिक उपयोग, पुनर्वितरण और संशोधन की अनुमति देता है। यह फ्रंटियर-टियर खुले-वेट रिलीज के लिए असामान्य रूप से अनुमतिशील है और बहुत सारे कानूनी घर्षण को हटाता है जो टीमों को छोटे या अधिक प्रतिबंधित मॉडलों की ओर धकेलता है जब वे सेल्फ-होस्ट करना, फाइन-ट्यून करना या शीर्ष पर वाणिज्यिक उत्पाद बनाना चाहते हैं।

बिल्डर्स के लिए, व्यावहारिक सवाल यह है कि क्या मॉडल स्वतंत्र मूल्यांकन आने के बाद अपने दावों के अनुरूप है। वर्तमान OpenRouter लिस्टिंग संदर्भ लंबाई, आर्किटेक्चर विवरण और लाइसेंस प्रदान करती है, और अभी यही स्थिति है। जब तक बेंचमार्क नंबर नहीं आ जाते, यही खुले-वेट फ्लैग-बियरर है जिसे आपके पहले जो कुछ भी चला रहे थे उसके विरुद्ध मूल्यांकन करने योग्य है।

[06:01] GPT-6 Astra ने उस एनिग्मा संदेश को हल किया जिसने 2005 से क्रिप्टानालिस्ट को परेशान किया

दो दशकों से अधिक समय से, पूर्वी मोर्चे का एक एनिग्मा संदेश एक सार्वजनिक शोध साइट पर हल नहीं हुआ पड़ा था। 15 सितंबर, 2026 को, क्रिप्टोग्राफर कार्टर लेफेन ने OpenAI के GPT-6 Astra को Crypto Cellar Research आर्काइव में अनसॉल्व्ड युद्धकालीन संदेशों पर इंगित किया और उन पर हमला करने को कहा। मॉडल ने सबसे आशाजनक उम्मीदवार MVUEH चुना, एक 1941 जर्मन आर्मी संदेश जो 2005 से हर प्रयास का विरोध करता रहा था, और इसे लगभग दो दिनों में तोड़ दिया।

काम लगभग पूरी तरह से मॉडल का था। GPT-6 Astra ने देखा कि MVUEH संभवतः उसी दिन के एक अन्य संदेश Nr. 173 SIPVX के साथ सादा पाठ साझा करता है, जिसे एलेक्स शोवकोपल्यास ने 2017 में तोड़ा था। फिर उसने एनिग्मा सिम्युलेटर और बॉम्ब-स्टाइल सर्च के लिए Python और C++ कोड लिखा, दोहराए गए स्थान नाम "ROSENOW ROSENOW" को क्रिब के रूप में लेकर। पुनर्प्राप्त कुंजी अन्य 10 जुलाई 1941 संदेशों द्वारा उपयोग की गई दैनिक कुंजी से पूरी तरह भिन्न थी: पहिया क्रम 512 के बजाय 253 था, और एनिग्मा का बाएं हाथ का पहिया 72वें अक्षर पर घूम गया, एक दुर्लभ जटिलता जिसे पहले के मानव प्रयासों ने नहीं समझा था। मूल सिफरटेक्स्ट में ट्रांसक्रिप्शन त्रुटियां भी थीं जिन्होंने पिछले ब्रेक को गलत किया था।

मॉडल ने जर्मन फेडरल आर्काइव्स वॉल्यूम RS 3-3/20a और RS 3-3/63b के संदर्भ भी सामने लाए, जो वास्तविक होल्डिंग्स से मेल खाते हैं लेकिन क्रिप्टो सेलर साइट पर सूचीबद्ध नहीं थे। फ्रोडे वीयरूद, अभिलेखागार चलाने वाले अनुभवी क्रिप्टानालिस्ट ने कहा कि इन संदर्भों को खोजने में उन्हें कई सप्ताह लगे और उन्होंने मॉडल के व्यवहार को "एक बहुत पेशेवर क्रिप्टानालिस्ट और आर्काइव रिसर्चर जैसा" बताया।

कहानी ने 23 सितंबर को OpenAI News के माध्यम से प्रकाशित होने के बाद Hacker News पर 733 का स्कोर बनाया। बिल्डर्स के लिए निष्कर्ष क्रिप्टोग्राफी के बारे में कम और इस बारे में अधिक है कि एक एजेंटिक मॉडल क्या कर सकता है जब उसे एक खुले-अंत शोध लक्ष्य और एक सार्वजनिक डेटासेट दिया जाता है: एक थ्रेड चुनना, अपने स्वयं के टूल बनाना, और एक जांच को अंत तक चलाना।

[07:58] GitHub Copilot में एजेंटिक कोडिंग के लिए Claude Opus 5.5 लैंड्स

Anthropic का Claude Opus 5.5 अब GitHub Copilot के अंदर चयन योग्य है, जिससे सब्सक्राइबर्स को अपने एडिटर के माध्यम से कंपनी के शीर्ष रीजनिंग मॉडल तक सीधी पहुंच मिलती है। GitHub ब्लॉग इसे एजेंटिक कोडिंग, दीर्घ-चलने वाले एजेंटिक टास्क और ज्ञान कार्य के लिए तैनात करता है।

मुख्य मैकेनिक एक "एडाप्टिव रीजनिंग, मैक्स एफर्ट, डिफ़ॉल्ट फॉलबैक" कॉन्फ़िगरेशन है: मॉडल डिफ़ॉल्ट रूप से कड़ी सोचता है और जब उचित हो हल्की प्रतिक्रियाओं पर वापस आता है। एक नॉन-रीजनिंग वेरिएंट भी मौजूद हो सकता है। इनपुट टेक्स्ट और इमेज स्वीकार करते हैं, आउटपुट टेक्स्ट हैं, और कॉन्टेक्स्ट विंडो 1 मिलियन टोकन तक फैली है — लगभग 12-पॉइंट Arial के 1,500 पृष्ठ — एक पूरे कोडबेस या एक सिंगल प्रॉम्प्ट में एक बहु-घंटे का सेशन रखने के लिए पर्याप्त बड़ी।

Artificial Analysis की Intelligence Index v4.3.2 पर, जो AA-Briefcase, Terminal-Bench 4.0, SciCode और Humanity's Last Exam सहित दस मूल्यांकनों को जोड़ती है, Opus 5.5 का स्कोर 58 है जबकि मेडियन 26 है। GitHub का Hacker News घोषणा उसी दिन 331 अपवोट मिले। ट्रेड-ऑफ वर्बोसिटी और कीमत है: मॉडल ने इंडेक्स रन के दौरान 260 मिलियन टोकन उत्सर्जित किए (मेडियन 88 मिलियन), प्राइसिंग $4 प्रति मिलियन इनपुट टोकन और $20 प्रति मिलियन आउटपुट पर है, और एक औसत इंडेक्स टास्क की कीमत $5.98 है। 95% कैश डिस्काउंट दोहराए जाने वाले प्रॉम्प्ट प्रीफिक्स के लिए उस बिल को कम करता है।

बिल्डर्स के लिए, व्यावहारिक बदलाव पहुंच है। लंबे रिफैक्टर्स, मल्टी-स्टेप एजेंटिक कोडिंग फ्लो, और मिश्रित टेक्स्ट-और-इमेज टास्क — उदाहरण के लिए एक स्क्रीनशॉट को कोड चेंज के साथ जोड़ना — अब टूल स्वैप किए बिना Copilot के अंदर चलते हैं। आगे देखने की बात यह है कि Anthropic नॉन-रीजनिंग वेरिएंट शिप करता है या नहीं जिसे Artificial Analysis संभावित रूप से मौजूद होने के रूप में फ्लैग करता है, क्योंकि एक सस्ता सिबलिंग ही इस मॉडल को एक स्पेशलिस्ट के बजाय डेली ड्राइवर बनाएगा।

[09:39] Ando मनुष्यों और AI एजेंटों के लिए बनाए गए एक Slack प्रतिद्वंद्वी के साथ स्टील्थ से बाहर आया

Ando, Sara Du द्वारा स्थापित एक स्टार्टअप, गुरुवार को एक टीम मैसेजिंग ऐप के साथ स्टील्थ से बाहर आया जो खुद को एक पूर्ण Slack प्रतिस्थापन के रूप में प्रस्तुत करता है — लेकिन AI एजेंटों को पहले-श्रेणी के साथियों के रूप में माना जाता है, बजाय अलग से जोड़े गए बॉट्स के।

प्लेटफॉर्म प्रत्येक एजेंट को अपनी पहचान और इनबॉक्स देता है, जिसमें चैनल, DMs, ग्रुप कन्वर्सेशन और यहां तक की लाइव ट्रांसक्राइब्ड कॉल शामिल हैं। एजेंट चैनल ब्राउज़ कर सकते हैं, यह तय कर सकते हैं कि कौन से जॉइन करने हैं, टैग किए बिना कन्वर्सेशन में प्रवेश कर सकते हैं, और जब उन्हें लगता है कि कुछ मायने रखता है तो अपने आप मानव सहकर्मियों को मैसेज कर सकते हैं। कोई अप्रूवल जरूरी नहीं।

Du came to the idea after spending 2025 helping companies build MCP servers. People kept asking how to use agents from inside Slack, and the friction — shuffling messages back and forth, feeding agents context, burning tokens — pointed at a deeper design problem. Slack and Teams were built for a world that was starting to pass us by, she said. The bigger issue, in her framing, is "meat proxies" — humans relaying their agent's output to the rest of the company.

Ando raised $20 million in pre-seed and seed funding from Accel, Index Ventures, and Emergence to hire more people and "burn through more tokens." Customers in software, real estate, and finance across 15 countries are already running on it, though most teams are small.

A concrete example of what changes: Du described an agent that noticed two separate channels debating the same problem. Without being asked, it pulled everyone into a group chat, laid out the shared context, and suggested a decision. Agents could better manage people than humans can because they can process a lot more messages in a shorter span of time, she said.

It's not an uncontested space. Slack has rebuilt its bot as an agent, Microsoft has woven Copilot into Teams, and Jack Dorsey's recently launched Buzz targets developers. But Du sees room for something built AI-native rather than retrofitted.

[11:38] Fastino's 340M Open Decision Model Runs Agent Guardrails on CPU

The model is built for the small but expensive judgment calls that sit inside every AI agent — the "which tool should I use," "is this safe," "which bucket does this belong in" moments. Fastino Labs calls it GLiNER2.5-Decide, a 340-million-parameter open-weight decision model released September 24.

Instead of generating text, you hand it content plus a schema of typed questions, and it returns structured answers. Every answer ships with a probability distribution, a confidence score, and feasibility flags. Schemas can express rules across questions, so a detection in one place can force a verdict in another.

The guardrail example shows why that matters. Decoded independently, the model flagged a prompt-injection attack at 0.82 confidence and simultaneously labeled the same prompt safe at 0.52. Joint decoding applies a rule that any detected harm requires an unsafe verdict, collapsing the answer to safety=unsafe and harm_type=prompt_injection together. Downstream code now has one consistent signal to block on.

It's a non-generative classifier built on a DeBERTa-v3-large encoder and fine-tuned from gliner2-large-v1. Weights ship under Apache 2.0; install is pip install gliner2, and it runs on CPU, GPU, or fully air-gapped. Fastino also offers hosted inference through its GLiNER API.

Fastino's internal suite, Fast Decisions, covers 5,100 examples across 17 datasets. GLiNER2.5-Decide averaged 60.1% exact-match, leading the suite on 9 of 17 datasets and beating a 4-billion-parameter Qwen 3.5-class baseline by about 2.6 points. On support intent it scored 75.3%.

बैच वन पर 15-लेबल स्कीमा के साथ विलंबता: 48-कोर Xeon पर 167 मिलीसेकंड p50, V100 पर 38 मिलीसेकंड। परिवार को पूरा करने वाले दो सिबलिंग्स — 59.6% पर 1B वेरिएंट और 56.7% पर 287M मल्टीलिंगुअल मॉडल।

[13:22] Black Forest Labs ने FLUX 3 Action लॉन्च किया: एक 7B रोबोट ब्रेन

Black Forest Labs ने FLUX 3 Action शिप किया है, एक 7-बिलियन-पैरामीटर ओपन-वेट्स मॉडल जो यह कल्पना करके रोबोट्स को बताता है कि क्या करना है कि क्या होगा। यह कैमरा फ्रेम्स, रोबोट की वर्तमान स्थिति और एक टेक्स्ट निर्देश पढ़ता है, फिर एक एकल संयुक्त भविष्यवाणी में भविष्य के वीडियो फ्रेम्स और रोबोट मोशन का अगला हिस्सा जेनरेट करता है। RoboLab-120 लीडरबोर्ड पर, जो सिमुलेशन में 120 टेबलटॉप टास्क्स का परीक्षण करता है, FLUX 3 Action 42.92% टास्क सक्सेस स्कोर करता है, जो NVIDIA के Cosmos 3 Nano (36.8%) से आगे है, भले ही यह बहुत छोटे बैकबोन पर चलता है। व्यावहारिक गति तस्वीर वही है जो इसे दिलचस्प बनाती है। Cosmos 3 Nano को π0.5 की तुलना में B200 पर रोबोट मोशन के प्रति सेकंड लगभग 4.7 गुना अधिक प्रोसेसिंग समय की आवश्यकता होती है। FLUX 3 Action छोटे आर्किटेक्चर और गाइडेंस डिस्टिलेशन के साथ उस अंतर को कम करता है। बेस चेकपॉइंट वर्कस्टेशन और डेटासेंटर GPU पर FP8 में Cosmos 3 Nano से 1.52 से 3.95 गुना तेज चलता है, और स्टेप-डिस्टिल्ड वेरिएंट उसी हार्डवेयर पर π0.5 से 2.28 गुना तक तेज चलता है। ट्रेडऑफ यह है कि बेस और गाइडेंस-डिस्टिल्ड चेकपॉइंट प्रति कॉल 2.13 सेकंड की मोशन प्रिडिक्ट करते हैं, जबकि π0.5 के लिए यह 1.0 सेकंड है, इसलिए गति लाभ आपके हार्डवेयर और आपके टास्क को कितनी मोशन की जरूरत है, इस पर निर्भर करता है। मेमोरी आवश्यकताएं मुख्य डिप्लॉयबिलिटी गेट हैं। पूर्ण DROID पॉलिसी को H200 पर BF16 में लगभग 32 GB GPU मेमोरी की आवश्यकता होती है। FP8 क्वांटाइजेशन और टेक्स्ट एनकोडर ऑफलोड के साथ, यह 24 GB कार्ड पर फिट होती है। Black Forest Labs ने मॉडल को Hugging Face LeRobot में भी इंटीग्रेट किया है और एज परिदृश्यों के लिए NVIDIA Jetson का समर्थन करता है। वास्तविक हार्डवेयर पर, Positronic Robotics के साथ एक ब्लाइंड इवैलुएशन जिसमें एक Franka आर्म का उपयोग किया गया, 10 DROID टास्क्स में 30 ट्रायल्स चलाया। FLUX 3 Action ने 30 में से 28 प्रयास पूरे किए। Cosmos 3 Nano ने 27, DreamZero ने 20 और π0.5 ने सिर्फ 13 स्कोर किया। टीमें अपने स्वयं के डेमोस्ट्रेशन पर मॉडल को फाइन-ट्यून कर सकती हैं। Black Forest Labs ने एक DROID रेसिपी और एक SO-101 LoRA रेसिपी प्रकाशित की, जो लगभग 200 उदाहरणों से सीखी गई एक पिक-एंड-प्लेस स्किल दिखाती है। वेट्स, कोड और रेसिपी FLUX Kommunity License के तहत आते हैं, जो गैर-वाणिज्यिक उपयोग की अनुमति देता है।

[15:29] Oracle New Mexico AI डेटा सेंटर पर Force Majeure लागू करता है

Oracle अपने सबसे बड़े AI इन्फ्रास्ट्रक्चर बेट्स में से एक के चारों ओर एक वित्तीय शील्ड लगा रहा है। कंपनी ने Project Jupiter के डेवलपर को एक force majeure नोटिस भेजा है, जो Blue Owl Capital की एक इकाई द्वारा New Mexico में बनाए जा रहे एक विशाल डेटा सेंटर है। यह खंड Oracle को भुगतान में देरी करने की अनुमति देता है अगर साइट 2028 के ऑनलाइन आने के लक्ष्य को चूक जाती है। Oracle मुख्य टेनेंट के रूप में पीछे हटने की कोशिश नहीं कर रहा है — यह इसलिए हेजिंग कर रहा है क्योंकि प्रोजेक्ट सार्वजनिक विरोध और नियामक बाधाओं का सामना कर रहा है।

यह फ्रेमिंग AI बिल्डआउट देखने वालों के लिए मायने रखती है। Force majeure खंड आमतौर पर प्राकृतिक आपदाओं या आपूर्ति झटकों के लिए पृष्ठभूमि में रहते हैं, इसलिए एक सक्रिय साइट पर क्लाउड टेनेंट को इसे लागू करते देखना यह संकेत देता है कि हर मेगावाट क्षमता पर कितनी वित्तीय एक्सपोजर निर्भर करती है। अगर Oracle Project Jupiter के 2028 से आगे बढ़ने की आशा कर रहा है, तो कंपनी अपनी पूंजी खर्च पर विकल्प चाहती है, न कि एक बाइनरी शिप-या-रद्द परिणाम।

प्रोजेक्ट को पहले से ही विरोध और परमिट घर्षण का सामना करना पड़ रहा है, और जब पावर, विनियमन और आपूर्ति श्रृंखला एक साथ बिल्डर के विरुद्ध धक्का दे रही हैं, तो 2028 की समय सीमा आशावादी दिखने लगती है। Oracle की हेज Blue Owl को भी एक शांत संकेत देती है: एंकर टेनेंट लचीलापन चाहता है, जरूरी नहीं कि लीज itself का पुनर्वार्ता।

व्यावहारिक पढ़ना सीधा है। क्षमता रोडमैप कंक्रीट से पहले अनुबंध हैं, और यह नोटिस उन पहले सार्वजनिक संकेतों में से एक है कि एक हाइपरस्केलर अपनी प्रतिबद्धताओं के साथ ऐसा व्यवहार कर रहा है। देखें कि क्या समान प्रोजेक्ट्स पर अन्य टेनेंट्स अपने टाइमलाइन में उतार-चढ़ाव आने पर वही सुरक्षा मांगते हैं।

[17:06] क्या Monkey Island का grog वास्तव में 35 सेकंड में एक मग को घोल सकता है? एक रसायनशास्त्री इसका मॉडल बनाता है।

Groningen विश्वविद्यालय के एक रसायनशास्त्री ने गेमिंग की सबसे प्रसिद्ध पहेलियों में से एक पर वास्तव में गणित किया है: क्या The Secret of Monkey Island में grog वास्तव में 35 सेकंड में एक पीवटर मग को खा सकती है। Journal of Geek Studies में प्रकाशित पेपर गेम के व्यवहार को एक इनवर्स प्रॉब्लम के रूप में मानता है, अवलोकित किए गए क्षरण दर से शुरू करके और यह अनुमान लगाकर कि तरल में क्या होना चाहिए।

लेखक, जो विज्ञान और इंजीनियरिंग संकाय में ENTEG इंस्टीट्यूट से संबद्ध है, ने 2009 के स्पेशल एडिशन का उपयोग किया जो Steam के माध्यम से वितरित किया गया था, और मग के जीवनकाल को लगभग 35 सेकंड के लगभग स्टॉपवॉच से मापा। उन्होंने माना कि मग पीटर का था, शुद्ध टिन के रूप में मॉडल किया गया, 2mm की दीवार की मोटाई को एक अनुमानित मान के रूप में चुना क्योंकि खेल कोई माप प्रदान नहीं करता। वहां से, उन्होंने अनुमान लगाया कि प्रति सेकंड आवश्यक प्रोटॉन की आपूर्ति क्या होगी ताकि अवलोकन समय के भीतर उस दीवार को छेदा जा सके।

उन्होंने फिर उस आवश्यकता को खेल की संवाद में सूचीबद्ध गrog सामग्री के विरुद्ध मिलाया: सल्फ्यूरिक एसिड, बैटरी एसिड, केरोसिन, प्रोपाइलीन ग्लाइकोल, कृत्रिम मिठास, रम, एसीटोन, लाल डाई नंबर 2, एक्सल ग्रीस, पेपरोनी, और रहस्यमय SCUMM। पेपर इस निष्कर्ष पर पहुंचता है कि सल्फ्यूरिक एसिड और बैटरी एसिड संभवतः संक्षारण को चला सकते हैं, जबकि अन्य अधिकांश सामग्रियां या तो सीधे टिन पर हमला करने की संभावना नहीं रखतीं या वास्तव में धातु की सतह को कोटिंग करके चीजों को धीमा कर देंगी। लेखक मॉडल को अर्ध-मात्रात्मक बताता है और नोट करता है कि सूचीबद्ध किसी भी घटक से गrog के चमकीले हरे रंग की व्याख्या नहीं होती जो खेल में बदल जाता है।

पोस्ट ने Hacker News पर 137 का स्कोर प्राप्त किया, जो इस बात का उपयुक्त सबूत है कि एक 1990 के पॉइंट-एंड-क्लिक एडवेंचर भी एक असली रसायन विज्ञान की समस्या रख सकता है अगर कोई इसे गंभीरता से लेने की परेशानी करे।

[18:50] DNA में सोचने वाला AI जैव-सुरक्षा सीमा को आगे बढ़ा रहा है

Radical Numerics, एक नई कंपनी जिसकी स्थापना उन शोधकर्ताओं ने की है जिन्होंने पहले Arc Institute में जीनोमिक लैंग्वेज मॉडल Evo और Evo-2 बनाए थे, उन क्षमताओं को जैविक समस्याओं की एक व्यापक श्रृंखला के लिए बढ़ा रही है। उन पहले के मॉडलों ने शुरू से संपूर्ण बैक्टीरियोफेज जीनोम उत्पन्न किए, और संश्लेषित वायरस प्रयोगशाला में कार्यात्मक सिद्ध हुए। अब टीम, CEO Eric Nguyen के नेतृत्व में, जीनोमिक लैंग्वेज मॉडल को DNA से आगे RNA और प्रोटीन में बढ़ा रही है, इस तथ्य का लाभ उठाते हुए कि DNA अनुक्रमों में जीन के लिए प्राकृतिक मार्कर और प्रोटीन कोड करने वाले अनुक्रम होते हैं। यह अंतर्निहित संरचना एक ही मॉडल को 3D प्रोटीन संरचना, एपिजेनेटिक्स, या प्राकृतिक भाषा पर प्रशिक्षण से पहले कई जैविक भाषाओं को संभालने देती है। एक प्रकट प्रयोग में, Radical Numerics ने एक मॉडल को क्रमशः बेहतर होते RNA एप्टामर्स को प्रदर्शन स्कोर के साथ जोड़कर दिखाया, फिर उससे अपने आप ट्रैजेक्टरी जारी रखने के लिए कहा। मॉडल ने उन उच्च-स्कोरिंग अनुक्रमों को दोहराया जो उसे नहीं दिखाए गए थे, जो सुझाव देता है कि उसने न केवल पैटर्न मैचिंग सीखी बल्कि DNA भाषा में सक्रिय अनुकूलन भी। टीम तर्क देती है कि वही क्षमताएं जो तेजी से वैक्सीन और चिकित्सीय डिजाइन को चलाती हैं, रक्षा के लिए भी मायने रखती हैं। जैसे-जैसे फ्रंटियर AI प्रयोगशालाएं साइबर-सुरक्षा के साथ-साथ जैव-सुरक्षा को शीर्ष चिंता के रूप में चिह्नित करती हैं, सवाल यह है कि क्या रक्षक पर्याप्त तेजी से आगे बढ़ सकते हैं। Radical Numerics हार रोकने के बजाय फ्रंटियर को और आगे धकेलने पर दांव लगा रही है। कंपनी में Michael Poli, जो पहले Liquid AI में संस्थापक वैज्ञानिक थे, मुख्य AI वैज्ञानिक के रूप में शामिल हैं; Stefano Massaroli, जो Yoshua Bengio के साथ पूर्व पोस्टडॉक और Liquid AI में संस्थापक टीम सदस्य थे, अध्यक्ष के रूप में; और Armin Thomas, जो पूर्व Stanford पोस्टडॉक थे जिन्होंने Chris Ré के साथ काम किया, CTO के रूप में। एक बात ध्यान देने योग्य: जीनोमिक लैंग्वेज मॉडल में क्रॉस-मॉडल जनरलाइज़ेशन कैसे काम करता है पैथोजन डिटेक्शन और वैक्सीन विकास टूलचेन में रक्षात्मक संपत्तियों और संभावित हमले-सतह की चिंताओं दोनों के रूप में।

[20:38] शोध सार: शोधकर्ताओं ने वीडियो मॉडल को मानवों की तरह छिपी हुई वस्तुओं को ट्रैक करने के लिए प्रशिक्षित किया

HuggingFace की दैनिक शोध फीड पर ट्रेंड करने वाला एक पेपर एक आश्चर्यजनक रूप से टॉडलर-स्तर का सवाल पूछता है: क्या आज के वीडियो जनरेशन मॉडल — वे AI सिस्टम जो चलती दृश्यों को संश्लेषित करते हैं — वास्तव में वस्तु स्थायित्व को समझते हैं, उस सामान्य भावना को कि चीजें तब भी मौजूद रहती हैं जब आप उन्हें नहीं देख सकते? लेखक तर्क देते हैं कि वीडियो मॉडल मानव-जैसी भौतिक बुद्धिमत्ता का अध्ययन करने के लिए एक स्वाभाविक उम्मीदवार हैं, क्योंकि हाल के संस्करणों ने उभरे हुए तर्क क्षमताओं को दिखाना शुरू कर दिया है। लेकिन जब वे उन मॉडलों की जांच करते हैं, तो पता चलता है कि मुख्य priors बड़े पैमाने पर अनुपस्थित हैं। उनका प्रस्तावित सुधार WROP है, एक नया प्रशिक्षण डेटासेट जो उन्हीं प्रकार की भौतिक अंतर्ज्ञान के आसपास बनाया गया है जो एक शिशु अपने जीवन के पहले महीनों में विकसित करता है। डेटासेट का उद्देश्य world models को ऑक्लूज़न और पुनः प्रवेश के दौरान वस्तुओं को सुसंगत रखना सिखाना है, ताकि एक जनरेट किया गया वीडियो कुर्सी के पीछे लुढ़की गेंद को याद रखे। व्यापक लक्ष्य world models है जो भौतिक दृश्यों के बारे में लोगों की तरह तर्क करें, रोबोटिक्स, सिमुलेशन, और किसी भी सिस्टम के लिए भुगतान करते हैं जिसे यह भविष्यवाणी करनी होती है कि छोटी अवधि के लिए दृश्य से बाहर जाने वाली चीजों का क्या होता है।

[21:42] शोध सार: AI कोडिंग एजेंट हाथ से बनाए गए रोबोट प्लानर से बेहतर प्रदर्शन करते हैं

रोबोट प्लानिंग कठिन है क्योंकि क्या करना है, कहां पकड़ना है, और कैसे हिलना है, ये सब एक साथ उलझे हुए हैं। इंजीनियर आमतौर पर इन प्लानरों को हाथ से लिखते हैं, जिसमें महीने लगते हैं। एक नए अध्ययन ने पूछा कि क्या AI कोडिंग एजेंट इस काम को कर सकते हैं।

Claude Code और Codex सहित एजेंटों को कार्य विवरण और सिम्युलेटर एक्सेस दिया गया। उन्होंने प्रोग्राम लिखे, वन-शॉट उत्तर नहीं बल्कि पुन: प्रयोज्य एल्गोरिदम, एक निश्चित बजट के भीतर। फ्रोज़न प्रोग्रामों को तब अनदेखे इंस्टेंस पर परीक्षण किया गया।

दो रोबोटिक्स बेंचमार्क के सिमुलेटेड वातावरणों में, एजेंटों ने हर विकल्प को हराया। मीन सक्सेस 56% से 95% तक पहुंची, जबकि हैंड-इंजीनियर्ड प्लानर 47% पर रहे जहां वे उपलब्ध थे। एजेंटों ने ऑब्जेक्ट काउंट बढ़ने पर भी अपना प्रदर्शन बनाए रखा, जो वह क्षेत्र है जहां क्लासिकल प्लानर आमतौर पर विफल हो जाते हैं।

मुख्य बात यह है कि बेस्पोक प्लानिंग कोड को मेंटेन करने में फंसे रोबोटिक्स टीमों के पास अब एक काम करने वाला शॉर्टकट है। किसी एजेंट को सिमुलेटर पर इंगित करें, इसे इटरेट करने दें, प्रोग्राम को फ्रीज करें, शिप करें। बॉटलनेक इंजीनियरिंग घंटों से कंप्यूट बजट में शिफ्ट हो जाता है।

[22:43] OpenAI ने मानसिक स्वास्थ्य AI प्रतिक्रियाओं के मूल्यांकन के लिए MentalHealthBench जारी किया

OpenAI ने 23 सितंबर को MentalHealthBench प्रकाशित किया, जो मानसिक स्वास्थ्य विशेषज्ञों के इनपुट के साथ निर्मित एक बेंचमार्क है जो यह मूल्यांकन करता है कि यथार्थवादी मानसिक स्वास्थ्य बातचीत में AI सिस्टम कितने सहायक और सुरक्षित हैं। लक्ष्य डेवलपर्स, शोधकर्ताओं और मॉडल प्रोवाइडर्स को एक साझा मानक देना है ताकि वे उस डोमेन में सहायक व्यवहार को ग्रेड कर सकें जहां सामान्य सटीकता स्कोर बिंदु को मिस कर देते हैं।

स्टैंडर्ड बेंचमार्क आमतौर पर यह मापते हैं कि क्या किसी मॉडल ने किसी तथ्यात्मक प्रश्न का सही उत्तर दिया। मानसिक स्वास्थ्य बातचीत अलग है: एक प्रतिक्रिया तथ्यात्मक रूप से सटीक हो सकती है और फिर भी हानिकारक, उपेक्षापूर्ण, या खतरनाक व्यवहार को प्रोत्साहित करने वाली हो सकती है। OpenAI का फ्रेमिंग इस बेंचमार्क को उस अंतर को भरने के रूप में स्थापित करता है, इस पर ध्यान केंद्रित करते हुए कि क्या कोई मॉडल सहायक रूप से जवाब देता है जबकि सुरक्षित सीमाओं के भीतर रहता है, जिसमें जानना शामिल है कि कब एस्केलेट करना है या पेशेवर मदद की सिफारिश करनी है, न कि इम्प्रोवाइज करना।

MentalHealthBench के अंदर के परिदृश्य यथार्थवादी बातचीत की स्थितियां हैं जो उपयोगकर्ता वास्तव में AI सहायकों के पास लाते हैं, जो व्यवहार-विशेषज्ञों द्वारा आकार दिए गए हैं, विशुद्ध रूप से सिंथेटिक टेस्ट राइटर्स द्वारा नहीं। विशेषज्ञ की भागीदारी मुख्य तंत्र है: जो लोग जीवन भर मानसिक स्वास्थ्य का काम करते हैं, वे तय करते हैं कि प्रत्येक आदान-प्रदान में एक अच्छा उत्तर कैसा दिखता है, इसलिए बेंचमार्क व्यवहार को उस तरह ग्रेड करता है जैसे एक क्लिनिशियन करता है, न कि उस तरह जैसे कोई मल्टीपल-चॉइस टेस्ट करता है।

बिल्डर्स के लिए, व्यावहारिक प्रभाव मानसिक स्वास्थ्य प्रतिक्रिया गुणवत्ता का एक तुलनीय स्कोर है। एक टीम जो AI वेलनेस कोच, थेरेपी-एडजेसेंट जर्नलिंग ऐप, या ट्रायज चैटबॉट शिप कर रही है, वह अब इम्प्रेशन या चेरी-पिक्ड डेमो पर भरोसा करने के बजाय एक प्रलेखित बेंचमार्क परिणाम का संदर्भ दे सकती है। रिलीज यह भी संकेत करती है कि डोमेन-विशिष्ट सुरक्षा मूल्यांकन संवेदनशील क्षेत्रों में एक डिफ़ॉल्ट अपेक्षा बन रहा है, लॉन्च के बाद बाद में पैच की गई अनावश्यक चीज नहीं।

एक बात देखने की है कि क्या अन्य लैब्स और स्वतंत्र मूल्यांकनकर्ता इस बेंचमार्क को अपनाते हैं, इसे फोर्क करते हैं, या प्रतिस्पर्धी संस्करण बनाते हैं, क्योंकि एक सिंगल वेंडर का ग्रेडिंग स्टैंडर्ड उतना ही उपयोगी है जितना कि व्यापक समुदाय इसे मानता है।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily