TobyOnFitnessTech
एजेंटस्टैक दैनिक: एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220 — Episode 97 cover art
Episode 97·6 अगस्त 2026·44:39

एजेंटस्टैक दैनिक: एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220

एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220, Qwen3.8-Max ने कोडिंग और सहकर्मी के लिए नया... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-97/

🎧 Listen to Episode

एपिसोड 097 — 05 अगस्त, 2026

[00:00] एपिसोड हुक

एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220 आज का नेतृत्व कर रहे हैं: v2026.8.3 उन सतहों में ठोस बदलाव लाता है जिन पर बिल्डर्स हर दिन काम करते हैं, विवरण नीचे। आज की लाइनअप में भी: Qwen3.8-Max कोडिंग और सहकर्मी कार्य के लिए नया मानक स्थापित करता है, AirLLM एकल 4GB GPU पर 70B इंफरेंस का दावा करता है, Circles ने OpenAI-संचालित व्यक्तिगतकरण के साथ टेलको ARPU में 22% की वृद्धि की, साथ ही मॉडल, टूलिंग और इन्फ्रास्ट्रक्चर में घनी खबरों का बाकी हिस्सा। प्रत्येक कहानी को वही इलाज मिलता है — क्या शिप हुआ, इसके नीचे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।

[02:00] एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220

इस चक्र में नए स्थिर रिलीज: OpenClaw v2026.7.1-2, v2026.7.1-1; Hermes Agent v2026.8.3; Claude Code CLI 2.1.220। github.com पर प्राथमिक स्रोत केवल इन बताई गई तथ्यों का समर्थन करता है; असमर्थित विशिष्टताओं को जानबूझकर छोड़ दिया गया है। प्राथमिक स्रोत उपरोक्त विशिष्ट उत्पाद या वर्कफ़्लो परिवर्तन का समर्थन करता है; यह प्रदर्शन, संगतता, या परिनियोजन के बारे में व्यापक दावों का समर्थन नहीं करता। इस पर निर्भर होने से पहले, एक वास्तविक वर्कफ़्लो के विरुद्ध स्रोतित परिवर्तन का परीक्षण करें। OpenClaw v2026.7.1-2: फिक्सेस - npm प्लगइन अपडेट: नए npm क्लाइंट से सिंगलटन-एरे मेटाडेटा स्वीकार करें ताकि ट्रैक किए गए आधिकारिक प्लगइन इंस्टॉल कर सकें और करेक्शन रिलीज में अपडेट कर सकें। OpenClaw v2026.7.1-1: फिक्सेस - Codex प्रोग्रेस रिप्लाई: डिलीवर किए गए प्रोग्रेस मैसेज के बाद ऐप-सर्वर टर्न्स चलते रखें ताकि GPT/Codex अपने अधिकृत टर्मिनल रिस्पॉन्स तक पहुंचे बजाय बीच में रुकने के। (106961, 108487) @joshavant को धन्यवाद। - मेमोरी कोर स्टार्टअप मरम्मत: व्युत्पन्न लेगसी-इंडेक्स और कैश-साइडकार कॉन्फ्लिक्ट्स को ठीक करें बिना Gateway को घातक रीस्टार्ट लूप में फंसाए, जबकि स्ट्रक्चरल वेक्टर-स्टोर करप्शन को रिट्रायबल रखें। (107220, 108652) @goutam-adwant को धन्यवाद। - WSL स्टेट परमिशन: EROFS को केवल तभी सहन करें जब गार्डेड chmod ऑपरेशन से हो जब मौजूदा स्टेट पाथ पहले से प्राइवेट हो, व्यापक परमिशन के लिए फेल-क्लोज्ड हैंडलिंग को संरक्षित रखते हुए। Hermes Agent v2026.8.3: Hermes Agent v0.20.0 (v2026.8.3) रिलीज तिथि: 03 अगस्त, 2026 v0.19.0 के बाद से: ~3,650 कमिट्स · ~1,400 मर्ज्ड PRs · ~5,200 बदली गई फाइलें · ~559,000 इन्सर्शन · ~405,000 डिलीशन · ~1,200 बंद इश्यू · 650+ योगदानकर्ता > द हेराल्ड रिलीज। Hermes देवताओं का हेराल्ड है, और यह रिलीज उसे वास्तव में एक बनाती है: वह बोलता है (रीयल-टाइम कन्वर्सेशनल वॉयस स्ट्रीमिंग TTS, बार्ज-इन, ऑन-डिवाइस वेक वर्ड्स, और CLI, डेस्कटॉप, और हर ऑडियो-सक्षम गेटवे प्लेटफॉर्म पर हैंड्स-फ्री कंट्रोल के साथ), वह दूसरे एजेंटों तक संदेश पहुंचाता है (A2A v1।

[02:37] Qwen3.8-Max कोडिंग और सहकर्मी कार्य के लिए नया मानक स्थापित करता है

Qwen ने 4 अगस्त, 2026 को Qwen3.8-Max जारी किया और इसे कोडिंग और सहकर्मी कार्य के लिए एक नया मानक के रूप में प्रस्तुत किया — सिंगल-टर्न चैट के बजाय मानव के साथ मल्टी-स्टेप एजेंटिक कार्य। qwen.ai पर रिलीज पोस्ट ने तर्क दिया कि नया टॉप-टियर मॉडल कोडिंग टास्क पर पिछले Qwen वर्जन से आगे निकल गया है। लॉन्च के आसपास की Hacker News थ्रेड 1102 के स्कोर तक पहुंच गई, एक मॉडल लॉन्च के लिए असामान्य रूप से मजबूत डेवलपर ध्यान, जो सुझाव देता है कि फ्रेमिंग समुदाय के साथ प्रभावी रही।

इसका व्यावहारिक अर्थ: कोडिंग एजेंट, रेपो-अवेयर असिस्टेंट, या लॉन्गर-होरिजॉन सहकर्मी सेटअप चलाने वाला कोई भी अब मूल्यांकन के लिए एक नया Qwen फ्लैगशिप रखता है। रिलीज Latent Space के कवरेज के माध्यम से 4 अगस्त को सामने आई, जब अधिकांश डेवलपर्स ने पहली बार इसे देखा। Qwen की अपनी ब्लॉग पोस्ट टीम की पोजिशनिंग दावों के लिए प्राथमिक स्रोत है, और यहां स्रोत सामग्री में अलग बेंचमार्क डंप, फीचर लिस्ट, या प्राइसिंग शीट शामिल नहीं थी — इसलिए "नया मानक" फ्रेमिंग को Qwen की अपनी पोजिशनिंग के रूप में पढ़ा जाना चाहिए जब तक कि स्वतंत्र मूल्यांकन इसे पुष्ट न करें।

अगले कदम पर ध्यान देने वाली एक बात: स्वतंत्र मूल्यांकन लॉन्च के बाद के दिनों में Qwen3.8-Max को कैसे ट्रीट करते हैं, और मॉडल कितनी जल्दी प्रमुख एजेंट उत्पादों के अंदर दिखाई देता है।

[03:51] AirLLM एकल 4GB GPU पर 70B इंफरेंस का दावा करता है

AirLLM, GitHub पर एक ओपन-सोर्स प्रोजेक्ट, 4GB मेमोरी के साथ एक ही GPU पर 70 अरब पैरामीटर भाषा मॉडल चलाने की क्षमता का विज्ञापन करता है। रिपॉजिटरी, lyogavin/airllm, 4 अगस्त को Hacker News पर सामने आई जिसका डिस्कशन स्कोर 230 था, जिसने इस विचार पर ध्यान आकर्षित किया कि कंज्यूमर-ग्रेड हार्डवेयर फ्रंटियर-साइज़्ड मॉडल को होस्ट कर सकता है।

4GB GPU वह तरह का कार्ड है जो पुराने लैपटॉप या बजट डेस्कटॉप में होता है। अगर 70B मॉडल वास्तव में उस पर उपयोगी रूप से चलता है, तो लोकल AI की लागत कहानी रातोंरात बदल जाती है — कोई डेटासेंटर नहीं, कोई मल्टी-GPU रिग नहीं, बस एक ऑफ-द-शेल्फ ग्राफिक्स कार्ड।

उपलब्ध सोर्स मैटेरियल में चेंजलॉग या विस्तृत रिलीज़ नोट्स शामिल नहीं हैं, इसलिए AirLLM द्वारा उपयोग की जाने वाली विशिष्ट तकनीक यहां की पुष्टि नहीं की जा सकती। प्रोजेक्ट का मूल्यांकन करने वाले को शीर्षक संख्या को व्यावहारिक उपयोग में बदलने से पहले सीधे रिपॉजिटरी पढ़नी चाहिए और अपने हार्डवेयर और वर्कलोड के खिलाफ इसका परीक्षण करना चाहिए।

सीमित हार्डवेयर पर चलने वाले बिल्डर्स के लिए — एज डिवाइस, पुराने वर्कस्टेशन, लागत-संवेदनशील डिप्लॉयमेंट — वास्तविक सवाल यह है कि वास्तविक लेटेंसी और थ्रूपुट संख्याएं टारगेट मशीन पर काम करती हैं या नहीं। GitHub रिपॉजिटरी वह जगह है जहां वर्तमान इम्प्लीमेंटेशन और मेंटेनर्स द्वारा प्रकाशित किसी भी बेंचमार्क विवरण को पाया जा सकता है।

[05:04] Circles ने OpenAI-संचालित पर्सनलाइज़ेशन के साथ टेल्को ARPU को 22% तक बढ़ाया

Circles, एक प्लेटफॉर्म जो टेलीकॉम कैरियर्स के लिए पर्सनलाइज़ेशन बनाता है, ने अभी अपने OpenAI के साथ काम के परिणाम प्रकाशित किए हैं। शीर्षक संख्याएं, इस सप्ताह OpenAI के न्यूज़रूम पर पोस्ट की गईं: प्रति उपयोगकर्ता औसत राजस्व 22% बढ़ा है, चर्न 9% कम हुआ है, और विकास दक्षता में सुधार हुआ है। Circles कैरियर्स और उनके सब्सक्राइबर्स के बीच बैठता है, इसलिए इस तरह के लाभ वे मेट्रिक्स हैं जिन्हें ऑपरेटर आमतौर पर वर्षों और कई मार्केटिंग अभियानों में कमाने की कोशिश करते हैं।

पेपर पर बिल्ड सीधा है। Circles OpenAI API और Codex दोनों का उपयोग करता है जिसे सोर्स AI-native telco अनुभव कहता है। प्रकाशित लेख दोनों OpenAI उत्पादों को एक सिंगल स्टैक के रूप में मानता है और तीनों रिपोर्ट किए गए परिणामों को उस संयुक्त सेटअप के लिए जिम्मेदार ठहराता है, ARPU लिफ्ट, चर्न ड्रॉप, और तेज़ डेवलपमेंट लूप। यहां बदलाव यह है कि Circles दोनों तरफ OpenAI पर निर्भर है: फीचर्स शिप करने वाली इंजीनियरिंग प्रोसेस में, और उन फीचर्स द्वारा उत्पादित कस्टमर अनुभवों में।

एक वर्टिकल के लिए जहां ऐतिहासिक रूप से पर्सनलाइज़ेशन का मतलब एक स्टैटिक कस्टमर सेगमेंट और मैन्युअली कॉन्फ़िगर ऑफर था, एक AI-native स्टैक एक सार्थक बदलाव है। अगला ध्यान देने योग्य एक बात: क्या Circles 22% और 9% आंकड़ों के पीछे विशिष्ट कैरियर्स और मार्केट्स का नाम बताता है, क्योंकि प्रूफ पॉइंट तेज़ होता है जितना अधिक कंक्रीट डिप्लॉयमेंट फुटप्रिंट बनता है।

[06:23] Mistral ने Shieldstral लॉन्च किया, एक 3B ओपन-वेट्स मल्टीमॉडल सेफ्टी क्लासिफायर

Mistral ने 4 अगस्त को Shieldstral रिलीज़ किया, एक 3 अरब पैरामीटर ओपन-वेट्स मॉडल जो मल्टीमॉडल सेफ्टी क्लासिफिकेशन के लिए बनाया गया है। कंपनी का कहना है कि यह छोटा मॉडल सात गुना आकार तक के क्लासिफायर्स से बेहतर प्रदर्शन करता है।

रिलीज़ Mistral के ब्लॉग पर आई और जल्दी से Hacker News पर जोर पकड़ गई, जहां थ्रेड 421 के स्कोर तक पहुंच गया। यह ध्यान एक संकेत है — मल्टीमॉडल मॉडरेशन एक ऐसा वर्कलोड है जिसे अधिकांश टीमें या तो बड़े क्लोज़्ड API या छोटे मॉडलों की सिलाई-जोड़ी पाइपलाइनों के माध्यम से रूट कर रही थीं।

बिल्डर्स के लिए जो बदलाव आता है वह साइज़ और ओपननेस का संयोजन है। क्योंकि वेट्स पब्लिक हैं, टीमें हार्मफुल कंटेंट के अपने टैक्सोनॉमी पर Shieldstral को फाइन-ट्यून कर सकती हैं, ब्लैक-बॉक्स क्लासिफायर के लेबल को रिवर्स-इंजीनियर करने के बजाय। मल्टीमॉडल एंगल — एक क्लासिफायर में इमेज और टेक्स्ट दोनों को लेना — भी एक कॉमन टू-स्टेप पाइपलाइन को एक सिंगल इंफरेंस कॉल में बदल देता है।

ओपन-वेट्स एंगल प्राइवेसी-सेंसिटिव प्रोडक्ट्स के लिए अधिक व्यावहारिक अनलॉक है। जिन टीमों को मॉडरेशन इंफरेंस अपने एनवायरनमेंट के अंदर रखने की जरूरत है, उनके पास अब एक मिस्ट्रल आर्टिफैक्ट है जिसकी ओर इंगित कर सकती हैं, बजाय शुरू से बनाने के। अगला देखने योग्य: सात गुना के दावे के स्वतंत्र बेंचमार्क रिप्रोडक्शन और फाइन-ट्यूनिंग रेसिपीज़ जो समुदाय से आएंगी एक बार लोग डोमेन-स्पेसिफिक एब्यूज़ कैटेगरीज़ के लिए Shieldstral को अडैप्ट करना शुरू कर देंगे।

[07:38] NVIDIA का Alpamayo 2 Super Robotaxis के लिए खुल गया

NVIDIA ने 4 अगस्त को Alpamayo 2 Super को कमर्शियल उपयोग के लिए खोला, इसे रोबोटैक्सी और अन्य स्वायत्त वाहनों के लिए एक फ्रंटियर ओपन मॉडल बताया। फ्रेमिंग मायने रखती है: NVIDIA रिलीज को आसान समस्याओं के बजाय सबसे कठिन ड्राइविंग समस्याओं के इर्दगिर्द पोजिशन कर रहा है। रोज़मर्रा की ऑब्जेक्ट डिटेक्शन और मोशन प्रेडिक्शन, उनके अनुसार, अब बॉटलनेक नहीं हैं। कठिन केस वे दुर्लभ, लॉन्ग-टेल स्थितियां हैं जिन्हें एंटिसिपेट और ट्रेन करना मुश्किल है, जहां वाहन को स्थिति को समझने, कारण और प्रभाव के बारे में रीज़न करने और सही कार्रवाई चुनने की जरूरत है। उस क्षमता को एक ओपन, कमर्शियली यूज़ेबल मॉडल में ले जाना यहां व्यावहारिक बदलाव है, AV टीमों को अध्ययन करने के बजाय बिल्ड करने के लिए एक फाउंडेशन देना। जो घोषणा अभी तक स्पष्ट नहीं करती वह यह है कि मॉडल मौजूदा AV स्टैक में कैसे फिट बैठता है, कमर्शियल उपयोग के लिए कौन से लाइसेंसिंग टर्म्स लागू हैं, या सुरक्षा-क्रिटिकल बेंचमार्क पर क्लोज़्ड प्रतिस्पर्धियों से यह कैसे तुलना करता है। आने वाले हफ्तों में जब इकोसिस्टम गहराई से देखेगा तो ये डीटेल्स देखने योग्य हैं।

[08:41] Apple नए कोर्ट फाइलिंग में OpenAI के ट्रेड सीक्रेट्स की जांच का विस्तार किया

Apple ने इस हफ्ते एक अदालत को बताया कि उसके अधिक पूर्व कर्मचारियों ने OpenAI की ओर जाते समय गोपनीय जानकारी ली या एक्सेस की होगी। एक सप्लीमेंटल फाइलिंग में, Apple कहता है कि उसकी मौजूदा ट्रेड सीक्रेट्स जांच अब अतिरिक्त पूर्व स्टाफ को शामिल करती है। 4 अगस्त को TechCrunch द्वारा पहले रिपोर्ट की गई फाइलिंग, मामले को फिर से शुरू करने के बजाय मौजूदा मामले का दायरा बढ़ाती है। Apple का दावा है कि इन अतिरिक्त पूर्व कर्मचारियों ने गोपनीय जानकारी रखी या एक्सेस की होगी। न फाइलिंग और न ही रिपोर्टिंग में अतिरिक्त कर्मचारियों के नाम हैं, और वे विशिष्ट श्रेणियां जिन्हें Apple का दावा है कि लिया गया था, सार्वजनिक रिकॉर्ड में नहीं हैं। जो स्पष्ट है वह यह है कि जांच अब एक छोटे से पहले से नामित व्यक्तियों के सेट तक सीमित नहीं है, और विवाद अब एक व्यापक चरण में पहुंच गया है। बिल्डर्स के लिए, व्यावहारिक निष्कर्ष यह है कि इन्कम्बेंट्स और OpenAI के बीच AI टैलेंट पाइपलाइन अभी भी लीगल फ्रिक्शन पैदा कर रही है। यह मामला आकार दे सकता है कि इंजीनियर्स कंपनियों के बीच जाते समय प्रॉपर्टरी के रूप में माना जाने वाले चीज़ों को कितना आक्रामक रूप से लागू किया जाता है, और अदालतें उस गोपनीय जानकारी को कैसे मानती हैं जो उन लाइनों को पार करती है। हम देखेंगे कि कोर्ट विस्तारित दायरे को स्वीकार करता है या नहीं और क्या कोई नए नामित कर्मचारी आरोपों का विरोध करते हैं।

[09:57] रिसर्च डाइजेस्ट: AI वीडियो एजेंट जो वास्तव में फुटेज देखते हैं, न कि बस Google करते हैं

अधिकांश AI 'वीडियो एजेंट' आड़े में छिपे टेक्स्ट-सर्च इंजन हैं — वे वीडियो को छोड़ देते हैं और बस टाइटल Google करते हैं, मेमोरी पर भरोसा करते हैं बजाय स्क्रीन पर जो वास्तव में है उसके। एक नया पेपर इसकी शिकायत करता है और इसे ठीक करता है। Video-DeepResearch मॉडल को पहले हर प्रासंगिक फ्रेम को व्यापक रूप से स्कैन करने के लिए मजबूर करता है, फिर वेब रिसर्च करता है जो उस पर आधारित होता है जो उसने वास्तव में देखा। सिस्टम दो चरणों में ट्रेंड है: सुपरवाइज़्ड फाइन-ट्यूनिंग के बाद एक रिइन्फोर्समेंट-लर्निंग पास जो जानकारी अनुमान लगाने के बजाय वास्तव में खोजने के लिए पुरस्कृत करता है। 200 प्रश्नों के नए वीडियो-रीज़निंग बेंचमार्क पर, 35 बिलियन-पैरामीटर मॉडल 64 प्रतिशत सटीकता के साथ स्टेट-ऑफ-द-आर्ट पोस्ट करता है, Claude 4.5 Sonnet, GPT-5, और Gemini 2.5 Pro को हराता है। व्यावहारिक परिणाम: एक असिस्टेंट जो लंबे ट्यूटोरियल या सर्विलांस क्लिप देख सकता है और स्क्रीन पर वास्तव में क्या हो रहा है इसके बारे में आधारित प्रश्नों के उत्तर दे सकता है, बजाय टाइटल को उसकी मेमोरी के खिलाफ पैटर्न-मैच करने के।

[10:52] OpenAI Apple पर 'बेबुनियाद मुकदमा' लेकर वापस आया

OpenAI ने इस सप्ताह Apple के खिलाफ "Apple is getting this wrong" शीर्षक से एक तीखा सार्वजनिक खंडन प्रकाशित किया, जिसमें उसने इसे एक बेबुनियाद मुकदमा बताया और Apple के अपने कर्मचारियों के बारे में दावों को खारिज किया। 3 अगस्त, 2026 की यह पोस्ट उन संदेशों और रिकॉर्ड्स पर केंद्रित है जिन्हें OpenAI कहता है कि वास्तव में क्या हुआ, कंपनी का पक्ष सीधे Apple की कथा के विरुद्ध रखा गया है। यह जवाब तब आया है जब विवाद AI उद्योग में सबसे अधिक देखे जाने वाले सार्वजनिक टकरावों में से एक बन गया है, जिसमें पोस्ट पर Hacker News थ्रेड में 277 अंक और एक तेज़-गति से चलने वाली टिप्पणी खंड है।

OpenAI ने इसे कानूनी प्रति-प्रहार के बजाय तथ्यात्मक सुधार के रूप में प्रस्तुत किया, जिसमें उसने Apple की घटनाओं की व्याख्या का खंडन करने के लिए ठोस साक्ष्य साझा किए। यह फ्रेमिंग मायने रखती है क्योंकि कर्मचारी आचरण और कॉर्पोरेट दावों की सार्वजनिक फ्रेमिंग अक्सर किसी भी अदालत के निर्णय से बहुत पहले नियामक और निवेशक की जागरूकता को आकार देती है। पोस्ट कानूनी तकनीकी बातों में कम और कंपनी के अपने तथ्यों के संस्करण में अधिक है।

अभी के लिए, व्यावहारिक समझ सरल है: OpenAI इस विवाद का एक हिस्सा सार्वजनिक रूप से लड़ने का चुनाव कर रहा है, और पोस्ट रिपोर्टरों, ग्राहकों और प्रतिद्वंद्वियों को Apple के दावों के विरुद्ध नए दस्तावेज़ों का एक सेट देती है। यह देखना जारी रखें कि Apple इसी तरह जवाब देता है या पोस्ट को बिना लिखित जवाब के खड़ा होने देता है — और क्या साझा किए गए कोई संदेश दस्तावेज़ों में सामने आते हैं।

[12:15] शोध सारांश: EcoFrame लंबे-वीडियो AI को गति देता है

दो घंटे की वीडियो देखना और उसके बारे में प्रश्नों के उत्तर देना AI के लिए कठिन है। आज के मॉडल या तो शुरू में कुछ निश्चित फ्रेम चुन लेते हैं और चीज़ों को छोड़ देते हैं, या फिर यह तय करने के लिए महंगी वापस-आने-जाने वाली reasoning का उपयोग करते हैं कि कहां देखना है। EcoFrame नामक एक नया training-free framework एक मध्यमा रास्ता अपनाता है: यह देखता है कि मॉडल जब काम कर रहा है तो कितना आश्वस्त है, और केवल तभी अधिक फ्रेम पकड़ता है जब अनिश्चितता उच्च हो। जब attention पूरे वीडियो में फैलता है, तो यह वैश्विक रूप से देखता रहता है; जब attention किसी विशिष्ट क्षेत्र पर केंद्रित होता है, तो यह वहां zoom in करता है। व्यावहारिक परिणाम agent-style approach की तुलना में 13.5 गुना तेज़ है, जबकि तीन लंबे-वीडियो benchmarks पर उसकी accuracy से मेल खाता है। builders के लिए, इसका मतलब है कि लंबे-वीडियो समझ features अधिक सस्ते में और तेज़ी से चल सकते हैं, underlying model को retrain किए बिना। Code publicly available है।

[13:05] OpenAI Outlines New Safeguards After Third-Party Cyber Evaluation Incidents

4 अगस्त को, OpenAI ने अपने मॉडलों से संबंधित third-party cybersecurity evaluations से जुड़ी हालिया घटनाओं के बारे में एक पोस्ट प्रकाशित की। बताया गया उद्देश्य दोहरा है: उन बाहरी evaluations के दौरान क्या हुआ, इसकी व्याख्या करना, और नए safeguards बताना जो कंपनी कहती है कि AI model testing और evaluation को यहां से आगे मजबूत करेंगे।

Framing महत्वपूर्ण है। इन घटनाओं को third-party cyber evaluation incidents के रूप में सार्वजनिक रूप से नाम देकर और उन्हें बिना टिप्पणी के ऐसे ही छोड़ने के बजाय, OpenAI बाहरी सुरक्षा जांच को एक श्रेणी के रूप में मान रहा है जो अपने स्वयं के playbook को justified ठहराती है। नए safeguards का परिचय बाहरी researchers के साथ cyber और security उद्देश्यों के लिए OpenAI models में संलग्न होने के तरीके के बारे में अधिक संरचित नियमों की ओर एक कदम को दर्शाता है।

Production में OpenAI models का उपयोग करने वाले builders के लिए, यह lab में एक model upgrade के बजाय process change है। Prompts, APIs, और end-user products में बदलाव के बारे में नहीं बताया गया है। व्यावहारिक प्रभाव एक परत ऊपर है, यह में कि OpenAI बाहरी researchers और firms के साथ अपने संबंधों को कैसे govern करता है।

एक बात आगे देखने की है वह नए safeguards के पीछे operational detail है। पोस्ट नए नियमों की घोषणा करती है, लेकिन OpenAI sanctioned third-party cyber work को unsanctioned probing से कैसे distinguish करता है, और कंपनी भविष्य की घटनाओं को कितनी खुले तरीके से disclose करेगी — यह तय करेगा कि यह उद्योग भर में model evaluation culture को कितना बदलता है।

[14:25] OpenAI ने GPT-Live के छह महीने के निर्माण पर पर्दा उठाया

OpenAI ने 3 अगस्त को एक पीछे की ओर इंजीनियरिंग पोस्ट प्रकाशित की जिसमें बताया गया है कि उसने GPT-Live कैसे बनाया, जो अपने असिस्टेंट के साथ निरंतर वॉयस इंटरैक्शन के पीछे की प्रणाली है। मुख्य दावा: एक टर्नलेस स्पीच मॉडल जो कम-विलंबता आर्किटेक्चर के साथ जोड़ा गया है, छह महीने में पूरा हुआ, जिसका उद्देश्य बोलचाल की बातचीत को तेज़ और अधिक प्राकृतिक बनाना है।

पोस्ट को एक उत्पाद लॉन्च के बजाय छह महीने के इंजीनियरिंग बिल्ड के रूप में प्रस्तुत किया गया है। यह पोजिशनिंग अपने आप में उपयोगी है। यह बिल्डर्स को बताती है कि OpenAI रियल-टाइम, फ्लुइड वॉयस को एक समर्पित सिस्टम के रूप में मान रहा है जिसका अपना मॉडल और आर्किटेक्चर है, टेक्स्ट मॉडल के ऊपर एक पतली परत नहीं।

पोस्ट में जिन ठोस विवरणों का नाम लिया गया है वे सीमित हैं। एक टर्नलेस स्पीच मॉडल है, जिसका मतलब है कि ऑडियो पाइपलाइन निरंतर इनपुट के इर्दगिर्द बनाई गई है, न कि असतत यूज़र टर्न के इर्दगिर्द। एक कम-विलंबता आर्किटेक्चर है जो स्पीकर के शब्दों और असिस्टेंट की जवाब के बीच के अंतर को कम करने के लिए डिज़ाइन किया गया है। ये दो नामित टुकड़े कहानी की रीढ़ हैं। पोस्ट में बेंचमार्क नंबर, विलंबता आंकड़े, या फीचर सूची प्रकाशित नहीं है।

बिल्डर्स के लिए, निकट-अवधि का सारांश सीमित है। यह एक "कैसे-बनाया" पोस्ट है, न कि एक नया API या एक नया मोड, इसलिए आज कुछ भी इंटीग्रेट करने के लिए नहीं है जो कल नहीं था। लंबी अवधि का संकेत यह है कि OpenAI वॉयस में एक फर्स्ट-क्लास सतह के रूप में निवेश कर रहा है जिसका अपना मॉडल क्लास है। यदि आप स्पोकन UX के लिए डिज़ाइन कर रहे हैं, तो यात्रा की दिशा स्पष्ट रूप से उन प्रणालियों की ओर है जो सुनती हैं और सुचारू रूप से जवाब देती हैं, न कि साफ़-सुथरे टर्न ट्रेड करती हैं, और OpenAI अब सार्वजनिक रूप से उस मॉडल पर दांव लगा रहा है।

[16:01] Microsoft Research ने Orchard रिलीज़ किया, AI एजेंट्स को प्रशिक्षित और मूल्यांकित करने के लिए एक ओपन फ्रेमवर्क

Microsoft Research ने 3 अगस्त, 2026 को Orchard प्रकाशित किया, एक ओपन-सोर्स फ्रेमवर्क जो विभिन्न प्रकार के कार्यों में AI एजेंट्स को प्रशिक्षित और मूल्यांकित करने के लिए शोध समुदाय के लिए बनाया गया है। पिच सीधी है: हर एजेंट प्रयोग के लिए मचान को फिर से बनाना बंद करें। Orchard इस जटिलता को कम करने के लिए डिज़ाइन किया गया है जबकि अभी भी छोटे मॉडलों को मजबूत प्रदर्शन देने देता है, क्योंकि एक ही अंतर्निहित इन्फ्रास्ट्रक्चर को कार्यों और रनों में पुनः उपयोग किया जा सकता है। वह पुनः उपयोग व्यावहारिक हुक है। एजेंट्स को प्रशिक्षित करने वाले शोधकर्ता अक्सर वास्तविक प्रयोग चलाने जितना समय वातावरण, हार्नेस और मूल्यांकन हार्नेस सेट अप करने में बिताते हैं। एक साझा फ्रेमवर्क सभी को परिणामों की तुलना करने के लिए एक सामान्य सतह देता है, जो विशेष रूप से तब उपयोगी है जब परीक्षण के तहत मॉडल इतना छोटा है कि सेब-से-सेब की स्थितियां मायने रखती हैं। Microsoft Research Orchard को समुदाय के लिए एक शुरुआती बिंदु के रूप में पोजिशन कर रहा है, न कि एक तैयार उत्पाद के रूप में, जो एक शोध फ्रेमवर्क के लिए सही स्वर है। दिलचस्प सवाल यह है कि अन्य लैब और अकादमिक समूह इसे डिफ़ॉल्ट मूल्यांकन परत के रूप में अपनाते हैं या नहीं, क्योंकि अपनाना ही एक कोडबेस को बेंचमार्क में बदलता है। बिल्डर्स के लिए, सीधा सारांश सीमित है: Orchard शोधकर्ताओं के लिए है, प्रोडक्शन टीमों के लिए नहीं, लेकिन यह वह उपकरण है जो चुपचольно अगले साल कुछ एजेंट परिणामों को गंभीरता से लेने को आकार देता है।

[17:20] Qwen 3.8 Max

Alibaba ने Qwen3.8-Max लॉन्च किया, एक 2.4T-पैरामीटर ओपन-वेट मॉडल जो स्वायत्त कोडिंग, लॉन्ग-होराइज़न एक्जीक्यूशन और मल्टीमॉडल फीडबैक पर जोर देता है, आक्रामक मूल्य निर्धारण के साथ। प्रारंभिक बेंचमार्क इसे मानव-प्राथमिकता और विज़न कार्यों पर उच्च रैंक करते हैं, जो Claude Opus 4.7 के साथ समानता और मजबूत ऑब्जेक्ट-डिटेक्शन क्षमताओं को दर्शाते हैं। हालांकि, परिचालन मांगें अभी भी अधिक हैं, विशेष रूप से Qwen3.8-Max और Kimi K3 जैसे बड़े MoE मॉडलों के लिए, आगामी 27B वेरिएंट जैसे छोटे ओपन मॉडलों की रणनीतिक महत्ता पर प्रकाश डालते हुए। ओपन-वेट फ्रंटियर में increasingly Chinese labs Kimi, DeepSeek, GLM, और MiniMax सहित अमेरिकी लैब के साथ अंतर कम हो रहा है। DeepSeek V4 Flash को एजेंट मॉडलों में लागत/प्रदर्शन विघटनकारी के रूप में नोट किया गया है। यह कंपनी का प्रकाशित नीति रुख है, न कि लागू कानून या नवीनतम शिप्ड मॉडल क्षमता। तंत्र मॉडल वेट्स का नियंत्रण है: ओपन वेट्स स्वतंत्र निरीक्षण और स्थानीय परिनियोजन का समर्थन करते हैं, जबकि प्रतिबंधित फ्रंटियर वेट्स सुरक्षा चिंताओं के कारण प्रदाता के नियंत्रण में रहते हैं। ओपन मॉडल चुनने वाले बिल्डर्स को इस बयानबाजी को वर्तमान कानून से अलग करना चाहिए और स्टैक बदलने से पहले ठोस लाइसेंस या एक्सेस परिवर्तनों का इंतज़ार करना चाहिए।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily