AgentStack Daily: एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.8.2 — Episode 110 cover art
Episode 110·3 सितंबर 2026·44:12

AgentStack Daily: एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.8.2

एजेंट स्टैक रिलीज़ रीडआउट: OpenClaw v2026.8.2, Qwen टीम ने एजेंट्स के लिए एक लोकल-फर्स्ट सर्च लेयर 'zg' को ओपन-सोर्स किया, OpenClaw 2.0 एजेंट हार्नेस को... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-110/

🎧 Listen to Episode

एपिसोड 110 — 03 सितंबर, 2026

[00:00] एपिसोड हुक

एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.8.2 दिन की अगुआई करता है: v2026.8.2 सतहों में ठोस बदलाव लाता है जिन पर बिल्डर्स रोज़ाना काम करते हैं, विवरण नीचे दिया गया है। आज के कार्यक्रम में यह भी शामिल है: Qwen टीम ने zg को ओपन-सोर्स किया, एजेंटों के लिए एक लोकल-फर्स्ट सर्च लेयर, OpenClaw 2.0 एक एजेंट हार्नेस को सजाता है लेकिन उपयोगकर्ताओं को सुरक्षा का बोझ उठाना पड़ता है, OpenAI का Astra परिप्रेक्ष्य ढांचे के तहत आंतरिक क्रिटिकल साइबर सुरक्षा बार को पार करता है, इसके अलावा मॉडल, टूलिंग और इन्फ्रास्ट्रक्चर में से दूसरी सारी खबरें। हर कहानी को वही व्यवहार मिलता है — क्या आया, उसके नीचे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।

[02:00] एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.8.2

OpenClaw v2026.8.2 1 सितंबर, 2026 को आया, और मुख्य बदलाव यह है कि एजेंट अब Linux पर अपना असली घर रखता है। x86-64 मशीनों पर बिल्डर्स .deb या AppImage इंस्टॉल कर सकते हैं, इसे स्थानीय या रिमोट Gateway से कनेक्ट कर सकते हैं, और सिस्टम ट्रे या X11 कीबोर्ड शॉर्टकट से सीधे क्विक चैट खोल सकते हैं। AppImage अपडेट सिग्नेचर-वेरिफाइड हैं, जबकि .deb इंस्टॉल आपके पैकेज मैनेजर के अंतर्गत रहते हैं।

Home एजेंट खुद अब आपके काम के बगल में डॉक कर सकता है। साइड या बॉटम डॉक में Home खोलने के लिए Cmd या Ctrl+Shift+H दबाएं, वह पेज दिखाई देता रहेगा जो आप पढ़ रहे हैं, एजेंट द्वारा जोड़े गए वर्क-कॉन्टेक्स्ट स्नैपशॉट को प्रीव्यू करें या हटाएं, या चुना हुआ टेक्स्ट सीधे अपने मैसेज में खींचें।

कई छोटे बदलाव दिन-प्रतिदिन के उपयोग को कम भंगुर बनाते हैं। बैकग्राउंड सेशन न्यू सेशन डायलॉग से चुनी हुई लोकल, क्लाउड या पेयर्ड-डिवाइस प्लेसमेंट के साथ शुरू किए जा सकते हैं, और पूर्णता सूचना से फिर से खोले जा सकते हैं। अपग्रेड रिकवरी नए कॉन्फ़िगरेशन को संरक्षित करती है, अधूरे सेशन माइग्रेशन को सफलता का दावा करने से पहले रोकती है, और इंस्टॉल्ड पैकेज या रोलबैक को सुरक्षित सिद्ध करने पर विफल अपडेट के बाद रुके हुए Gateway को पुनर्स्थापित करती है। रिप्लाइ अब अंतिम उत्तर लौटाने के लिए बसे हुए टूल वर्क का इंतज़ार करती हैं और स्वीकृत टर्न के बाद विफलताओं को सामने लाती हैं, जिससे वे बातचीत ठीक होती हैं जो पहले टूल आउटपुट या पहली स्वीकृति पर रुक जाती थीं। वॉइस आउटपुट आंतरिक रीज़निंग को स्पीच से बाहर रखता है और डिलीवरी के दौरान टूल-जेनरेटेड ऑडियो को सुरक्षित रखता है।

ब्राउज़र ऑटोमेशन भी ढीला हो गया। समर्थित macOS और Linux Chrome एक्सटेंशन बिल्ड अब पेयर्ड लोकल रिले को जगा सकते हैं एथेंटिकेटेड CDP क्लाइंट्स के लिए, ताकि Gateway को पहले से चलना न पड़े। रिलीज़ चार नए Control UI थीम्स — CRT, Manuscript, Rosé और Miami — के साथ समाप्त होती है जिनकी पसंद ऑफ़लाइन बनी रहती है और रीलोड पर गलत थीम फ्लैश किए बिना लागू होती है।

[02:46] Qwen टीम ने zg को ओपन-सोर्स किया, एजेंटों के लिए एक लोकल-फर्स्ट सर्च लेयर

2 सितंबर को, Qwen डेवलपर्स ने zg, या zvec-grep नामक एक छोटा लेकिन चुपचाप उपयोगी प्लंबिंग का टुकड़ा ओपन-सोर्स किया, Apache 2.0 के तहत रिलीज़ किया गया और सीधे लोकल-फर्स्ट समुदाय को लक्षित किया।

पिच सरल है। आज, एक एजेंट को कोडबेस में कुछ खोजने के लिए आमतौर पर ripgrep को सटीक टेक्स्ट के लिए, BM25 को कीवर्ड रैंकिंग के लिए, और फज़ी, मीनिंग-बेस्ड मैचों के लिए वेक्टर सर्च को एक साथ जोड़ना पड़ता है। zg तीनों को एक सिंगल इंटरफ़ेस के पीछे रैप करता है, ताकि एक एजेंट प्लेन-लैंग्वेज रिक्वेस्ट ले सके, इसे सही रिट्रीवल मोड पर रूट कर सके, और सटीक लाइन स्पैन के साथ वापस आ सके जहां जवाब है, न कि अस्पष्ट हिट लिस्ट के साथ।

तीन डिज़ाइन चॉइस इसे क्लाउड रैपर की जगह लोकल-AI टूल जैसा महसूस कराते हैं। पहला, एम्बेडिंग कैटलॉग डिवाइस पर रहता है, ताकि सेमांटिक इंडेक्स कभी आपकी मशीन न छोड़े। दूसरा, MCP-स्टाइल सरफेस जानबूझकर छोटा रखा गया है, जिसका मतलब है कि एजेंट को इसे उपयोग करने के लिए विस्तृत टूल मैनिफेस्ट की जरूरत नहीं है। तीसरा, और शायद सबसे महत्वपूर्ण, आपके लोकल कंटेंट और किसी भी रिमोट मॉडल के बीच स्पष्ट ऑथराइज़ेशन गेट बैठता है, यह तय करता है कि आपकी फाइलों के कौन से टुकड़े पढ़ने या भेजने की अनुमति है।

बिल्डर्स के लिए, व्यावहारिक प्रभाव यह है कि एक टूल कॉल grep, कीवर्ड और सेमांटिक लुकअप की चेन की जगह ले सकता है, और परिणाम अनुमान की जगह पठनीय साइटेशन के रूप में वापस आता है। ऑथराइज़ेशन लेयर वह हिस्सा है जिसे अध्ययन करना चाहिए अगर आप संवेदनशील लोकल कंटेंट को क्लाउड मॉडल में लीक होने से रोकना चाहते हैं और साथ ही एजेंट को अपनी फाइलों पर तर्क करने देना चाहते हैं।

अगला देखने वाली बात अपनाना है। zg ओपन सोर्स है और इंटरफ़ेस जानबूझकर न्यूनतम रखा गया है, इसलिए सवाल यह है कि क्या अन्य एजेंट फ्रेमवर्क और लोकल IDE इसे डिफ़ॉल्ट सर्च बैकएंड के रूप में जोड़ते हैं, या यह Qwen-साइड एक्सपेरिमेंट बना रहता है।

[04:37] OpenClaw 2.0 एजेंट हार्नेस को सजाता है लेकिन सिक्योरिटी का बैग यूज़र्स के पास छोड़ देता है

OpenClaw ने 31 अगस्त को अपने एजेंट हार्नेस का वर्शन 2.0 शिप किया, और अपग्रेड को फिक्स से ज्यादा ताज़ा कोटिंग के रूप में देखा जा रहा है। The Register की कवरेज रिलीज़ को धीमी-जलती सिक्योरिटी डंपस्टर फायर पर ग्लिटर डालने के रूप में फ्रेम करती है, और इस रूपक के पीछे का तत्व ठोस है: वर्शन 2.0 इंस्टॉलेशन को सुचारू करता है और मौजूदा इंटरफ़ेस को नई लेयर में रैप करता है, जबकि सिक्योरिटी की जिम्मेदारी जो भी इसे चलाता है उस पर छोड़ देता है।

यह तनाव बिल्डर्स को अपग्रेड करने से पहले समझना चाहिए। कम-घर्षण सेटअप और साफ़-सुथरा सरफेस हार्नेस के नीचे क्या करता है उसे नहीं बदलता, और गलत होने पर कौन जिम्मेदार है उसे भी नहीं बदलता। The Register का मानना है कि OpenClaw 2.0 ज्यादा लोगों के लिए एजेंट हार्नेस इंस्टॉल करना आसान बनाता है जिसकी सिक्योरिटी पोस्चर में कोई मायने रखने वाला बदलाव नहीं हुआ है, जो कम घटनाओं की जगह ज्यादा घटनाओं की रेसिपी है।

गंभीर वर्कफ़्लो में पहले से OpenClaw चलाने वाले किसी के लिए, व्यावहारिक सवाल यह नहीं है कि इंस्टॉल और दोस्ताना होगा। यह है कि क्या आपकी सिक्योरिटी पोस्चर के वे हिस्से जिन पर आप हार्नेस के सपोर्ट पर भरोसा करते हैं, वे अपग्रेड से पहले जैसे थे वैसे ही हैं या नहीं। चिकना ऑनबोर्डिंग फ़्लो एक असली प्रोडक्ट इम्प्रूवमेंट है, लेकिन यह सुरक्षित होने जैसा नहीं है, और अपग्रेड में ऐसे गार्डरेल जोड़ते नहीं लगता जो कैज़ुअल यूज़र को बिना सोचे संवेदनशील काम हार्नेस को सौंपने दें।

[06:07] OpenAI का Astra Preparedness Framework के तहत आंतरिक Critical साइबरसेक्योरिटी बार को क्लियर करता है

OpenAI का Astra मॉडल कंपनी के Preparedness Framework के तहत Critical साइबरसेक्योरिटी क्षमता थ्रेशोल्ड को पूरा करने वाला पहला है, जो कंपनी की आंतरिक प्रणाली है जो शिप करने से पहले किसी मॉडल को विशिष्ट जोखिम श्रेणियों में कितना खतरनाक हो सकता है, उसकी रेटिंग के लिए है। Critical टियर तक पहुंचने का मतलब है कि OpenAI के रिव्यूअर्स ने Astra की साइबर क्षमताओं को इतनी उच्च आंका कि मजबूत प्री-रिलीज़ सेवगार्ड ट्रिगर हों।

यह मायने रखता है क्योंकि Preparedness Framework OpenAI का एक संरचित तरीका है यह तय करने के लिए कि कोई मॉडल किसी जोखिम क्षेत्र में — जैसे साइबर सुरक्षा, CBRN, प्रेरणा, या स्वायत्तता — कितनी शक्तिशाली है कि व्यापक उपलब्धता से पहले अतिरिक्त सुरक्षा उपायों की आवश्यकता हो। साइबर सुरक्षा पर Critical हिट करना उस श्रेणी में सबसे ऊंचा स्तर है और OpenAI को व्यापक पहुंच से पहले कड़े संरक्षण लागू करने के लिए मजबूर करता है।

घोषणा विशिष्ट सुरक्षा उपायों का विवरण नहीं देती है, इसलिए बिल्डर्स और एंटरप्राइज़ ग्राहकों को फॉलो-अप पोस्ट के लिए देखना चाहिए जो बताते हैं कि व्यवहार में वे संरक्षण कैसे दिखते हैं, Astra तक पहुंच कैसे बदलती है, और क्या साइबर-प्रासंगिक वर्कलोड पर कोई परिनियोजन प्रतिबंध लागू होते हैं। पोस्ट के आसपास Hacker News पर 172 अंकों पर बैठी चर्चा सुझाव देती है कि डेवलपर समुदाय सक्रिय रूप से मूल्यांकन कर रहा है कि Critical वर्गीकरण वास्तव में डाउनस्ट्रीम उपयोग के लिए क्या मायने रखता है।

अभी के लिए, व्यावहारिक निष्कर्ष शासन है, क्षमता नहीं: OpenAI संकेत कर रहा है कि उसके अपने समीक्षकों का मानना है कि Astra ने एक सार्थक साइबर बार पार कर लिया है, और अगला ठोस कदम सुरक्षा उपायों और एक्सेस शर्तों को पढ़ना है जब वे प्रकाशित होंगे।

[07:30] Perplexity Mac पर Hybrid Compute लाता है: क्लाउड प्लान, लोकल एक्जीक्यूशन

Perplexity ने इस सप्ताह Mac पर Hybrid Compute लॉन्च किया, और फ्रेमिंग असामान्य है: उपयोगकर्ताओं से क्लाउड मॉडल और लोकल मॉडल के बीच चुनने के बजाय, कंपनी का Computer agent अब एक ही टास्क के भीतर दोनों का उपयोग करता है।

यहां इसका स्वरूप है। Perplexity के क्लाउड में चलने वाला एक फ्रंटियर मॉडल तर्क, योजना और ऑर्केस्ट्रेशन को संभालता है — वे कार्य के वे हिस्से हैं जहां स्केल और क्षमता सबसे अधिक मायने रखती है। उपयोगकर्ता के Mac पर स्थानीय रूप से चलने वाला एक मॉडल उन हिस्सों को संभालता है जो निजी संदर्भ को छूते हैं: डिस्क पर दस्तावेज़, स्थानीय फ़ाइलें, कुछ भी जिसे उपयोगकर्ता ने स्पष्ट रूप से अपलोड के लिए अधिकृत नहीं किया है। एक डिवाइस-साइड गेट तय करता है कि कौन से चरण स्थानीय मॉडल पर रूट किए जाते हैं, ताकि विशेषाधिकार प्राप्त सामग्री Mac पर रह सके।

Perplexity जो प्रेरणा रेखांकित करता है वह संरचनात्मक है। Agentic assistants उन कार्यों पर सबसे उपयोगी होते हैं जिनमें उपयोगकर्ता का अपना संदर्भ शामिल होता है — डील दस्तावेज़, विशेषाधिकार प्राप्त फ़ाइलें, क्लाइंट रिकॉर्ड्स — लेकिन वही संदर्भ है जिसे उपयोगकर्ता उचित रूप से रिमोट एंडपॉइंट पर भेजने से मना करते हैं। Hybrid Compute उस ट्रेड-ऑफ को भंग करने के लिए बनाया गया है।

बिल्डर्स और ज्ञान कर्मियों के लिए, व्यावहारिक निहितार्थ यह है कि निजी सामग्री पर वर्कफ़्लो अब भारी तर्क क्लाउड में रख सकते हैं जबकि फ़ाइल-टचिंग डिवाइस पर होती है। एक बात देखने योग्य है कि रूटिंग कितनी पारदर्शी साबित होती है — क्या उपयोगकर्ता, प्रति टास्क, देख सकते हैं कि कौन से चरण स्थानीय रूप से चले और कौन से क्लाउड में, और गेट अस्पष्ट सामग्री को कैसे संभालता है जैसे दस्तावेज़ जो सार्वजनिक और निजी जानकारी को मिलाता है।

[09:06] Pipecat का PhoneLLM एक Nemotron MoE बैकबोन पर ओपन-वेट वॉइस-एजेंट मॉडल के रूप में ट्रेंड कर रहा है

एक नया ओपन-वेट मॉडल Hugging Face की ट्रेंडिंग सूची पर चढ़ रहा है। PhoneLLM, pipecat-ai द्वारा प्रकाशित, 24 अगस्त को इसके ड्रॉप के बाद से लगभग 11,500 डाउनलोड और 200 लाइक्स पार कर चुका है, और यह इसलिए आगे बढ़ रहा है क्योंकि यह पहले टेक्स्ट-जेनरेशन मॉडल में से एक है जो स्पष्ट रूप से वॉइस-एजेंट और फ़ोन वर्कलोड के लिए टैग किया गया है।

आर्किटेक्चर टैग कहानी बताते हैं। PhoneLLM Nvidia के Nemotron परिवार पर बनाया गया है, विशेष रूप से nemotron_h वेरिएंट, और यह mixture-of-experts डिज़ाइन का उपयोग करता है, जिसका अर्थ है कि प्रति टोकन केवल पैरामीटर का एक स्लाइस सक्रिय होता है, जो कम प्रति-क्वेरी कंप्यूट के लिए बड़ी कुल पैरामीटर गणना का व्यापार करता है। मॉडल स्टैंडर्ड transformers और safetensors फॉर्मेट में आता है, इसलिए यह उन स्थानीय-इंफरेंस टूलचेन में सीधे आ जाता है जो बिल्डर्स पहले से ही सामान्य-उद्देश्य वाले ओपन-वेट LLM के लिए चला रहे हैं।

जो चीज़ इसे सिर्फ एक और Nemotron रीब्रांड से अलग बनाती है वह एप्लिकेशन फोकस है। फोन एजेंटों को छोटे, संरचित रिस्पॉन्स, तंग लेटेंसी बजट और interruption, transfers और slot-filling का विश्वसनीय हैंडलिंग चाहिए - समस्याएं जिन्हें सामान्य-उद्देश्य वाली चैट मॉडल केवल भारी प्रॉम्प्टिंग के साथ हल करती हैं। उस सतह क्षेत्र के लिए ट्यून किया गया मॉडल पूरी तरह से स्थानीय वॉयस-एजेंट स्टैक के लिए लापता मध्य परत है, जो speech-to-text और text-to-speech के बीच बैठता है बिना भाषा मस्तिष्क के लिए hosted API का भुगतान किए।

बिल्डर्स के लिए, व्यावहारिक प्रभाव यह है कि STT से LLM से TTS पाइपलाइन में LLM स्लॉट के पास अब एक वॉयस-एजेंट-स्पेशलाइज्ड ओपन विकल्प है, न कि लंबे सिस्टम प्रॉम्प्ट वाला सामान्य चैट मॉडल। आगे देखने योग्य: क्या Pipecat एक quantized वेरिएंट के साथ आगे बढ़ता है, क्योंकि अधिकांश स्थानीय-AI अपनाने से तब तेज़ी से बढ़ती है जब एक छोटा, अधिक सुलभ checkpoint आता है।

[10:38] NBA 2K27 Brings NVIDIA DLSS 5 Neural Rendering to GeForce NOW

NBA 2K27 Nvidia के सितंबर GeForce NOW ड्रॉप का हेडलाइनर है, और यह एक ऐसी सुविधा के साथ आता है जो पहले किसी लाइव स्पोर्ट्स टाइटल में नहीं दिखी: 3D-guided neural rendering के साथ DLSS 5. Nvidia ने इस सुविधा को Visual Concepts और 2K के साथ घनिष्ठ सहयोग में बनाया, जिसे विशेष रूप से बास्केटबॉल कोर्ट के लिए ट्यून किया। नतीजा वह जीवन-जैसी लाइटिंग और मैटेरियल डिटेल का स्तर है जो पारंपरिक रेंडरिंग पाइपलाइन वास्तविक समय में मिलाना मुश्किल बनाती हैं।

GeForce NOW इस महीने कुल 28 गेम जोड़ता है, लेकिन DLSS 5 की शुरुआत ही इस ड्रॉप को मायने रखती है। 3D-guided neural rendering का मतलब है कि लाइटिंग और सतह का व्यवहार एक तंत्रिका नेटवर्क के माध्यम से अनुमानित होता है, प्रति मैटेरियल हाथ से ट्यून किए जाने के बजाय, जिससे गेम बिना पारंपरिक पाइपलाइन के प्रति-फ्रेम खर्च के जीवन-जैसी डिटेल दे सकता है। बास्केटबॉल सिम जैसी तेज़-गति वाली टाइटल के लिए, यह ट्रेड-ऑफ पूरा गेम है।

व्यावहारिक परिणाम: GeForce NOW के माध्यम से स्ट्रीम करने वाला कोई भी व्यक्ति NBA 2K27 में DLSS 5 आज़मा सकता है बिना स्थानीय RTX हार्डवेयर के स्वामित्व के, जो एक सार्थक बदलाव है। अब तक, neural rendering डेमो आमतौर पर डेस्कटॉप GPU मानते थे। क्लाउड डिलीवरी दर्शकों को पूरी तरह बदल देती है।

आगे देखना यह है कि अन्य 27 सितंबर टाइटल में से कितने DLSS 5 अपनाते हैं, और क्या Visual Concepts का ट्यूनिंग कार्य दूसरी स्पोर्ट्स स्टूडियो के लिए संदर्भ टेम्पलेट बनता है। फिलहाल, कोर्ट ही शोकेस है।

[12:01] A 90-Minute Transformer Training Run Beats Many LLMs on ARC-1

वीकेंड पर एक सिंगल ब्लॉग पोस्ट ने इस सीज़न की सबसे तेज़ AI चर्चाओं में से एक को आकर्षित किया। "I trained a small transformer in 1.5hrs and it beats many LLMs" शीर्षक के तहत, mvakde द्वारा लिखा गया यह लेख एक छोटे प्रशिक्षण रन के बारे में बताता है जिसने ARC-1 विज़ुअल रीज़निंग पहेलियों पर बड़े भाषा मॉडल से बेहतर प्रदर्शन किया।

यह पोस्ट, जो mvakde.github.io पर होस्ट की गई है, प्रकाशन के तुरंत बाद 660 के Hacker News स्कोर तक पहुंच गई, जिसके साथ Lobsters पर एक समानांतर थ्रेड भी था। मूल विचार सरल है: एक छोटा ट्रांसफॉर्मर, जिसे नब्बे मिनट की ट्रेनिंग दी गई, ARC-1 ग्रिड पहेलियों को इतनी अच्छी तरह से संभालता है कि यह कई LLMs को हरा देता है जिनमें क्रमों से अधिक पैरामीटर हैं।

ARC-1 एक मॉडल से कुछ उदाहरण ग्रिड ट्रांसफॉर्मेशन देखने, नियम का अनुमान लगाने और इसे एक नए ग्रिड पर लागू करने के लिए कहता है, एक ऐसा कार्य जो ऐतिहासिक रूप से केवल स्केल पर आधारित दृष्टिकोणों के लिए कठिन रहा है। यहां प्रतिस्पर्धा करने वाला एक मॉडल बनाने वाला एक संक्षिप्त ट्रेनिंग रन यह सुझाव देता है कि सही आर्किटेक्चर और ट्रेनिंग रेसिपी reasoning-भारी कार्यों पर केवल पैरामीटर गिनती के लिए विकल्प हो सकती है, कम से कम एक संकीर्ण डोमेन में।

बिल्डर्स के लिए, यह एक अनुस्मारक है कि उद्देश्य-निर्मित आर्किटेक्चर पर केंद्रित, छोटे, सस्ते ट्रेनिंग चक्र एक frontier API को कॉल करने का एक विश्वसनीय विकल्प बने हुए हैं। अगला देखने वाली बात यह है कि क्या परिणाम प्रतिकृति से बचता है और क्या रेसिपी अन्य विज़ुअल रीज़निंग बेंचमार्क में सामान्यीकृत होती है।

[13:19] Grok 4.6 एक स्वतंत्र जीव विज्ञान-सुरक्षा परीक्षण में शीर्ष पर

स्वतंत्र जैव-सुरक्षा मूल्यांकनकर्ता LatchBio ने इस सप्ताह परिणाम प्रकाशित किए जो दर्शाते हैं कि Grok 4.6 एकमात्र frontier मॉडल है जो एक साथ दो बार साफ करता है: छिपे हुए खतरनाक जीव विज्ञान कार्यों को विश्वसनीय रूप से अस्वीकार करते हुए सामान्य शोध पूरा करना। LatchBio के BioSecBench-Refusal सुइट पर, जो सामान्य विज्ञान की तरह दिखने वाली फाइलों के अंदर छिपे 46 red-team कार्यों को सार्वभौमिक प्रकाशित साहित्य से drawn सामान्य जैविक कार्यों के साथ मिलाता है, Grok 4.6 ने विभिन्न एजेंट हार्नेस में शीर्ष तीन स्थान रखे और औसतन 62.1% हासिल किया। स्कोर refusal दर और कार्य अनुपालन का परीक्षण-भारित हार्मोनिक मीन है। अकेले, Grok 4.6 ने 59.2% red-team प्रश्नों को अस्वीकार किया और 64.8% सामान्य प्रश्न पूरे किए।

जो इसे कठिन बनाता है वह परीक्षण डिज़ाइन है। Red-team कार्य अपने खतरे को गलत लेबल वाली फाइलों, संलग्न वैज्ञानिक डेटा, या जानबूझकर अस्पष्टता में छिपाते हैं, न कि pathogen या toxin जैसे स्पष्ट ट्रिगर शब्दों का उपयोग करके। एक मॉडल जो केवल कीवर्ड से पैटर्न मिलाता है, वह या तो बहुत अधिक वैध कार्य को ब्लॉक करेगा या खतरनाक प्रॉम्प्ट छूट जाएंगे। LatchBio के मूल्यांकन ट्रेस दर्शाते हैं कि Grok 4.6 निर्णय लेने से पहले कार्य और उसके वातावरण की सामग्री पर reasoning करता है, बताए गए इरादे और डेटा में वास्तव में क्या है के बीच बेमेल को पहचानता है, और केवल तब refuse करता है जब इरादा उच्च-जोखिम प्रतीत होता है।

BioSecBench-Surveillance पर, जो सार्वजनिक स्वास्थ्य निगरानी में उपयोग की जाने वाली pathogen genomic निगरानी वर्कफ़्लो का परीक्षण करता है, Grok 4.6 का औसत 53.5% था, Opus 5 से पीछे लेकिन GPT-5.6 Sol को हराकर। xAI परिणाम को refusal और biosecurity कार्य पर Grok 4.5 और 4.3 पर सामग्री क्षमता छलांग के रूप में फ्रेम करता है, और परतदार सुरक्षा उपायों का वर्णन करता है: इरादा अनुमान पर refusal training, inference-time फ़िल्टर जो हानिकारक अनुरोधों को मॉडल तक पहुंचने से पहले ब्लॉक करते हैं, व्यवहारिक नियंत्रण, और post-deployment सत्र-स्तरीय निगरानी। LatchBio ने तुलना को ईमानदार रखने के लिए एजेंटों को उनके उच्चतम प्रयास स्तरों पर चलाया।

[15:00] कानूनी फर्म Gilbert + Tobin OpenAI के साथ AI को कैसे शासित करती है और स्केल करती है

कानूनी फर्म Gilbert + Tobin ने अपने पूरे अभ्यास में ChatGPT Enterprise और Codex को रोल आउट किया है, तीन स्तंभों पर आधारित: CEO-led AI के प्रति प्रतिबद्धता, औपचारिक शासन नियम, और मानव जवाबदेही परत। OpenAI ने 1 सितंबर को फर्म के दृष्टिकोण को ग्राहक कहानी के रूप में प्रस्तुत किया, rollout को central नियमों द्वारा हल किया गया स्केलिंग समस्या के रूप में फ्रेम करते हुए, team-by-team अपनाने के बजाय। तंत्र एक कानूनी या नीति सीमा है, API परिवर्तन नहीं। स्रोत तथ्य परिभाषित करते हैं कि क्या प्रस्तावित, तय या बताया गया था बिना उसे सार्वभौमिक कानून बनाए। बिल्डर्स को ठोस नियम, निर्णय, या पहुंच परिवर्तन को ट्रैक करना चाहिए और केवल एक शीर्षक के आधार पर उत्पाद नहीं बदलना चाहिए।

[15:41] शीर्ष AI ओपन सोर्स प्रोजेक्ट समुदाय PR को एजेंट फैक्ट्री के लिए स्वैप करते हैं

वर्सेल की AI SDK, Astro, Flue, और tldraw AI टूलिंग के लिए ओपन सोर्स के काम करने के तरीके को शांतिपूर्वक बदल रहे हैं। समुदाय की पुल रिक्वेस्ट को छानने के बजाय, ये प्रोजेक्ट फिक्स और फीचर्स को उस चीज़ के माध्यम से भेज रहे हैं जिसे Latent Space "सॉफ्टवेयर फैक्ट्री" कहता है—AI एजेंटों के समन्वित टीम जो यांत्रिक काम को संभालती हैं।

Latent Space का शीर्षक इस बदलाव को सीधे पकड़ता है: "PRs not welcome." इनमें से प्रत्येक प्रोजेक्ट हज़ारों कंट्रीब्यूटर्स से निपट रहा है, और पारंपरिक समीक्षा प्रक्रिया अब स्केल नहीं होती। फैक्ट्री दृष्टिकोण सामान्य ओपन-सोर्स समझौते को पलट देता है। मेनटेनर के हर ड्राइव-बाय PR को हाथ से मूल्यांकित करने के बजाय, एजेंट टीमें खुद पैच लागू करती हैं और केवल सार्थक निर्णय ही मनुष्यों के सामने लाती हैं।

बिल्डर्स के लिए, व्यावहारिक निष्कर्ष सरल है। यदि आप इनमें से किसी एक repo में एक छोटा फिक्स भेजने की योजना बना रहे हैं, तो बहुत लंबे समीक्षा मार्ग की उम्मीद करें—या बिल्कुल भी नहीं। कंट्रीब्यूशन सतह मानवीय पुल रिक्वेस्ट से उस पाइपलाइन में बदल रही है जो प्रत्येक प्रोजेक्ट अपने एजेंटों के चारों ओर सेट अप करता है।

ध्यान देने योग्य बात यह है कि अन्य तेज़-गति वाले AI प्रोजेक्ट यह पैटर्न कॉपी करते हैं या नहीं। एक बार जब कुछ हाई-प्रोफाइल repo एजेंट-संचालित मेंटेनेंस को सामान्य बना लेते हैं, तो हर हॉट AI लाइब्रेरी के लिए अपेक्षाएं इसके साथ ही बदल सकती हैं।

[16:53] मेटा की Muse Voice Transcribe तीन वॉइस जॉब्स को एक रियल-टाइम मॉडल में समेकित करती है

मेटा सुपरइंटेलिजेंस लैब्स ने इस सप्ताह Muse Voice Transcribe जारी किया, और मुख्य बात संरचनात्मक है: यह तीन कार्यों को एक एकल ऑटोरेग्रेसिव मॉडल में समेकित करती है जो प्रोडक्शन वॉइस स्टैक आमतौर पर अलग रखते हैं।

एक विशिष्ट रियल-टाइम वॉइस पाइपलाइन में, एक सिस्टम ऑडियो को ट्रांसक्राइब करता है, दूसरा तय करता है कि कौन बोल रहा है (डायराइज़ेशन), और तीसरा डिटेक्टर यह पता लगाता है कि उपयोगकर्ता ने वास्तव में अपना वाक्य कब समाप्त किया है ताकि एजेंट जवाब दे सके। उन मॉड्यूल के बीच प्रत्येक हैंडऑफ विलंबता और एक और विफलता मोड जोड़ता है। एंडपॉइंटिंग मॉडल, उदाहरण के लिए, यह तय कर सकता है कि स्पीकर तैयार है जब वे वास्तव में तैयार नहीं हैं, जो एजेंट के जवाब देने से ठीक पहले एक वाक्य को आधा काट देता है।

Muse Voice Transcribe तीनों कार्यों को एक स्ट्रीमिंग मॉडल के रूप में चलाती है। मेटा इसे ऑटोरेग्रेसिव बताता है, जिसका अर्थ है कि यह एक अनुक्रम में अगले तत्व की भविष्यवाणी करता है, लेकिन यह ट्रांसक्रिप्शन, स्पीकर लेबल और वाक्य-समाप्ति संकेतों को एक साथ प्रसारित करता है, अलग-अलग इंजनों के बीच ऑडियो पास करने के बजाय।

बिल्डर्स के लिए, यही व्यावहारिक बदलाव है। एक वॉइस एजेंट जिसे पहले तीन मॉडल एक साथ जोड़ने, प्लस हैंडऑफ प्रबंधित करने के लिए एक ऑर्केस्ट्रेशन लेयर की जरूरत थी, अब एक इंफेरेंस कॉल पर चल सकता है। यह स्टैक को सरल बनाता है और राउंड-ट्रिप विलंबता को ट्रिम कर सकता है जो संवादी एजेंटों को सुस्त बनाती है।

एक चीज ध्यान देने योग्य है कि एकीकृत मॉडल अव्यवस्थित बातचीत को कैसे संभालता है। ओवरलैपिंग स्पीकर, तेज़ बारी-बदलाव, और आंशिक शब्द वे जगहें हैं जहां मल्टी-मॉडल पाइपलाइन अक्सर विफल होती हैं, और कार्यों को समेकित करने से वे विफलता मोड एक जगह पर केंद्रित हो जाते हैं, विभिन्न चरणों में फैलने के बजाय।

यह Meta की इस सप्ताह की खबर है: एक मॉडल, तीन वॉइस जॉब्स, कम हाँडऑफ़।

[18:28] Gradium का नया Default TTS 216 ms पर Hard Sentences पर 81% हिट करता है

Gradium AI ने एक नया default text-to-speech मॉडल लॉन्च किया है जो उस speed-versus-accuracy tradeoff को संबोधित करता है जो voice product teams को परेशान करता है। अपने स्वयं के मूल्यांकन में, मॉडल ने पाँच भाषाओं को कवर करने वाले 500-वाक्यों की hard-case सेट पर 81.0% human-rated pass rate हासिल किया, जबकि इसका P50 time-to-first-audio Coval पर 216 milliseconds पर दर्ज हुआ।

TTS में Hard cases वे वाक्य हैं जो नियमित रूप से मॉडल को परेशान करते हैं: संख्याएँ, संक्षेप, कोड-स्विच, जीभ तोड़ने वाले वाक्य, और असामान्य नाम।

पाँच-भाषा के hard सेट पर 80% से अधिक pass rate, sub-quarter-second latency के साथ मिलकर, मॉडल को किसी भी उत्पाद के लिए दौड़ में रखता है जहाँ delayed या mangled audio deal-breaker है, in-car assistants से लेकर phone-based customer support तक।

क्योंकि Gradium ने Hugging Face पर CC BY 4.0 के तहत 500-वाक्यों का evaluation सेट रिलीज़ किया है, कोई भी team अपने current provider और नए मॉडल के विरुद्ध apples-to-apples comparison के लिए same prompts को फिर से चला सकता है। Open test prompts, एक public latency number, और default-model rollout का संयोजन, specialized paid tier के बजाय, यह संकेत देता है कि कंपनी इसे baseline experience के रूप में position कर रही है, premium add-on के रूप में नहीं।

अगली बात जो देखने योग्य है वह यह है कि slower mobile networks पर 216 ms number कायम रहता है या नहीं, और शेष 19% पर failure cases वास्तव में कैसे दिखते हैं, क्योंकि यह residual वह जगह है जहाँ real product risk रहती है।

[19:49] ATV Tour ने ChatGPT के साथ Production को दिनों से घंटों तक कम किया

ATV Big Air Tour, एक कंपनी जो all-terrain vehicle events चलाती है, ने ChatGPT Work का उपयोग common business tasks को काफी हद तक compress करने के लिए किया। OpenAI द्वारा 2 सितंबर को प्रकाशित case study के अनुसार, कंपनी ने काम को जो पहले तीन दिन लगता था घटाकर तीन घंटे कर दिया। General marketing और merchandising improvements से परे, team ने merchandise photos को लगभग 15 मिनट में एक functioning inventory website में बदल दिया। OpenAI ने इसे ChatGPT Work की विशेषता के उदाहरण के रूप में प्रस्तुत किया है कि यह time-intensive workflows को व्यावहारिक business settings में कैसे compress कर सकता है।

यहाँ described efficiency gains इस कंपनी के specific use case पर आधारित हैं, और source यह नहीं बताता कि rapid website generation के लिए कौन से features responsible थे या results की तुलना alternative approaches से कैसे हुई। E-commerce tools, catalog systems, या event merchandise pipelines बनाने वाली teams के लिए, यह photo-to-product-site workflows का एक proof point दर्शाता है, हालांकि individual results asset complexity और workflow fit पर depend करेंगे।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily