TobyOnFitnessTech
एजेंटस्टैक डेली: एजेंट स्टैक रिलीज़ रीडआउट: हर्मेस एजेंट v2026.7.30 — Episode 96 cover art
Episode 96·4 अगस्त 2026·45:09

एजेंटस्टैक डेली: एजेंट स्टैक रिलीज़ रीडआउट: हर्मेस एजेंट v2026.7.30

एजेंट स्टैक रिलीज़ रीडआउट: हर्मेस एजेंट v2026.7.30, जेमिनी रोबोटिक्स 2 रोबोट्स को पूर्ण-शरीर बुद्धिमत्ता देता है, गिटहब मॉडल रिटायर्ड: प्लेग्राउंड, API, और... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-96/

🎧 Listen to Episode

एपिसोड 096 — 31 जुलाई, 2026

[00:00] एपिसोड हुक

एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.7.30 आज का नेतृत्व करता है: v2026.7.30 बिल्डर्स के रोजमर्रा के सतहों में ठोस बदलाव लाता है, विवरण नीचे। आज की लाइनअप में भी शामिल है: Gemini Robotics 2 रोबोट में पूर्ण-शरीर बुद्धिमत्ता लाता है, GitHub Models रिटायर्ड: प्लेग्राउंड, API, और BYOK गया, Moonshot का Kimi K3 एक क्वांटाइज्ड लोकल-AI ड्रॉप के रूप में आया, साथ ही मॉडल, टूलिंग, और इन्फ्रास्ट्रक्चर में एक घनी न्यूज साइकल का बाकी हिस्सा। हर कहानी को वही इलाज मिलता है — क्या शिप हुआ, उसके नीचे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।

[02:00] एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.7.30

इस चक्र में एक स्थिर रिलीज उतरा, जो बताता है कि एजेंटिक हार्नेस अभी कैसे असेंबल हो रहे हैं। Hermes Agent v2026.7.30: रिलीज तिथि: 30 जुलाई, 2026 > पैच रिलीज। यह टैग v0.19.0 से मर्ज किए गए ~1,000+ PRs को डाउनस्ट्रीम उपभोक्ताओं के लिए (Docker इमेज, होस्टेड डिप्लॉयमेंट, फ्रेश इंस्टॉल) एक स्थिर टैग्ड रिलीज में रोल अप करता है। (v0.19.0, 20 जुलाई) के बाद से: मेन पर ~2,789 कमिट्स · ~4,748 फाइलें बदलीं · ~442,000 इंसर्शन · ~392,300 डिलीशन। यह विंडो गेटवे, वॉइस सबसिस्टम, डेस्कटॉप ऐप, और इंस्टॉलर में बग-फिक्स और साल्वेज वेव्स से भरी है, साथ ही निरंतर प्लेटफॉर्म काम (Buzz/Nostr चैनल, FLUX3 वीडियो जेनरेशन और डिलीवरी, टेलीग्राम मीडिया रिलायबिलिटी, वॉइस-मोड रिग्रेशन)। इस विंडो के लिए पूर्ण क्यूरेटेड रिलीज नोट्स v0.20.0 के साथ शिप होंगे, जो v0.19.0 से आगे सब कुछ डॉक्यूमेंट करेगा — हाइलाइट्स, फीचर एरिया, और पूर्ण कंट्रीब्यूटर क्रेडिट्स। इस विंडो में कुछ भी स्किप नहीं किया गया। hermes update curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash फुल चेंजलॉग: ..v2026.7.30 API और रनटाइम लेयर पर ये बदलाव बिल्डर्स के लिए डिफ़ॉल्ट रूप से कॉन्फ़िगर और भरोसा करने की चीजें बदलते हैं; किसी भी प्रोडक्शन एजेंट वर्कफ्लो के लिए सवाल यह है कि क्या नए डिफ़ॉल्ट इस सप्ताह जो पथ आप चला रहे थे उसको बेहतर बनाते हैं या तोड़ते हैं। प्रत्येक हार्नेस के लिए पूर्ण रिलीज नोट्स — डिप्लॉयमेंट गाइडेंस, मर्ज किए गए पुल रिक्वेस्ट्स की लिस्ट, और कंट्रीब्यूटर क्रेडिट्स सहित — प्राइमरी सोर्स से लिंक हैं, और प्रत्येक टैग का चेंजलॉग कॉन्टेक्स्ट वह है जिसके विरुद्ध बिल्डर्स को अपने वर्तमान पिन्ड वर्जन को diff करना चाहिए प्रोडक्शन में डिफ़ॉल्ट फ्लिप करने से पहले। Hermes Agent v2026.7.30, प्रकाशित 2026-07-30, एक स्थिर टैग है: इसे एक मूविंग चैनल ट्रैक करने के बजाय स्पष्ट रूप से पिन करें, नए बिल्ड के विरुद्ध एक प्रतिनिधि एजेंट सेशन रीप्ले करें, और नए डिफ़ॉल्ट को प्रमोट करने से पहले वर्तमान में चल रहे वर्जन के साथ टूल-कॉल लेटेंसी, रीकनेक्ट बिहेवियर, और अप्रूवल हैंडलिंग की तुलना करें।

[02:42] Gemini Robotics 2 रोबोट में पूर्ण-शरीर बुद्धिमत्ता लाता है

DeepMind ने 30 जुलाई को Gemini Robotics 2 प्रकाशित किया, इस काम को रोबोट में 'पूर्ण-शरीर बुद्धिमत्ता' लाने के रूप में फ्रेम करते हुए। मुख्य दावा यह है कि एक सिस्टम अब पूरे रोबोट बॉडी में परसेप्शन, प्लानिंग, और टूल यूज को संभाल सकता है, बजाय हथियारों, ग्रिपर्स, और बेस मूवमेंट को अलग-अलग समस्याओं के रूप में देखने के। रिलीज वास्तव में दो मॉडल हैं: Gemini Robotics 2 और एक साथी जिसका नाम Gemini Robotics ER 2 है। ब्लॉग के अनुसार, ER 2 वैरिएंट रीजनिंग, कोलैबोरेशन, और वास्तविक दुनिया के कार्यों को हल करने के लिए बनाया गया है। DeepMind ने तीन ठोस क्षेत्रों को फ्लैग किया जहां नए मॉडल पहले के काम से आगे निकल जाते हैं। पहला, वीडियो समझ: मॉडल लंबे डेमोस्ट्रेशन देख सकते हैं और जो स्टेप्स मायने रखते हैं उन्हें चुन सकते हैं। दूसरा, टूल ऑर्केस्ट्रेशन: रोबोट केवल अपने हथियार हिलाने के अलावा, यह तय कर सकता है कि किसी अलग इंप्लीमेंट को लाया जाए या किसी अलग एजेंट को कॉल किया जाए। तीसरा, मल्टी-रोबोट कोलैबोरेशन: कई रोबोट एक जॉब को बांट सकते हैं बिना किसी इंसान के प्रत्येक हैंडऑफ को कोरियोग्राफ करने के। DeepMind की पोस्ट काम को टेबलटॉप पिक-एंड-प्लेस के बजाय वास्तविक दुनिया के कार्यों के इर्दगिर्द फ्रेम करती है। Hacker News थ्रेड एक दिन में 561 स्कोर पर पहुंच गया, जो रोबोटिक्स टॉपिक के लिए असामान्य रूप से उच्च है और सुझाव देता है कि बिल्डर कम्युनिटी सोचती है कि इस बार काम असली चीजें कर रहा है।

[03:56] GitHub Models रिटायर्ड: प्लेग्राउंड, API, और BYOK गया

GitHub Models रिटायर्ड हो गया है। 30 जुलाई, 2026 से, प्लेग्राउंड, मॉडल कैटलॉग, इन्फरेंस API, और ब्रिंग-योर-ओन-की ऑप्शन किसी भी कस्टमर के लिए अब उपलब्ध नहीं है।

डेवलपर्स के लिए, व्यावहारिक प्रभाव सीधा है। अगर आपने GitHub Models का इस्तेमाल ब्राउज़र में अलग-अलग मॉडल आज़माने के त्वरित तरीके के रूप में किया, तो वह एंट्री पॉइंट चला गया। अगर आपने अपने कोड से GitHub Models इन्फरेंस एंडपॉइंट को कॉल किया, तो वह एंडपॉइंट चला गया। अगर आपने बाहरी प्रोवाइडर कीज़ को BYOK फ्लो के माध्यम से सेट अप किया ताकि आप एक GitHub-साइड सरफेस से OpenAI, Anthropic, या अन्य को रिक्वेस्ट्स रूट कर सकें, तो वह हैंड-ऑफ भी चला गया।

सेवा समाप्ति पूर्ण है न कि आंशिक। GitHub कोई एक हिस्सा बंद नहीं कर रहा जबकि बाकी चलता रहे; प्लेग्राउंड, कैटलॉग, इंफरेंस और BYOK सब एक साथ गायब हो जाते हैं। जिन ग्राहकों ने GitHub Models को बाहरी प्रदाताओं पर एक पतली सुविधा परत के रूप में माना, उन्हें अब सीधे उन प्रदाताओं से बात करनी होगी।

अगला उचित कदम है किसी भी सक्रिय उपयोग को माइग्रेट करना। प्रत्यक्ष प्रदाता SDK और API कुंजियाँ इंफरेंस और BYOK पथों की जगह ले लेती हैं। मॉडल ब्राउज़िंग प्रत्येक प्रदाता के अपने कैटलॉग या तृतीय-पक्ष डायरेक्टरी में चली जाती है। OpenAI प्लेग्राउंड, Anthropic Console, या वेंडर-विशिष्ट चैट UI जैसे प्रोटोटाइपिंग सतहें प्लेग्राउंड के उपयोग मामले को पूरा करती हैं।

एक बात ध्यान देने योग्य है: चेंजलॉग पोस्ट अपने ग्राहक-दायरे खंड को अधूरा छोड़ देती है, इसलिए यह स्पष्ट नहीं है कि पेड-टियर या एंटरप्राइज़ ग्राहकों को कोई निरंतरता मार्ग या पुरानी सुविधाएं मिलती हैं या नहीं। यदि आपने प्रोडक्शन वर्कफ़्लो के लिए GitHub Models पर निर्भरता की थी, तो जांचें कि क्या आपके मौजूदा प्रदाता संबंध आपको बिना पुनर्स्थापत्य के कॉल्स जारी रखने की अनुमति देते हैं।

[05:32] Moonshot का Kimi K3 एक क्वांटाइज़्ड लोकल-AI ड्रॉप के रूप में आता है

Moonshot AI का एक नया Kimi K3 मॉडल इस सप्ताह Hugging Face पर ट्रेंड कर रहा है, और यह लोकल-AI समुदाय है जो इसे ले रहा है। Unsloth ने 27 जुलाई को Moonshot के Kimi K3 का GGUF संस्करण प्रकाशित किया, और कुछ ही दिनों में इसके 36,000 डाउनलोड और 218 लाइक्स हो गए।

यह ड्रॉप इसलिए उल्लेखनीय है क्योंकि इसमें दो चीजों का संयोजन है: यह मल्टीमॉडल है — एक साथ चित्र और टेक्स्ट दोनों स्वीकार करता है और जवाब में टेक्स्ट तैयार करता है — और यह GGUF के रूप में वितरित किया गया है, वह फ़ाइल प्रारूप जिसे Ollama, llama.cpp, और LM Studio जैसे टूल कंज्यूमर हार्डवेयर पर क्वांटाइज़्ड वेट लोड करने के लिए उपयोग करते हैं। तो यह क्लाउड API नहीं है; यह कुछ ऐसा है जिसे आप डाउनलोड करके लैपटॉप या होम GPU रिग पर स्थानीय रूप से चला सकते हैं।

ओपन-वेट स्पेस में यह संयोजन अपेक्षाकृत दुर्लभ रहा है। अधिकांश लोकल-फ्रेंडली मॉडल अभी भी टेक्स्ट-ओनली हैं, इसलिए Moonshot जैसी बड़ी लैब से क्वांटाइज़्ड मल्टीमॉडल रिलीज़ बिल्डर्स को ऑफ़लाइन वर्कफ़्लो में नई चीज़ें शामिल करने को देता है। चैट में स्क्रीनशॉट डालना, स्कैन किए गए दस्तावेज़ों को पार्स करना, या डेटा को तृतीय-पक्ष सर्वर पर भेजे बिना विज़न-क्षमता वाला असिस्टेंट चलाना सब अधिक व्यावहारिक हो जाता है।

मॉडल Hugging Face हब पर image-text-to-text के रूप में सूचीबद्ध है, जिसमें टैग्स transformers आर्किटेक्चर, GGUF पैकेजिंग, और कन्वर्सेशनल ट्यूनिंग की पुष्टि करते हैं। यह Moonshot के Kimi K3 का बेस-मॉडल क्वांटाइज़ेशन है, जिसे "other" के रूप में टैग किए गए लाइसेंस के तहत वितरित किया गया है — इसलिए कोई भी जो इस पर व्यावसायिक रूप से निर्माण करने की योजना बना रहा है, उसे पहले नियम देखने चाहिए।

जो लोग पहले से लोकल स्टैक चला रहे हैं, उनके लिए यह कदम सीधा है: Ollama या llama.cpp को unsloth/Kimi-K3-GGUF रेपो पर इंगित करें और देखें कि यह इमेज इनपुट को कैसे संभालता है। डाउनलोड नंबर बताते हैं कि इस सप्ताह बहुत से अन्य लोग यही कर रहे हैं।

[07:13] आलसी GPU आपको खर्च कर रहे हैं — फ्लीट मैनेजमेंट पर एक नई नज़र

Hugging Face ब्लॉग पर 30 जुलाई को Dharma-AI द्वारा प्रकाशित एक नई पोस्ट एक विमानन रूपक का उपयोग करती है ताकि बजट तर्क बनाया जा सके: एक खाली GPU एक जमीन पर खड़े विमान जैसी है — एक ऐसी संपत्ति जो घटती है चाहे वह उड़े या रनवे पर बैठी रहे।

यह फ्रेमिंग मायने रखती है क्योंकि AI टीमें खरीदी गई कच्ची कंप्यूट पर बजट बनाती हैं, वास्तव में उपभोग की गई कंप्यूट पर नहीं। पोस्ट का मुख्य दावा यह है कि खाली समय चुपचाप कई त्वरकों को चलाने वाले संगठनों के लिए प्रमुख लागत बन गया है, क्योंकि GPU काम के बावजूद प्रति घंटा घटते हैं।

बिल्डर्स के लिए, निष्कर्ष यांत्रिक से अवधारणात्मक अधिक है। उपलब्ध सामग्री विशिष्ट शेड्यूलिंग सिस्टम, पुनर्ग्रहण नीतियों, या उपयोग बेंचमार्क का दस्तावेजीकरण नहीं करती, इसलिए उपयोगी साक्ष्य स्वयं फ्रेमिंग है: त्वरक क्षमता को प्रबंधित फ्लीट के रूप में मानें, उपयोग को मापें, और ऐसे कार्य डिज़ाइन करें जो अंतराल भरें, न कि हार्डवेयर को अनिश्चित काल तक आरक्षित करें।

आगे क्या देखना है: क्या Dharma-AI उपकरण या केस स्टडी के साथ फॉलो-अप करता है जो खाली-लागत तर्क पर संख्या रखता है।

[08:16] Jetson 'क्लच' एक्सेसरी के रूप में: Sarah Guo Edge AI को रेखांकित करती हैं

NVIDIA ने इस सप्ताह अपने Jetson edge-AI प्लेटफॉर्म पर एक प्रमोशनल स्पॉटलाइट लगाया, और कंपनी ने यह करने के लिए एक फैशन रूपक का सहारा लिया। 28 जुलाई को NVIDIA ब्लॉग पर "Powerful Compute So Compact, It's Clutch — Build AI Anywhere With NVIDIA Jetson" शीर्षक के तहत प्रकाशित पोस्ट में निवेशक Sarah Guo को एक छोटे वीडियो में दिखाया गया है जहाँ उन्होंने कॉम्पैक्ट डेवलपर किट को "क्लच" के रूप में प्रस्तुत किया — एक छोटा, स्टाइलिश एक्सेसरी जो आपकी हथेली में फिट होता है और फिर भी ध्यान आकर्षित करता है।

Guo Conviction की रन करती हैं, एक AI-नेटिव वेंचर कैपिटल फर्म, और No Priors पॉडकास्ट की सह-होस्ट हैं। वीडियो में, वह जोर देती हैं कि Jetson edge AI बिल्ड्स के लिए प्लेटफॉर्म के रूप में कैसे काम करता है।

बिल्डर्स के लिए, अंतर्निहित विचार सीधा है: "edge" का मतलब है कि मॉडल खुद डिवाइस पर चलता है न कि रिमोट सर्वर को पिंग करता है। यही एक रोबोट, कैमरा, ड्रोन, या हैंडहेल्ड गैजेट को स्थानीय रूप से इंफरेंस संभालने देता है। यहां फ्रेमिंग कच्चे बेंचमार्क नंबरों के बारे में कम और इस बारे में अधिक है कि Guo जैसी निवेशक-ऑपरेटर edge AI के बारे में कैसे बात करती हैं जब वह दूसरे फाउंडर्स को यह समझाने की कोशिश कर रही हों कि यह एक रिसर्च डेमो नहीं, एक असली डिप्लॉयमेंट टारगेट है।

पोस्ट में तकनीकी विवरण कम है — कोई नया SKU नहीं, कोई SDK रिलीज नहीं, कोई प्राइसिंग नहीं, कोई चेंजलॉग नहीं। दिलचस्प चीज मैसेंजर है: एक वेंचर कैपिटलिस्ट जो AI-नेटिव कंपनियों को बैक करती है, NVIDIA के अपने मार्केटिंग में एक विशिष्ट हार्डवेयर प्लेटफॉर्म को एंडॉर्स करती है। यह इस बात का संकेत है कि कैपिटल edge AI को आगे कहां ले जाना चाहता है, और अगर आप भविष्य के बिल्ड के लिए क्लाउड API बनाम ऑन-डिवाइस इंफरेंस पर विचार कर रहे हैं तो यह एक त्वरित वॉच के लायक है।

[09:55] OpenAI Europe के लिए अपनी Responsible AI प्लेबुक की रूपरेखा देता है

31 जुलाई को, OpenAI ने 'यूरोप भर में जिम्मेदार AI को आगे बढ़ाना' शीर्षक से एक लेख प्रकाशित किया, जिसमें बताया गया है कि महाद्वीप में जिम्मेदार AI शासन को कैसे समर्थन प्रदान किया जाता है। इस पोस्ट में कार्य को चार क्षेत्रों में वर्गीकृत किया गया है: सुरक्षा, सुरक्षा (security), पारदर्शिता, और उत्पत्ति। OpenAI का कहना है कि ये प्रयास EU AI Act के साथ-साथ चलते रहेंगे क्योंकि कानून अपने कार्यान्वयन चरणों से गुजर रहा है।

निर्माताओं के लिए व्यावहारिक संकेत यह है कि उत्पत्ति, जिसका अर्थ है AI-जनित छवियों और टेक्स्ट को चिह्नित करने वाला मेटाडेटा, और पारदर्शिता प्रकटीकरण तेजी से यूरोपीय बेसलाइन का हिस्सा बन रहे हैं। OpenAI अपनी मौजूदा प्रथाओं को उस अनुपालन के लिए मचान के रूप में प्रस्तुत कर रहा है, न कि इस पोस्ट में यूरोप के लिए विशिष्ट नई प्रतिबद्धताएं पेश कर रहा है। यह लेख कार्य को AI Act के रोलआउट को ट्रैक करने वाले एक निरंतर कार्यक्रम के रूप में प्रस्तुत करता है।

EU AI Act समय के साथ चरणबद्ध तरीके से लागू किया जा रहा है, जिसमें विभिन्न दायित्व विभिन्न समय-सारणी पर लागू होते हैं। OpenAI की पोस्ट इन दायित्वों के लागू होने पर अपनी सुरक्षा और सुरक्षा प्रकटीकरणों को उनसे संरेखित रखने में निरंतर निवेश का संकेत देती है। यह पारदर्शिता और उत्पत्ति को उन क्षेत्रों के रूप में भी इंगित करता है जहां यूरोपीय उपयोगकर्ता AI-जनित सामग्री की पहचान और लेबलिंग में अधिक दृश्यता देखने की उम्मीद कर सकते हैं।

आगे देखने के लिए: जैसे-जैसे AI Act के उच्च-जोखिम प्रावधान लागू होंगे, यूरोपीय बाजार में तैनात किसी भी सिस्टम के लिए उत्पत्ति, मॉडल दस्तावेज़ीकरण, और सुरक्षा प्रकटीकरण के आसपास अधिक ठोस दस्तावेज़ीकरण आवश्यकताओं की उम्मीद करें।

[11:18] शोध डाइजेस्ट: PhiZero वर्ल्ड की गति का अनुमान लगाने के लिए एक 'फिजिकल लैंग्वेज' बनाता है

PhiZero एक नया शोध मॉडल है जो भौतिक भाषा सीखकर भविष्य में दुनिया कैसे व्यवहार करेगी, इसका अनुमान लगाता है - यह कच्चे वीडियो पिक्सेल का अनुमान लगाने के बजाय स्थिति परिवर्तनों का एक संक्षिप्त असतत शब्दावली है। मौजूदा वर्ल्ड मॉडल भविष्य के फ्रेम को सीधे रेंडर करने की ओर झुकते हैं, जो अंतर्निहित भौतिकी को एक उच्च-आयामी विज़ुअल प्रेडिक्टर के अंदर दबा देता है। PhiZero के लेखकों का तर्क है कि मनुष्य कुछ अलग करते हैं: हम अवलोकन करते हैं, गति के नियमों को अमूर्त करते हैं, और उन नियमों को भाषा-जैसी प्रतिनिधित्वों में संग्रहीत करते हैं जिन पर हम तर्क कर सकते हैं। PhiZero वाइल्ड वीडियो अनुभव से भौतिक टोकन सीखकर और फिर वर्ल्ड स्थितियों को आगे बढ़ाने के लिए उन टोकन का उपयोग करके उस ट्रिक को दोहराने की कोशिश करता है। व्यावहारिक उम्मीद यह है कि एक ऐसा मॉडल जो वीडियो जनरेटर की तुलना में एक व्यक्ति की तरह परिणामों की योजना बनाए और तर्क करे। यह एक शोध प्रीप्रिंट है, उत्पाद नहीं, इसलिए मुख्य बात यह विचार है: भौतिकी के लिए असतत टोकन वर्ल्ड मॉडल के लिए पिक्सेल की तुलना में अधिक उपयोगी सब्सट्रेट हो सकते हैं।

[12:13] शोध डाइजेस्ट: Frontis-MA1: AI बनाने की प्रक्रिया को बेहतर बनाने के लिए AI को प्रशिक्षित करना

एक टीम यह परीक्षण कर रही है कि क्या AI AI बनाने की प्रक्रिया में सार्थक रूप से सुधार कर सकती है — और सैंडबॉक्स प्रकाशित कर रही है ताकि कोई भी देख सके। पेपर Frontis-MA1 पेश करता है, एक 35-अरब-पैरामीटर मॉडल जिसे मशीन लर्निंग इंजीनियरिंग के लिए मेटा-एवोल्यूशन एजेंट के रूप में पोस्ट-ट्रेंड किया गया है। शोधकर्ताओं ने OpenMLE बनाया, एक ओपन स्टैक जो ML इंजीनियरिंग को निष्पादन फीडबैक के साथ एक मापनीय खेल में बदल देता है।

OpenMLE के तीन स्तर हैं। OpenMLE-Gym सत्यापन योग्य कार्य वातावरण चलाता है जहां प्रस्तावित परिवर्तन वास्तव में निष्पादित होते हैं। OpenMLE-RL ऑपरेटर लर्निंग संभालता है — मॉडल को संपादन और खोजों को कैसे निर्देशित करना है, यह सिखाता है। OpenMLE-Evo दीर्घ-क्षितिज खोज चलाता है ताकि सुधार एकत्रित हो सकें। Frontis-MA1 शीर्ष पर बैठता है, ML इंजीनियरिंग परिवर्तनों का प्रस्ताव करता है और देखता है कि कौन से वास्तव में काम करते हैं।

हेडलाइन यह नहीं है कि AI ने खुद को बेहतर बनाया है — यह है कि पुनरावर्ती स्व-सुधार के पास अब एक ठोस, खुला टेस्टबेड है। अधिकांश पिछला कार्य सैद्धांतिक रहा या बंद डेमो के पीछे रहा; यहां जिम, ट्रेनिंग लूप और सर्च हार्नेस सभी सार्वजनिक हैं, इसलिए अन्य प्रयोगशालाएं समान सेटअप को दोहरा या विस्तारित कर सकती हैं। पेपर HuggingFace की दैनिक फीड पर ट्रेंड कर रहा है।

[13:15] DeltaNet Attention Variants का फैमिली-ट्री टूर

Doubleword ने एक ब्लॉग वॉकथ्रू प्रकाशित किया जो DeltaNet परिवार के लीनियर attention variants को ट्रेस करता है और तर्क देता है, जैसा कि इसके शीर्षक में कहा गया है, कि Kimi Delta Attention एक प्राकृतिक विस्तार है जो एक सावधान पाठक स्वयं पहुंच सकते थे। पोस्ट 28 जुलाई, 2026 को Hacker News पर प्रकाशित हुई, 297 पॉइंट की चर्चा को आकर्षित किया जो सक्रिय बनी हुई है, और Lobsters के AI टैग पर भी दिखाई दी।

पोस्ट इस क्षेत्र को स्वतंत्र ट्रिक्स के ढेर के बजाय एक फैमिली ट्री के रूप में प्रस्तुत करती है। इसका केंद्रीय दावा यह है कि हाल के attention variants कम विचित्र दिखते हैं एक बार जब आप उनके पूर्ववर्तियों को क्रम में लगाते हैं, और यह कि वंशावली का अनुसरण करना भविष्य में अगला कहां जाने की भविष्यवाणी करने के लिए पर्याप्त है।

अभी क्यों मायने रखती है: फ्रंटियर मॉडल घोषणाएं attention mechanisms के साथ जारी रहती हैं जो पहले पास में विश्वास की छलांग की तरह पढ़ती हैं, और इंजीनियरों के लिए व्यावहारिक takeaway यह है कि वंशावली किसी एक पेपर से अधिक मायने रखती है। पहले फैमिली ट्री पढ़ना हर नए variant के उतरने के तरीके को बदल देता है।

builders के लिए जो वास्तव में समझना चाहते हैं कि Kimi जैसे मॉडलों के अंदर क्या चल रहा है, पोस्ट एक उपयोगी on-ramp है। यह एक शोध परियोजना नहीं, एक weekend read है, और इसके साथ Hacker News और Lobsters थ्रेड्स संदर्भ भरती हैं।

[14:31] Copilot Code Review के Agent Skills और MCP Support GA में आए

GitHub ने Copilot code review के agent skills और MCP server support को 29 जुलाई को general availability में ले जाया। दोनों क्षमताएं अब सभी Copilot Pro, Pro+, Business, और Enterprise users के लिए खुली हैं, public preview से बाहर आ चुकी हैं।

Changelog post विवरण में कम है। MCP — Model Context Protocol — AI assistants को बाहरी टूल्स और डेटा स्रोतों से जोड़ने का मानक तरीका है। पोस्ट इस संदर्भ में "agent skills" का अर्थ परिभाषित नहीं करती और न ही बंडल किए गए कौन से skills हैं यह सूचीबद्ध करती है। यह विशिष्ट MCP integrations, व्यवहार परिवर्तन, या builders को preview से क्या अलग उम्मीद करनी चाहिए यह भी नहीं बताती।

सूचीबद्ध paid tiers पर builders के लिए, बदलाव यह है कि ये features preview के बजाय production-ready हैं। Free-tier Copilot इस rollout में उल्लेखित नहीं है। ईमानदार अगला-देखना यह है कि teams वास्तव में एक बार उपलब्ध होने पर इन्हें कैसे configure करती हैं, लेकिन घोषणा खुद इतनी पतली है कि कोई भी rollout की योजना बना रहा होगा उसे changelog पर निर्भर रहने के बजाय GitHub docs में जाना होगा।

[15:33] MCP का 28-07-2026 Spec Stateless हो गया, Sudden Removals का वादा नहीं करता

मॉडल कॉन्टेक्स्ट प्रोटोकॉल (Model Context Protocol), जो AI असिस्टेंट्स को बाहरी टूल्स और डेटा सोर्सेज से कनेक्ट करने देता है, को 30 जुलाई को एक स्पेसिफिकेशन अपडेट मिला। मुख्य बदलाव: ट्रांसपोर्ट लेयर stateless हो रही है, मतलब सर्वर को अब क्लाइंट रिक्वेस्ट्स के बीच सेशन स्टेट रखने की जरूरत नहीं है। इसके साथ ही, प्रोजेक्ट ने एक नई पॉलिसी अपनाई है जो बिना चेतावनी के फीचर्स को हटाने से रोकती है।

सादे शब्दों में, stateless का मतलब है कि हर रिक्वेस्ट अपने आप में पूर्ण है, न कि सर्वर पर किसी याद किए गए सेशन पर निर्भर। MCP सर्वर चलाने वाले बिल्डर्स के लिए, यह डिज़ाइन को सरल, अधिक प्रेडिक्टेबल कनेक्शन्स की ओर ले जाता है — और यही जरूरी है, यह उन फेलियर मोड्स की एक पूरी कैटेगरी को हटा देता है जो ड्रॉप्ड या खोए हुए सेशन स्टेट से आते हैं।

डेप्रिकेशन पॉलिसी रिलीज़ का अधिक शांत हिस्सा है लेकिन अपना वजन रखती है। अब प्रोटोकॉल फीचर्स हटाने से पहले एक डॉक्यूमेंटेड डेप्रिकेशन साइकल से गुजरेंगे, जिससे सर्वर और क्लाइंट ऑथर्स को माइग्रेट करने का समय मिले। यह वही तरह की प्रेडिक्टेबिलिटी प्रॉमिस है जिसने वेब स्टैंडर्ड्स को स्थिर होने में मदद की, और यह आज MCP इंटीग्रेशन में निवेश करने वाले किसी भी व्यक्ति की वास्तविक चिंता का सीधा जवाब देती है।

अपडेट 30 जुलाई को MCP ब्लॉग पर प्रकाशित हुआ और Hacker News पर जल्दी ध्यान खींचा, जहां इसने 127 का स्कोर हासिल किया।

[16:52] avatarin ने GPT-Realtime के साथ 24/7 रिटेल वॉइस एजेंट लॉन्च की

avatarin ने OpenAI के GPT-Realtime को Yamada Denki, एक जापानी इलेक्ट्रॉनिक्स रिटेलर पर शॉपर्स के लिए 24/7 मल्टीलिंगुअल वॉइस एजेंट के रूप में काम पर लगाया है। ग्राहक अपनी भाषा में सवाल पूछ सकते हैं, और असिस्टेंट रियल टाइम में जवाब देता है।

पहले दो हफ्तों में शानदार आंकड़े आए: 30,000 लोगों ने एजेंट का इस्तेमाल किया, और 92% सर्वे रिस्पॉन्स पॉजिटिव आए। एक व्यस्त रिटेल एनवायरनमेंट में कंज्यूमर स्केल पर डिप्लॉय की गई वॉइस असिस्टेंट के लिए, यह एक सार्थक अर्ली सिग्नल है कि रियल-टाइम वॉइस मॉडल वास्तविक ट्रैफिक में काम कर सकते हैं।

GPT-Realtime OpenAI का स्पीच-टू-स्पीच मॉडल है, मतलब ऑडियो अंदर जाता है और बीच में अलग टेक्स्ट ट्रांसक्रिप्शन के बिना ऑडियो बाहर आता है। यह डायरेक्ट वॉइस पाथ फ्लुइड बैक-एंड-फॉर्थ कन्वर्सेशन को संभव बनाती है, और यही वही क्षमताएं हैं जिन्हें avatarin ने अब हाई-वॉल्यूम रिटेल वर्कलोड के लिए इस्तेमाल किया है।

बिल्डर्स के लिए, यह कहानी एक कंक्रीट डेटा पॉइंट है न कि फीचर अनाउंसमेंट। एक वॉइस एजेंट जो 30,000 लाइव शॉपर इंटरैक्शन्स सurvived और बहुत बड़े पैमाने पर पॉजिटिव फीडबैक के साथ, यह डेमो-वेयर से ज्यादा प्रोडक्शन-रेडी है। मल्टीलिंगुअल कवरेज और चौबीसों घंटे उपलब्धता रिटेल डिप्लॉयमेंट के लिए स्पष्ट डिफरेंशिएटर्स हैं, और दोनों काम करते नजर आ रहे हैं।

एक बात जिस पर नजर रखनी चाहिए: क्या avatarin और Yamada Denki एजेंट का स्कोप प्रोडक्ट सवालों से आगे रिटर्न्स, शिकायतों, या अपसेल्स तक बढ़ाते हैं, जहां बातचीत कठिन हो जाती है और संतुष्टि के आंकड़े बनाए रखना मुश्किल होगा।

[18:17] Google DeepMind ने संपूर्ण शरीर नियंत्रण, कौशल और मल्टी रोबोट सहयोग के लिए तीन भौतिक AI मॉडल शिप किए

Google DeepMind ने Gemini Robotics 2 जारी किया है, जो अपने अगली पीढ़ी के रोबोट के लिए बुद्धिमत्ता परत है। इस रिलीज में तीन मॉडल शामिल हैं: पूर्ण शरीर मानवरोबोट नियंत्रण के लिए एक विज़न-भाषा-क्रिया मॉडल, एम्बॉडिड रीज़निंग और टास्क ऑर्केस्ट्रेशन के लिए Gemini Robotics ER 2, और एक ऑन-डिवाइस VLA जो घंटों में नए रोबोट बॉडीज़ के अनुकूल हो जाता है। एक चेकपॉइंट Apptronik Apollo 2 और एक Franka Duo को चलाता है। केवल ER 2 सार्वजनिक रूप से उपलब्ध है। पोस्ट Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration पहली बार MarkTechPost पर दिखाई दी। प्राथमिक स्रोत उपरोक्त विशिष्ट उत्पाद या वर्कफ़्लो परिवर्तन का समर्थन करता है; यह प्रदर्शन, संगतता, या परिनियोजन के बारे में व्यापक दावों का समर्थन नहीं करता। इस पर निर्भर होने से पहले, वास्तविक वर्कफ़्लो के खिलाफ़ स्रोत परिवर्तन का परीक्षण करें।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily