
Codex Desktop का WebMCP अपग्रेड और Grok Bot का 24/7 क्लाउड कंप्यूटर
Codex desktop ने WebMCP, Messages, Linux और multi-repo review को रोल आउट किया। साथ ही, xAI का Grok Bot एजेंट्स को 24/7 स्थायी cloud computer प्रदान करता है। Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-107/
🎧 Listen to Episodeएपिसोड 107 — 27 अगस्त, 2026
[00:00] एपिसोड हुक
Hermes Agent v2026.8.27 27 अगस्त को जारी किया गया, जिसमें लगभग 525 मर्ज किए गए पुल रिक्वेस्ट को एक ही रिलीज में समेकित किया गया जो Docker इमेज, होस्टेड डिप्लॉयमेंट और नए इंस्टॉल पर लागू होता है, और 19 अगस्त की v2026.8.19 बेसलाइन को बदल देता है। उपयोगकर्ता-दृश्य परिवर्धन में पुनर्डिज़ाइन किया गया एजेंट टास्क पेन, संरचित प्लान डिफ़, विस्तारित टूल-कॉल स्ट्रीमिंग, एक बैकग्राउंड शेड्यूलर जो पुनः कनेक्शन के दौरान लंबे समय चलने वाले जॉब्स को जीवित रखता है, और एक नया फाइलसिस्टम सैंडबॉक्स मोड शामिल है जो प्रोजेक्ट-वार अलाउलिस्ट के पीछे राइट्स को गेट करता है। अंडर द हुड यह रिलीज रनटाइम के लिए सुरक्षा फिक्स, मॉडल राउटर के लिए रिफ्रेश्ड डिफॉल्ट्स, लेगसी CLI फ्लैग्स के डेप्रिकेशन, और प्लगइन मैनिफेस्ट में ब्रेकिंग चेंजेस लेकर आता है जिसे डाउनस्ट्रीम इंटीग्रेटर्स को अपग्रेड करने से पहले पैच करना होगा। Docker इमेज एक ही वर्जन पर पिन करती हैं, होस्टेड टेनेंट सप्ताह के अंत तक तरंगों में रोल आउट हो रहे हैं, और सेल्फ-होस्टेड ऑपरेटर्स को नए प्लगइन मैनिफेस्ट स्कीमा को पिक अप करने के लिए इंस्टॉल स्क्रिप्ट को फिर से चलाना होगा।
[02:00] एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.8.27, v2026.8.19
Hermes Agent ने 27 अगस्त को v2026.8.27 जारी किया, जिसमें लगभग 525 मर्ज किए गए पुल रिक्वेस्ट को Docker इमेज, होस्टेड डिप्लॉयमेंट और नए इंस्टॉल के लिए एक सिंगल स्टेबल टैग में रोल अप किया। सबसे दिखने योग्य परिवर्तन यह है कि डेस्कटॉप ब्राउज़र अब अपनी खुद की OS विंडो में खुलता है, एक मैनेज्ड SSH रिमोट-अपडेट इंजन और फ्लीट प्रोफाइल रेल के साथ जोड़ा गया। ब्राउजिंग सेशन अब चैट पैनल के अंदर नहीं रहते — उन्हें अपनी खुद की विंडो मिलती है जिसे आप अलग से डॉक या बंद कर सकते हैं — और रिमोट अपडेट गेटवे को मिड-टास्क में मारने के बजाय कंट्रोल सॉकेट पर पॉज़ करते हैं।
लोकल ब्राउजिंग ने एक consent-gated पाथ हासिल किया जो आपकी डिफॉल्ट Chromium प्रोफाइल का उपयोग करता है, Windows close-with-approval फ्लो के साथ, ताकि जिन साइट्स को आपकी लॉग्ड-इन ब्राउज़र सेशन की जरूरत होती है वे बिना re-authentication के काम करें। रिमोट MCP कैटलॉग 50 से अधिक लाइव-वेरिफाइड वेंडर-होस्टेड सर्वर तक बढ़ गई, जिसमें Cloudflare, Grafana Cloud, Better Stack, और Railway शामिल हैं। MCP मॉडल कॉन्टेक्स्ट प्रोटोकॉल है, जो AI एजेंट बाहरी टूल्स और डेटा से बात करने के लिए उपयोग करते हैं, इसलिए एक सिंगल Hermes इंस्टॉल अब एक लोकल ब्रिज के बिना उन सर्विसेज तक पहुंच सकता है।
वेब सर्च और एक्सट्रैक्शन ने TTL परिणाम कैशिंग पिक अप की, और tool_search अब stemming के साथ मल्टी-क्वेरी लुकअप चलाता है ताकि "runs" और "running" जैसे शब्द वेरिएंट एक ही टूल पर मैप हों। Mac यूजर्स के लिए, स्टोर्ड सीक्रेट्स के लिए opt-in OS-keychain एन्क्रिप्शन प्रति-लॉन्च macOS Keychain प्रॉम्प्ट्स को हटाता है। Lean-tail कम्प्रेशन डिफॉल्ट पर फ्लिप हो गया, जवाब की बातबात को ट्रिम करता है बिना उपयोगी सामग्री खोए।
अन्य शिप्ड परिवर्तन: इमेज और पैकेज-मैनेज्ड इंस्टॉल अब unsafe in-place अपडेट्स को रिफ्यूज करते हैं, Slack लिंक-अन्फर्ल कंट्रोल्स शिप हुए, Docker कंटेनर्स आइडेंटिटीज शेयर करते हैं, प्लगेबल टर्मिनल एनवायरनमेंट बैकएंड्स आए, और मॉडल पिकर्स में GLM-5.3-Flash, MiniMax M3 फ्री, और MiniMax H3 Max वीडियो जुड़ गए। पिछला टैग, 21 अगस्त को v2026.8.19, ने keyless वेब टियर पेश किया — पांच-वेंडर फ्री रोटेशन रिंग फेलओवर के साथ ताकि नए इंस्टॉल बिना किसी API कीज़ कॉन्फ़िगर किए वेब सर्च कर सकें — प्लस फज़्ज़ी मॉडल पिकर और Ctrl+P कमांड पैलेट के साथ CLI पॉलिश वेव। v0.20.0 से आगे के क्यूरेटेड नोट्स v0.21.0 के साथ आएंगे।
[03:19] Codex डेस्कटॉप ऐप WebMCP, Messages, Linux, और मल्टी-रेपो रिव्यू जोड़ता है
जुलाई के अंत और अगस्त के अंत के बीच OpenAI के Codex डेस्कटॉप ऐप में अपडेट का एक स्टैक्ड महीना था, जिसमें बदलाव बिल्ट-इन ब्राउज़र, macOS, Linux, और मल्टी-रेपो प्रोजेक्ट्स को कैसे रिव्यू किया जाता है, को छूते हैं।
30 जुलाई को, डेस्कटॉप संस्करण 26.727 में पता बार इतिहास और बिल्ट-इन ब्राउज़र के अंदर Google खोज, ChatGPT के लिए वैकल्पिक ब्राउज़िंग-हिस्ट्री एक्सेस, Chrome टैब और चयनित-टेक्स्ट मेंशन, YouTube प्रश्न, और राइट-क्लिक Ask ChatGPT जोड़ा गया। मल्टी-फोल्डर प्रोजेक्ट्स को रिपॉजिटरी में diffs के लिए एक संयुक्त रिव्यू व्यू मिला, और जेनरेट की गई इमेज में टिप्पणी और परिशोधन के लिए Focused और Canvas व्यू जुड़े। उसी बिल्ड में Activity व्यू जोड़ा गया और लंबे पैकेज पाथ के लिए Windows इंस्टॉलेशन विश्वसनीयता में सुधार किया गया।
11 अगस्त को, OpenAI ने Ubuntu, Debian, और Fedora पर x64 और ARM64 के माध्यम से .deb और .rpm पैकेज द्वारा Linux डेस्कटॉप प्रीव्यू शिप किया। डेस्कटॉप ऐप Claude Code, Claude Cowork, और Cursor से निर्देश, सेटिंग्स, स्किल्स, प्लगइन, प्रोजेक्ट, और हालिया कार्य भी इम्पोर्ट कर सकता है, इम्पोर्ट किए गए कार्य के लिए वैकल्पिक ऑटो-अपडेट के साथ।
20 अगस्त को, macOS ऐप में Apple Messages प्लगइन जोड़ा गया जो सभी प्लान पर उपलब्ध है, ChatGPT Work या Codex से उपयोग योग्य, भेजने से पहले अनुमति आवश्यक। उसी अपडेट में हर Codex प्लान पर स्थानीय Codex थ्रेड्स के रीड-ओनली शेयर्ड स्नैपशॉट, समान-वर्कस्पेस साइट को-एडिटिंग और URL परिवर्तन, डेस्कटॉप और iOS पर यूनिफाइड पिन्ड थ्रेड्स, और यूरोप में व्यापक Computer History उपलब्धता पेश की गई। OpenAI चेतावनी देता है कि शेयर्ड स्नैपशॉट पर सीक्रेट-पैटर्न रीडक्टर हर संवेदनशील विवरण को स्ट्रिप नहीं कर सकता।
25 अगस्त को, ब्राउज़र एक्सटेंशन Chrome से Edge, Brave, Opera, और Vivaldi तक विस्तारित हुआ, पांचों पर टैब मेंशन और ब्राउज़र कंट्रोल के साथ, हालांकि Opera में साइड चैट नहीं है। बिल्ट-इन डेस्कटॉप ब्राउज़र में ChatGPT Work और Codex के लिए WebMCP के माध्यम से वेबसाइट-प्रोवाइडेड Site Tools भी मिले। उस फीचर के लिए नवीनतम डेस्कटॉप ऐप और GPT-5.6 Sol या Terra सब्सक्रिप्शन आवश्यक है और यह Luna, Enterprise, या Edu पर उपलब्ध नहीं है।
[05:11] Grok Bot एजेंट्स को एक निरंतर क्लाउड कंप्यूटर और 24/7 कार्य देता है
Grok Bot xAI का अलग एजेंट प्रोडक्ट है, Grok चैट के अंदर का मोड नहीं। यह 11 अगस्त को प्रारंभिक बीटा में लॉन्च हुआ और 26 अगस्त को फिर से एक्सेस विस्तारित किया गया। उपयोगकर्ता कई Bots बनाते हैं, उन्हें सहकर्मियों की तरह संदेश भेजते हैं, उन्हें शेयर्ड थ्रेड्स में ड्रॉप करते हैं, और एक Bot को दूसरे Bot को काम सौंपने देते हैं।
मुख्य आर्किटेक्चर चॉइस यह है कि उपयोगकर्ता द्वारा बनाया गया हर Bot एक निरंतर क्लाउड कंप्यूटर शेयर करता है, फाइल्स, ब्राउज़र स्टेट, और लॉगिन्स सहित। आइसोलेशन प्रति Bot के बजाय प्रति उपयोगकर्ता है। यह एक सेल्स Bot को लॉग्ड-इन ब्राउज़र में खातों पर शोध करने, परिणाम एक ऑपरेशंस Bot को सौंपने देता है जो Gmail से इनवॉइस प्रोसेस करता है, और लैपटॉप बंद होने पर भी जारी रह सकता है। Bots उन वेबसाइट्स में साइन इन कर सकते हैं जिनमें APIs या MCP सर्वर नहीं हैं, और xAI कहता है कि वे एक बार किसी उपयोगकर्ता को वर्कफ़्लो पूरा करते हुए देख सकते हैं, इसे रूटीन के रूप में सेव कर सकते हैं, सुधार स्वीकार कर सकते हैं, और ड्रॉप किए गए थ्रेड्स पर फॉलो अप कर सकते हैं।
डाउनलोड क्लाइंट्स में Apple silicon और Intel पर macOS, x64 पर Windows 10 और 11, और iPhone और iPad शामिल हैं। प्रोडक्ट पेज पर Android Grok Bot क्लाइंट सूचीबद्ध नहीं है।
एक्सेस SuperGrok, SuperGrok Plus, और SuperGrok Heavy सब्सक्रिप्शन के साथ शामिल है, सबसे कम इंडिविजुअल टियर $30 प्रति माह पर। वही प्रोडक्ट Cursor Pro, Pro+, और Ultra प्लान के साथ $20 प्रति माह से शुरू, और Cursor Teams Standard और Premium के साथ भी बंडल है। Grok Bot उपयोग का बिलिंग स्टैंडर्ड Grok या Cursor उपयोग से अलग है। एंटरप्राइज एक्सेस अभी भी वेटलिस्ट-ओनली है।
xAI द्वारा सूचीबद्ध सुरक्षा और नियंत्रण फीचर्स में ट्रांज़िट और रेस्ट पर एन्क्रिप्शन, ट्रेनिंग ऑप्ट-आउट, संवेदनशील कार्यों के लिए Auto Review, और DLP, सर्टिफिकेट, प्रॉक्सी, और नेटवर्क नियंत्रण के लिए एंटरप्राइज नियंत्रण शामिल हैं।
[06:52] अलीबाबा ने Qwen3.8-Flash-Next के माध्यम से Qwen4 का प्रीव्यू दिया
अलीबाबा की Qwen टीम ने Qwen3.8-Flash-Next जारी किया है, एक 125-बिलियन-पैरामीटर मल्टीमॉडल मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल जो आगामी Qwen4 आर्किटेक्चर का प्रीव्यू प्रस्तुत करता है। हेडलाइन कुल 180 बिलियन पैरामीटर है, तीन हिस्सों में बांटा गया: एक 125B बैकबोन, एक 51B N-ग्राम एम्बेडिंग टेबल, और एक 4B मल्टी-टोकन प्रेडिक्शन मॉड्यूल। प्रति टोकन केवल 6 बिलियन पैरामीटर सक्रिय होते हैं, जहां दक्षता की कहानी रहती है।
चार आर्किटेक्चरल शिफ्ट प्रीव्यू को परिभाषित करते हैं। एक हाइब्रिड लेयर सीक्वेंस मॉडलिंग के लिए Gated DeltaNet को Qwen Sparse Attention के साथ जोड़ती है। Gated Residual कनेक्शन नेटवर्क में ग्रेडिएंट्स के प्रवाह को पुनर्आकार देते हैं। N-ग्राम एम्बेडिंग टेबल मॉडल को स्पष्ट शॉर्ट-रेंज पैटर्न मेमोरी देती है, और Muon ऑप्टिमाइज़र मानक ट्रेनिंग स्टेप को बदलता है। साथ मिलकर ये बदलाव मॉडल की समग्र पहुंच को कम किए बिना सक्रिय कंप्यूट को कम करते हैं।
टीम रिपोर्ट करती है कि प्रशिक्षण लागत Qwen3.7-Plus की लगभग एक-नौवीं है, एक तेज गिरावट जिसकी व्याख्या नए ऑप्टिमाइज़र और हाइब्रिड अटेंशन मदद करती है। सेल्फ-होस्टर्स के लिए, FP8 चेकपॉइंट 172.78 GiB पर है, जो उपभोक्ता हार्डवेयर पर वास्तविक बाधाएं डालता है और गंभीर परिनियोजनों को डेटा-सेंटर GPU की ओर धकेलता है।
बिल्डर्स के लिए इसका मतलब: प्रीव्यू मल्टीमॉडल टीमों को Qwen4 की दिशा का शीघ्र अनुमान देता है, विशेषकर हाइब्रिड अटेंशन एप्रोच और N-ग्राम एम्बेडिंग टेबल। 172.78 GiB FP8 फुटप्रिंट स्टोरेज और मेमोरी के लिए एक स्पष्ट प्लानिंग फ्लोर सेट करता है। जब तक पूर्ण Qwen4 उपलब्ध नहीं होता, बेंचमार्क प्रदर्शन को निश्चयात्मक के बजाय दिशात्मक मानें।
[08:13] Tata Communications कहते हैं कि CX बॉटलनेक के रूप में ऑर्केस्ट्रेशन ऑटोमेशन को पीछे छोड़ता है
Tata Communications यह तर्क दे रही है कि ग्राहक अनुभव कार्य अपनी पाइपलाइन से आगे बढ़ गया है। Gaurav Anand, जो Tata Communications में ग्लोबली Customer Interaction Suite चलाते हैं, कहते हैं कि एंटरप्राइजेज ने पिछले कुछ सालों में लेगसी सिस्टम पर कन्वर्सेशनल AI जोड़ा है जो कभी एजेंटिक वर्कलोड्स के लिए बनाए नहीं गए थे, और सीमाएं दिखने लगी हैं।
27 अगस्त, 2026 को प्रकाशित VentureBeat कॉलम में Anand तर्क देते हैं कि परिणाम यह है कि मानव एजेंट अब अधिकांश एकीकरण बोझ उठाते हैं। उन्हें असंबद्ध टूल्स से संदर्भ जोड़ना होता है सिर्फ यह पता लगाने के लिए कि AI सिस्टम ने ग्राहक को पहले ही क्या बताया है। बॉटलनेक अब डेटा एक्सेस नहीं है, वे कहते हैं, बल्कि एक साझा एंटरप्राइज कॉन्टेक्स्ट की अनुपस्थिति है जो ग्राहक पहचान, इंटरैक्शन, ट्रांज़ैक्शन, पॉलिसी, जर्नी, और ऑपरेशनल सिस्टम को एक सामान्य समझ में जोड़ती है।
पारंपरिक CX आर्किटेक्चर रैखिक, मानव-संचालित रूटिंग के लिए डिज़ाइन किया गया था, स्वायत्त AI एजेंट्स, डेटा लेक्स, और मानव कर्मचारियों के बीच रियल-टाइम डेटा फ्लो को ऑर्केस्ट्रेट करने के लिए नहीं। Anand इस बदलाव को शीर्ष CX प्राथमिकता के रूप में ऑटोमेशन से ऑर्केस्ट्रेशन की ओर बढ़ाव के रूप में फ्रेम करते हैं। रणनीतिक प्रश्न, वे सुझाते हैं, यह है कि एंटरप्राइज के अंदर पहले से मौजूद बुद्धिमत्ता का समन्वय कैसे करें ताकि ग्राहक को आंतरिक साइलोज़ कभी महसूस न हों।
वह फ्रेमिंग ऑर्केस्ट्रेशन टूलिंग, आइडेंटिटी रेज़ोल्यूशन, और कॉन्टेक्स्ट लेयर्स को अगले CX बिल्ड साइकल के केंद्र में रखती है, एक और कन्वर्सेशनल मॉडल अपग्रेड से पहले।
[09:37] एजेंटों के बीच छिपा वास्तविक एंटरप्राइज AI खतरा
इस लेख में एक तीखा दावा है: एंटरप्राइज AI का खतरनाक हिस्सा कोई एक एजेंट का बिगड़ना नहीं है, बल्कि यह एजेंटों के बीच अदृश्य कॉल का जाल है जिसे कोई मैप नहीं करता और न ही कोई इसका मालिक है।
वास्तविक डिप्लॉयमेंट एक एजेंट भेजकर और उसे चलते हुए देखने से नहीं होते। वे फ्लीट भेजते हैं जहां हर एजेंट API को कॉल करता है, दूसरे एजेंटों को कॉल करता है, और उन एप्लिकेशन में जाता है जो किसी मशीन डिसीजन-मेकर के अस्तित्व में आने से बहुत पहले बनाए गए थे। एक सपोर्ट टिकट जो पहले एक सिस्टम को छूता था अब चार एजेंटों से गुजर सकता है इससे पहले कि कोई इंसान उसे देखे, और हर हैंडऑफ एक स्वीकृति है जिसे किसी ने नहीं लिखा।
गणित इसे दर्दनाक बनाती है। दसवां एजेंट जोड़ने से दस कनेक्शन नहीं जुड़ते, यह दर्जनों जोड़ सकते हैं, क्योंकि कोई भी एजेंट किसी भी दूसरे एजेंट को कॉल कर सकता है, और हर कॉल कहीं और दूसरी कॉल ट्रिगर कर सकती है। जटिलता एजेंटों की संख्या के साथ नहीं, बल्कि एजेंटों के बीच पथों की संख्या के साथ बढ़ती है, और उस ग्राफ को बनाने का कोई काम नहीं है।
गवर्नेंस अपडेट नहीं हुई है। सिक्योरिटी टीम से पूछें कि कौन से एजेंट कौन से सिस्टम तक पहुंच सकते हैं और आपको खामोशी मिलती है। पूछें कि तीन हॉप पहले किस एजेंट ने कौन सा डाउनस्ट्रीम एक्शन ट्रिगर किया और आपको और खामोशी मिलती है। इंस्टिंक्ट इसे चेकलिस्ट की तरह देखने की है: एजेंट को अप्रूव करो, एजेंट को लॉग करो, आगे बढ़ो। लेकिन चेकलिस्ट एक पल की जांच करती है, जबकि जटिलता एक चेन में चलती है। एक बार की स्वीकृतियों का ढेर किसी वर्कफ्लो को गवर्न नहीं कर सकता, जैसे एक सब्जी डाइट नहीं बनाती।
बिल्डर्स के लिए व्यावहारिक निष्कर्ष: एजेंट फ्लीट को स्केल करने से पहले, यह ग्राफ बनाएं कि कौन सा एजेंट किस सिस्टम तक पहुंच सकता है। अगर टीम में कोई उस तस्वीर को पांच मिनट से कम समय में स्केच नहीं कर सकता, तो डिप्लॉयमेंट पहले से ही गवर्न करने के लिए बहुत अपारदर्शी है।
[11:20] Liquid AI का Pipette मॉडल का बेंचमार्क उन डिवाइस पर करता है जहां वे वास्तव में चलते हैं
इंटरनेट पर हर मॉडल कार्ड सर्वर-क्लास हार्डवेयर पर फुल प्रिसिजन में मापी गई क्वालिटी नंबर सूचीबद्ध करता है। वे नंबर शायर ही भविष्यवाणी करते हैं कि वही मॉडल एक बार छोटा होकर फोन या लैपटॉप पर चलाया जाएगा तो कैसा व्यवहार करेगा। इस हफ्ते Liquid AI ने Pipette जारी किया, एक ओपन-सोर्स, रिप्रोड्यूसिबल बेंचमार्किंग सुइट जो इस अंतर को पाटने के लिए बनाया गया है।
Pipette चार वेरिएबल को एक साथ मापता है: मॉडल, उसका क्वांटाइजेशन, रनटाइम, और डिवाइस हार्डवेयर। इन्हें अलग-अलग सवालों के बजाय एक ही एक्सपेरिमेंट के रूप में देखना, यह वे नंबर प्रोड्यूस करता है जो एक डेवलपर को वास्तव में तब दिखते हैं जब वे किसी मॉडल को असली हार्डवेयर पर साइडलोड करते हैं। Liquid AI ने Artificial Analysis के साथ पार्टनरशिप की है ताकि वे एक स्वतंत्र मेथडोलॉजी वैलिडेटर के रूप में काम करें, जिसका मकसद सुइट को उसके मापने और न मापने के बारे में ईमानदार रखना है।
ऑन-डिवाइस फीचर शिप करने वाले बिल्डर्स के लिए व्यावहारिक बदलाव यह है कि मॉडल-और-क्वांटाइजेशन चॉइस अब किसी विशिष्ट फोन पर मापे गए लेटेंसी और क्वालिटी पर आधारित हो सकते हैं, न कि किसी पेपर से एक्सट्रैपोलेट करके। सुइट ओपन-सोर्स है, इसलिए टीमें अपने डिवाइस प्रोफाइल जोड़ सकती हैं और उस मैट्रिक्स को असली हार्डवेयर पर दोबारा चला सकती हैं जो वे वास्तव में शिप करती हैं।
सच्ची चेतावनी यह है कि Pipette जो मापता है वही मापता है; यह उन मूल हार्डवेयर सीमाओं को दूर नहीं करता जो ऑन-डिवाइस AI को प्रतिबंधित करती हैं। लेकिन अब एक सार्वजनिक, पुनरुत्पादन योग्य तरीका है जिससे एक ही मैदान पर उम्मीदवारों की तुलना की जा सकती है, और यही वह चीज है जो अधिकांश ऑन-डिवाइस प्रोजेक्ट्स के लिए कमी थी।
[12:47] OpenAI के Jalapeño चिप ने पहले इन्फरेंस परिणाम पोस्ट किए
OpenAI ने Jalapeño के लिए पहले प्रदर्शन आंकड़े प्रकाशित किए, जो अपने कस्टम-निर्मित चिप है जिसे प्रोडक्शन में AI मॉडल चलाने के लिए डिज़ाइन किया गया है। इन्फरेंस, जो वास्तव में उपयोगकर्ता के सेंड दबाने पर जवाब उत्पन्न करने का काम है, एक आधुनिक AI उत्पाद चलाने का सबसे महंगा हिस्सा है, और specifically इसके लिए बनाई गई चिप्स सामान्य-उद्देश्य ग्राफिक्स प्रोसेसर की तुलना में तेज़ और सस्ती हो सकती हैं। यही Jalapeño के पीछे का दांव है।
25 अगस्त को प्रकाशित परिणामों में, OpenAI का कहना है कि चिप उद्योग-अग्रणी गति और पावर दक्षता प्रदान करती है, तुलनीय विकल्पों की तुलना में अधिक थ्रूपुट (प्रति सेकंड अधिक जवाब) और कम लेटेंसी (प्रति जवाब कम प्रतीक्षा) के साथ। कंपनी ने इस घोषणा को बहु-वर्षीय प्रयास के पहले ठोस सत्यापन के रूप में प्रस्तुत किया जिसमें तीसरी पक्ष के एक्सेलेरेटर पर पूर्ण निर्भरता के बजाय अपना खुद का सिलिकॉन डिज़ाइन करने का प्रयास किया गया।
ये आंकड़े महत्वपूर्ण हैं क्योंकि इन्फरेंस, प्रशिक्षण नहीं, बार-बार आने वाला बिल है। एक पर्पस-बिल्ट चिप जो कम पावर पर समान लोड संभालती है, या प्रत्येक सर्वर से अधिक रिस्पॉन्स निकालती है, सीधे चैटबॉट, कोडिंग असिस्टेंट, या बैच्ड सारांश जॉब को बड़े पैमाने पर चलाने की लागत कम करती है। OpenAI के लिए यह मार्जिन में बदलता है, और इसके API पर बनाने वाले किसी के लिए यह अंततः मूल्य परिवर्तन या नए लेटेंसी टियर में बदल सकता है।
दो चीजें हैं जिन पर अगले दिन ध्यान देना है: स्वतंत्र बेंचमार्क जो वेंडर-सप्लाइड आंकड़ों की पुष्टि करें या खंडन करें, और कोई संकेत कि क्या Jalapeño केवल आंतरिक OpenAI वर्कलोड तक सीमित है या अंततः ChatGPT या API के माध्यम से बाहरी ट्रैफिक की सेवा करेगा।
[14:14] Google का Tiny GlucoFM मॉडल अपने आकार से सैकड़ों गुना बड़े प्रतिद्वंद्वियों को हराता है
Google Research और University of New South Wales Sydney ने इस सप्ताह GlucoFM जारी किया, एक फाउंडेशन मॉडल जो निरंतर ग्लूकोज मॉनिटर डेटा के लिए है। निरंतर ग्लूकोज मॉनिटर वे छोटे सेंसर हैं जो मधुमेह वाले लोग पूरे दिन अपने रक्त शर्करा को ट्रैक करने के लिए पहनते हैं, हर कुछ मिनट में एक नई रीडिंग जनरेट करते हैं।
GlucoFM में केवल 720,000 पैरामीटर हैं, जो अधिकांश आधुनिक AI सिस्टम के आकार का एक अंश है, फिर भी 14 कोहॉर्ट और टास्क मूल्यांकनों में इसने प्रिसिजन-रेकॉल AUC में औसतन 58.8 हासिल किया, GluFormer को हराया जो उसी काम के लिए बनाया गया 135-मिलियन-पैरामीटर मॉडल है, और MOMENT को, जो 385-मिलियन-पैरामीटर का सामान्य टाइम-सीरीज फाउंडेशन मॉडल है। संदर्भ के लिए, GluFormer लगभग 190 गुना बड़ा है और MOMENT GlucoFM से लगभग 535 गुना बड़ा है।
यह ट्रिक यह है कि GlucoFM सिग्नल को कैसे पढ़ता है। ग्लूकोज ट्रेस को एक लंबे अविभेदित अनुक्रम के रूप में व्यवहार करने के बजाय, यह डेटा को दो स्ट्रीम में विभाजित करता है: एक धीमी फिजियोलॉजिकल स्ट्रीम जो बेसलाइन ड्रिफ्ट और लंबे रुझानों को कैप्चर करती है, और एक ट्रांज़िएंट इवेंट स्ट्रीम जो भोजन, व्यायाम, या दवा से होने वाले अल्पकालिक स्पाइक्स को पकड़ती है। प्रत्येक स्ट्रीम को अपना स्वयं का एनकोडिंग पाथवे मिलता है उससे पहले कि मॉडल उन्हें वापस एक साथ फ्यूज करता है। मॉडल को सेल्फ-सुपरवाइज्ड तरीके से प्रीट्रेन किया गया है, जिसका अर्थ है कि किसी विशिष्ट भविष्यवाणी के लिए फाइन-ट्यूनिंग से पहले यह अनलेबल्ड डेटा से ग्लूकोज ट्रेस के आकार को सीखता है।
यह मायने रखता है क्योंकि CGM डेटा शोरगुल वाला, व्यक्ति-विशिष्ट, और अतिव्यापी गतिशीलता से भरा होता है। एक सामान्य टाइम-सीरीज मॉडल को उस पृथक्करण को शुरू से सीखना होता है जिसके लिए बहुत बड़े पैरामीटर बजट की आवश्यकता होती है। GlucoFM उस पृथक्करण को आर्किटेक्चर में बेक करता है, और यही कारण है कि एक छोटे इमेज क्लासिफायर के आकार का मॉडल एक क्लिनिकल-स्टाइल बेंचमार्क पर जीत सकता है।
सावधानियां वास्तविक हैं। GlucoFM एक शोध प्रोटोटाइप है जिसके पास FDA या समकक्ष नियामक मंजूरी नहीं है, इसलिए कल किसी क्लिनिक में कुछ नहीं भेजा जाता। Google ने सार्वजनिक API, ओपन वेट्स, या डिवाइस-निर्माता साझेदारी की घोषणा नहीं की है। GlucoFM जो संकेत देता है वह यह है कि medical AI में bigger-is-better का डिफ़ॉल्ट तब एक विश्वसनीय चुनौतीकर्ता है जब आर्किटेक्चर भाषा से उधार लेने के बजाय जीव विज्ञान के इर्द-गिर्द डिज़ाइन किया गया हो।
[16:16] शोध डाइजेस्ट: Vision Models को निर्देशों का पालन करना सिखाने के लिए एक स्मार्टर लूप
एक विज़न मॉडल को जटिल निर्देशों का पालन करना सिखाने के लिए आमतौर पर बड़े डेटासेट इकट्ठा करने और उम्मीद करने का मतलब है कि वे सटीक, विविध, और कठिन पर्याप्त हैं। नया VISA फ्रेमवर्क उस डेटा-निर्माण चरण को एक लूप के रूप में मानता है जिस पर सिस्टम स्वयं में सुधार करता है। हर राउंड में, यह एक छवि का निरीक्षण करता है, उन बाधाओं को हटाता है जिनकी पुष्टि नहीं की जा सकती, और एक मेमोरी बैंक से खींचे गए नए प्रस्ताव प्रस्तुत करता है। उम्मीदवार निर्देशों की जांच executable tools और संरचित भाषा-मॉडल न्यायाधीशों के साथ की जाती है, और किसी भी विफलता का निदान किया जाता है और प्रतिक्रिया दी जाती है ताकि अगला राउंड उसी कमजोरी को लक्षित करे जो लक्ष्य मॉडल अभी दिखाता है।
वह प्रतिक्रिया दोहरा काम करती है: यह भविष्य के डेटा को तेज करती है और सुदृढीकरण शिक्षण के लिए इनाम संकेत के रूप में भी काम करती है, इसलिए अलग इनाम मॉडल को प्रशिक्षित करने की आवश्यकता नहीं है। MM-IFEval बेंचमार्क पर, VISA-प्रशिक्षित मॉडलों ने निर्देश-अनुसरण पर मजबूत बेसलाइन को पीछे छोड़ दिया जबकि सात सामान्य मल्टीमॉडल टेस्ट पर स्थिर रहे। व्यावहारिक परिणाम यह है कि किसी के लिए भी सस्ता, उच्च-गुणवत्ता वाला ट्यूनिंग डेटा है जो विज़न असिस्टेंट बना रहा है जिन्हें एक साथ कई नियमों को संभालना होता है, जैसे चार्ट पढ़ना और एक शब्द सीमा के साथ एक विशिष्ट प्रारूप में उत्तर देना।
[17:22] xAI का Grok 4.6 Microsoft Foundry पर उतरा
xAI का फ्लैगशिप Grok 4.6 अब Microsoft Foundry पर उपलब्ध है, जो कि एंटरप्राइज़ AI परिनियोजनों के लिए Azure का मॉडल कैटलॉग है। 26 अगस्त को घोषित एकीकरण, Grok 4.6 को Azure के एंटरप्राइज़ इन्फ्रास्ट्रक्चर के माध्यम से सीधी तुलना और परिनियोजन के लिए अन्य अग्रणी मॉडलों के साथ रखता है।
Grok 4.6 500,000-टोकन संदर्भ विंडो और चार कॉन्फ़िगर करने योग्य तर्क प्रयास स्तरों के साथ आता है: कम, मध्यम, उच्च, और एक्सहाई। xAI मॉडल को लंबे समय चलने वाले एजेंटों और महत्वाकांक्षी इंटरैक्टिव और विज़ुअल कार्य के लिए बनाया गया बताता है, भाषा जो इशारा करती है कि कंपनी एकल-टर्न चैट के बजाय गंभीर एजेंट वर्कलोड को लक्षित कर रही है।
बिल्डर्स के लिए, Foundry एक जगह प्रदान करता है जहां Grok 4.6 को प्रतिस्पर्धी अग्रणी मॉडलों के खिलाफ मूल्यांकन करना, वर्कलोड-विशिष्ट टेस्ट चलाना, और एंटरप्राइज़ सुरक्षा और गवर्नेंस नियंत्रणों के तहत प्रबंधित एंडपॉइंट परिनियोजित करना संभव है। xAI विशेष रूप से कोडिंग एजेंटों, इंजीनियरिंग कोपायलटों, शोध सहायकों, और एंटरप्राइज़ ऑटोमेशन को उन प्रणालियों के रूप में बुलाता है जिन्हें मॉडल लक्षित करता है, डेवलपर्स अभी Foundry मॉडल कैटलॉग में शुरू कर सकते हैं।
[18:17] शोध डाइजेस्ट: AI मॉडलों को लंबे समय तक सोचने देने का एक सस्ता तरीका
एक नई तकनीक जिसे Prefix Sliding कहा जाता है, AI मॉडल को काफी सस्ता चला सकती है जब वे कठिन समस्याओं को "सोच" में लंबा समय बिताते हैं। आज, जब कोई मॉडल लंबे समय तक तर्क करता है, तो यह हर मध्यवर्ती विचार को कार्यशील मेमोरी में रखता है, इसलिए जितना लंबा यह सोचता है, प्रत्येक प्रश्न उतना ही महंगा होता जाता है। शोधकर्ताओं ने पाया कि जैसे ही मॉडल आगे बढ़ जाता है, उनमें से अधिकांश मध्य चरण महत्वपूर्ण नहीं रहते, इसलिए उन्हें रखना उस संदर्भ के लिए भुगतान करना है जो शायद ही कभी मदद करता है।
उनका समाधान सिद्धांत में सरल है: आगे केवल मूल निर्देश रखें और सबसे हाल के कुछ हज़ार टेक्स्ट का एक स्लाइडिंग विंडो रखें, बाकी को ऑन-द-फ्लाई छोड़ दें। यह मेमोरी उपयोग को तब तक सीमित करता है जब तक विचार श्रृंखला कितनी भी लंबी न हो। बिना किसी रिट्रेनिंग के, मौजूदा मॉडल पर Prefix Sliding लागू करने से वे सटीकता बनाए रखते हुए लगभग 3 गुना तेज़ हो गए, और उसी पॉलिसी के साथ ट्रेनिंग ने 100,000 से अधिक तर्क चरणों की सीमा पार कर ली।
लंबी प्लानिंग लूप्स वाले एजेंट्स को शिप करने वाले बिल्डर्स के लिए, इस तरह का मेमोरी कैप मायने रखता है क्योंकि इन्फरेंस लागत ही है जो महत्वाकांक्षी तर्क एजेंट्स को पैमाने पर आर्थिक रूप से व्यवहार्य बनने से रोकती है।
[19:26] Open WebUI ने Human-in-the-Loop Tool Approval जोड़ा
Open WebUI, जो स्व-होस्ट करने योग्य चैट फ्रंटएंड है जिस पर कई local-AI स्टैक बनते हैं, ने 25 अगस्त को v0.11.1 शिप किया। एकमात्र प्रलेखित परिवर्तन एक human-in-the-loop टूल अप्रूवल फ्लो है।
यह कैसे काम करता है। एक एडमिनिस्ट्रेटर सेटिंग्स में फीचर सक्षम करता है। उसके बाद, कोई भी बातचीत डिफ़ॉल्ट — जहां टूल कॉल मॉडल के अनुरोध पर तुरंत एक्जीक्यूट होते हैं — से बदलकर एक मोड में स्विच की जा सकती है जहां प्रत्येक कॉल रुकता है और पहले उपयोगकर्ता से पूछता है। बटन या कीबोर्ड शॉर्टकट द्वारा अप्रूवल या डिनियल होता है, एक बार में एक कॉल, और वह विकल्प उस बातचीत के शेष समय और भविष्य की बातचीतों के लिए याद रखा जाता है।
रिलीज़ नोट्स का अंश फीचर के बीच में कट जाता है, इसलिए यह कहानी केवल एक परिवर्तन पर केंद्रित है जो प्रलेखित है: प्रति-कॉल अप्रूवल गेट, इसका एडमिन-स्तरीय इनेबल, और प्रति-बातचीत टॉगल।
सेल्फ-होस्टर्स के लिए, यह किसी भी एजेंट वर्कफ्लो के लिए एक वास्तविक सुरक्षा लीवर है। व्यावहारिक कदम शुद्ध रूप से बातचीत वाली चैट के लिए एडमिन स्विच बंद रखना है और कहीं भी मॉडल के पास टूल अटैच होने पर प्रति-बातचीत अप्रूवल चालू करना है, ताकि प्रत्येक कॉल explicit allow या deny के लिए रुके बजाय बिना जाँच के चलने के। देखें कि भविष्य की रिलीज़ में याद रखा गया विकल्प एकल बातचीत से आगे बढ़कर वर्कस्पेस-वाइड डिफ़ॉल्ट में विस्तारित होता है या नहीं, क्योंकि अभी पर्सिस्टेंस उस चैट तक सीमित है जहाँ टॉगल फ्लिप किया गया था।
[20:46] Google ने Hot Chips पर अपनी आठवीं पीढ़ी के TPU लाइनअप को विभाजित किया
Hot Chips 2026 में, सालाना सम्मेलन जहाँ चिप टीमें अपने नवीनतम सिलिकॉन को तकनीकी दर्शकों के लिए उजागर करती हैं, Google ने अपने आठवीं पीढ़ी के Tensor Processing Unit परिवार के बारे में चर्चा की। 26 अगस्त को प्रकाशित ServeTheHome रिपोर्ट के अनुसार, नया परिवार वर्कलोड द्वारा दो चिप्स में विभाजित है: TPU 8t जो ट्रेनिंग के लिए और TPU 8i जो इन्फरेंस के लिए लक्षित है।
यह विभाजन घोषणा की संरचनात्मक कहानी है। एक चिप मॉडल को प्रशिक्षित करने के लिए बनाई गई है और दूसरी भविष्यवाणियां प्रदान करने के लिए, और Google उन्हें एक जोड़े के रूप में साथ-साथ प्रस्तुत कर रहा है। कंपनी हाइपरस्केलर्स में से एकमात्र में से एक के रूप में भी खड़ी है जो अपना स्वयं का प्रशिक्षण हार्डवेयर विकसित करती है, बाहरी विक्रेताओं से प्रशिक्षण सिलिकॉन प्राप्त करने के बजाय — उद्योग में एक असामान्य स्थिति, जहां अधिकांश बड़े AI ऑपरेटर अपना प्रशिक्षण कंप्यूट तृतीय-पक्ष चिप निर्माताओं से खरीदते हैं।
बिल्डर्स के लिए, व्यावहारिक प्रश्न पहुंच का है। Google's TPUs आमतौर पर Google Cloud और साझेदारों के एक छोटे घेरे के माध्यम से बाहरी डेवलपर्स तक पहुंचते हैं, और Hot Chips के आसपास प्रकाशित तकनीकी गहन विश्लेषण आमतौर पर पूर्वावलोकन करते हैं कि क्या कुछ महीने बाद सामान्य रूप से उपलब्ध होगा। देखने के लिए ठोस संकेत Google Cloud ब्लॉग पोस्ट और नए चिप्स से जुड़े बेंचमार्क नंबर हैं, जो यह प्रकट करेंगे कि आठवीं पीढ़ी Google's स्टैक पर मॉडल को प्रशिक्षित करने या चलाने की लागत, थ्रूपुट या स्केलेबिलिटी को बदलती है या नहीं।