TobyOnFitnessTech
एजेंटस्टैक डेली: एजेंट स्टैक रिलीज़ रीडआउट: ओपनक्लॉ v2026.6.34, v2026.6.33 — Episode 99 cover art
Episode 99·10 अगस्त 2026·44:31

एजेंटस्टैक डेली: एजेंट स्टैक रिलीज़ रीडआउट: ओपनक्लॉ v2026.6.34, v2026.6.33

एजेंट स्टैक रिलीज़ रीडआउट: ओपनक्लॉ v2026.6.34, v2026.6.33, क्लॉड कोड ऑटो मोड को डिफ़ॉल्ट बनाता है, क्लाउडफ्लेयर का कीटसर्फ AI एजेंटों को अपना हल्का ब्राउज़र... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-99/

🎧 Listen to Episode

एपिसोड 099 — 10 अगस्त, 2026

[00:00] एपिसोड हुक

एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.6.34, v2026.6.33 आज का नेतृत्व करता है: v2026.6.33, v2026.6.34 बिल्डर्स की रोजमर्रा की सतहों में ठोस बदलाव लाते हैं, जिनका विवरण नीचे दिया गया है। आज की लाइनअप में भी: Claude Code ऑटो मोड को डिफ़ॉल्ट बनाता है, Cloudflare का Kitesurf AI एजेंटों को अपना हल्का ब्राउज़र देता है, GitHub का Copilot मेट्रिक्स API अब Claude और Codex एजेंट रन को ट्रैक करता है, साथ ही मॉडल, टूलिंग और इन्फ्रास्ट्रक्चर में घने न्यूज साइकिल का बाकी हिस्सा। हर कहानी को वही इलाज मिलता है — क्या शिप हुआ, उसके नीचे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।

[02:00] एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.6.34, v2026.6.33

OpenClaw ने 8 अगस्त को दो लगातार अपडेट शिप किए — v2026.6.33 और v2026.6.34, छह मिनट के अंतराल पर — दोनों नए फीचर्स की जगह सुरक्षा और विश्वसनीयता पर जोर दिया। v2026.6.33 पहले आता है, v2026.6.34 एक लक्षित हार्डनिंग पास के रूप में आता है।

सैंडबॉक्स्ड ब्राउज़र रूट्स, ट्रस्टेड DNS टारगेट्स, कस्टम ब्राउज़र ऑरिजिन्स और लूपबैक प्रोवाइडर एंडपॉइंट्स अब असुरक्षित एक्सेस पाथ्स को अस्वीकार करते हैं। प्रोवाइडर स्ट्रीम्स, Discord REST रिस्पॉन्सेस, ब्राउज़र फेचेस, OAuth पाथ्स और लॉग्स शत्रुतापूर्ण रिस्पॉन्स साइज़ को कैप करते हैं, और Telegram क्रेडेंशियल्स अब डायग्नोस्टिक्स या अकाउंट URL में लीक नहीं होते।

लंबे समय चलने वाले एजेंटों को सार्थक अपग्रेड मिलते हैं। रन रिलीज, लाइवनेस चेक्स और वॉचडॉग सेमांटिक्स अब सक्रिय लॉन्ग मॉडल कॉल्स से वास्तविक स्टाल्स को अलग करते हैं, इसलिए एक धीमा इन्फरेंस कॉल हैंग के रूप में मारा नहीं जाएगा। रिटेन्ड सेशन राइट्स, प्रोवाइडर फॉलबैक्स और स्ट्रीम प्रोग्रेस हैंडलिंग बिना सक्रिय काम को चुपचाप खत्म किए रिकवर होते हैं, और stdio फेलर्स अब होस्ट प्रोसेस को क्रैश नहीं करते।

चैनल डिलीवरी सबसे बड़े यूज़र-विजिबल फिक्सेस देखती है। Discord रीकनेेक्ट्स अब कतारबद्ध मैसेजेस को ड्रॉप नहीं करते और अस्पष्ट सेंड्स को दोहराते नहीं। Telegram बॉट-टू-बॉट और रिप्लाई-फेंस हैंडलिंग इरादे के थ्रेड को बनाए रखती है, पेंडिंग चैनल वर्क रिकवरी के बाद फिर से शुरू होता है, और एक्नॉलेजमेंट्स इडेम्पोटेंट हैं। निरंतर Discord गेटवे बर्स्ट्स बाउंडेड रहते हैं।

क्रेडेंशियल हैंडलिंग भी कड़ी होती है। सर्विस रीस्टार्ट्स SecretRef-बैक्ड Telegram क्रेडेंशियल्स को प्रिज़र्व करते हैं, OAuth रिपेयर अब पहले से वैध डेस्टिनेशन प्रोफाइल को ओवरराइट नहीं करता, और MCP स्टेटस आउटपुट सीक्रेट्स को रिडैक्ट करता है। बाहरी MCP लूपबैक क्लाइंट्स परिवर्तनशील चाइल्ड-प्रोसेस अथॉरिटी को इनहेरिट करने के बजाय शॉर्ट-लिव्ड सेशन-बाउंड अटैच ग्रांट्स का उपयोग करते हैं।

ऑपरेटर-साइड अप्रूवल गेट्स कड़े हुए। Codex ऐप-सर्वर कमांड्स अब एक वास्तविक इंसान या प्लगइन अप्रूवल की मांग करते हैं, exec ऑटो-रिव्यू सही रेज़ोल्व्ड कमांड से बंधा रहता है, और संकरे टूल अलाउलिस्ट्स उस फैक्ट्री के स्वामित्व में रहते हैं जो उन्हें कंस्ट्रक्ट करती है। गेटवे HTTP अनऑथेंटिकेटेड हैंडलिंग से पहले अनुमत नहीं दिए गए ब्राउज़र ऑरिजिन्स को अस्वीकार करता है।

पैच्ड brace-expansion, PostCSS, fast-uri, ip-address और Undici के लिए प्रोडक्शन रेज़ोल्यूशन अपडेट। SQLite चेकपॉइंट्स, वर्कस्पेस रीड्स, गेटवे प्रोसेस सिग्नलिंग और प्लगइन HTTP रेस्पॉन्स अब ट्रांज़िएंट होस्ट कंडीशन्स को फेल्ड रन में नहीं बदलते।

दो छोटे फिक्सेस v2026.6.34 बंद करते हैं: OpenCode Go डॉक्यूमेंटेड hy3 मॉडल आइडेंटिफायर का उपयोग करता है फेलिंग hy3-preview एलियास की जगह, और Codex नेटिव सबएजेंट्स मल्टी-एजेंट V2 चाइल्ड एक्टिविटी के दौरान पैरेंट app-server सब्सक्रिप्शन बनाए रखते हैं जब तक कि एक yielded चाइल्ड कम्प्लीशन अपने रिक्वेस्टर तक नहीं पहुंच जाती।

[03:04] Claude Code ऑटो मोड को डिफ़ॉल्ट बनाता है

Claude Code, Anthropic का कमांड-लाइन कोडिंग असिस्टेंट, नए सेशन्स के लिए डिफ़ॉल्ट सेटिंग में ऑटो मोड ले जा रहा है। यह बदलाव 9 अगस्त, 2026 को रिपोर्ट किया गया था, एक सीधे हेडलाइन फ्रेमिंग के साथ: टूल के साथ प्रोग्रामिंग जल्द ही कम मानव पर्यवेक्षण की मांग करेगी।

ऑटो मोड Claude Code सेटिंग है जो एक सेशन के दौरान कम मानव पर्यवेक्षण से जुड़ी है। इसे डिफ़ॉल्ट में प्रमोट करना माने है कि नए सेशन उस पोस्चर में शुरू होते हैं बजाय इसके कि बिल्डर्स को ऑप्ट-इन करने के लिए कहा जाए, इसलिए आज Claude Code का उपयोग करने वाला कोई भी भविष्य में एक अलग आउट-ऑफ़-द-बॉक्स अनुभव की उम्मीद कर सकता है। जिन डेवलपर्स के पहले से असिस्टेंट के लंबे फ्लो संभालने में सहज हैं, उनके लिए यह मैसेज वन से कम इंटरप्टेड वर्कफ्लो में बदल जाता है।

यह कहानी TechCrunch AI के माध्यम से सामने आई और Hacker News पर 212 स्कोर तक पहुंची, जो सुझाव देती है कि डेवलपर समुदाय वास्तव में ध्यान दे रहा है कि कोडिंग टूल्स डिफ़ॉल्ट रूप से कितना ऑटोनॉमी लेते हैं, ना कि सिर्फ यह कि वे पूछे जाने पर क्या कर सकते हैं।

ट्रेड-ऑफ़ फ्लैग करने योग्य है। कम मानव पर्यवेक्षण का मतलब प्रोजेक्ट के अंदर एक्शन लेने से पहले कम चेकपॉइंट्स भी हैं, जो प्रोडक्शन रिपॉजिटरीज़ या संवेदनशील कोडबेस में काम करने वाले किसी के लिए एक वास्तविक विचार है। बिल्डर्स के लिए अभी व्यावहारिक सवाल यह है कि नए डिफ़ॉल्ट को जगह पर छोड़ें या पिछले व्यवहार को पिन करें जब तक वे नहीं समझते कि ऑटो मोड उनके वातावरण में वास्तव में क्या करेगा।

[04:26] Cloudflare का Kitesurf AI एजेंट्स को अपना हल्का ब्राउज़र देता है

Cloudflare ने 7 अगस्त, 2026 को एक ब्लॉग पोस्ट प्रकाशित किया जिसमें Kitesurf पेश किया गया, एक क्लाउड-होस्टेड ब्राउज़र जो स्पष्ट रूप से AI एजेंट्स के लिए डिज़ाइन किया गया है मानव उपयोगकर्ताओं के बजाय। पिच सीधी है: हर बार एक एजेंट को वेबपेज विज़िट करने, फॉर्म भरने या कुछ डेटा स्क्रैप करने की जरूरत होने पर पूर्ण Chromium ब्राउज़र लॉन्च करने की लागत के बजाय, Kitesurf हल्के V8 isolates में चलता है, वही JavaScript सैंडबॉक्स मॉडल जो Cloudflare Workers को शक्ति देता है। Isolates मिलीसेकंड्स में शुरू होते हैं और एक अंतर्निहित रनटाइम शेयर करते हैं, जो एक पूर्ण ब्राउज़र प्रोसेस स्पिन करने से मूल रूप से अलग लागत आकार है।

सोर्स मैटेरियल में फ्रेमिंग यह है कि Kitesurf सामान्य ऑटोमेशन टास्क्स के लिए Chromium की तुलना में कम कंप्यूटिंग पावर का उपयोग करता है। यह मायने रखता है क्योंकि ब्राउज़र-आधारित एजेंट्स आज AI वर्कलोड्स में सबसे महंगी श्रेणियों में से एक हैं; हर headless Chrome इंस्टेंस मेमोरी और CPU ओवरहेड लेकर आता है जो हज़ारों सेशन्स में जल्दी जुड़ जाता है। एजेंट्स के लिए बनाया गया एक पर्पस-बिल्ट ब्राउज़र, ह्यूमन-रेंडरिंग पार्ट्स को ट्रिम करके, उस लागत दबाव के लिए एक प्राकृतिक जवाब है।

Kitesurf को ब्राउज़र-आधारित AI agents बनाने वाले developers के लिए infrastructure के रूप में position किया गया है, जो उन्हें status quo से अधिक कुशल runtime देता है। Launch के आसपास का Hacker News thread 217 score पर पहुंचा, जो एक महत्वपूर्ण signal है कि developer community agent-native browsing infrastructure में सक्रिय रूप से रुचि रखती है, headless browser को wrap करने और उम्मीद करने की usual approach के बजाय कि यह scale होगा।

जिस बात पर नज़र रखनी चाहिए वह यह है कि Kitesurf एक focused developer tool बना रहता है या managed agent-browsing service में evolve होता है जिसे अन्य agent platforms अपने products के नीचे plumbing के रूप में call करते हैं।

[06:03] GitHub का Copilot metrics API अब Claude और Codex agent runs को track करता है

GitHub ने चुपचाप एक reporting layer जोड़ा जिसका कई administrators ने इंतज़ार किया था। Copilot usage metrics API अब agent app activity को surface करता है, इसलिए partner agents जैसे Claude और Codex के कोई भी runs जो GitHub workflows के अंदर fire होते हैं, वे same dashboard में human Copilot usage के साथ appear होते हैं। Agent apps themselves नए नहीं हैं — GitHub पहले से ही teams को partners से agents लाने और उन्हें सीधे अपने repositories और pull requests में run करने की अनुमति देता है। जो नया है वह visibility है: अब तक, उन agents का usage उस API के बाहर था जिसे admins पहले से ही Copilot metrics के लिए polling कर रहे थे। इस change के साथ, एक call एक team को बता सकता है कि उसके organization भर में ये agents कितनी बार use हो रहे हैं। Changelog entry itself छोटी है और नए endpoint names, नए fields, या migration guide को spell out नहीं करती, इसलिए teams को exact shape of the new payload के लिए GitHub changelog और API reference check करना चाहिए। Builders और platform owners के लिए, practical shift सीधा है कि agent work अब उसी usage reporting का हिस्सा है जिसके against seats and spend आप पहले से reconcile कर रहे हैं, जिससे underused agents, budget drift, या workflows जहां agents चुपचाप dominant contributor बन गए हैं, spot करना आसान हो जाता है। जिस बात पर अगली नज़र रखनी चाहिए वह यह है कि API per-agent breakdowns expose करता है या नहीं, जो teams को बिना logs scrape किए सीधे Claude बनाम Codex usage की तुलना करने देगा।

[07:29] GitHub Copilot का August 3 Weekly Update Desktop, CLI, और VS Code में आ गया है

GitHub ने August 3 को एक weekly Copilot release ship किया, changelog August 7 को publish हुई। Update Copilot desktop app, CLI, और VS Code पर spans है, और post changes को तीन behaviors around frame करता है: work को resume और organize करना, changes review करना, और context खोए बिना questions पूछना।

GitHub changelog entry उन themes के पीछे specific feature flags, version bumps, या technical mechanisms enumerate नहीं करती। Headline summary ही एकमात्र supplied concrete detail है, इसलिए rollout को single feature drop के बजाय Copilot के three primary surfaces पर continuity-focused weekly update के रूप में समझना सबसे अच्छा है। जो कोई named capability, model upgrade, या usage-limit change खोज रहा होगा, उसे post में एक नहीं मिलेगा।

Builders के लिए, practical implication straightforward है। यदि आप VS Code में Copilot session को mid-task छोड़ देते हैं, CLI में कुछ run करते हैं, और फिर desktop app पर return करते हैं, तो stated goal यह है कि आप context खोए बिना work को resume और organize कर सकते हैं। Review-of-changes flows और question-asking flows announcement में same way में frame किए गए हैं।

क्योंकि changelog post specifics पर light है, next useful step यह है कि जिस Copilot client को आप सबसे ज़्यादा use करते हैं उसे open करें और granular feature list के लिए उसके in-product release notes skim करें। यह आपको बताएगा कि आपके installed version में resume, review, और ask surfaces में से कौन actual changed है, और continuity improvements किस model rollout, UI refresh, या settings toggle से tied हैं।

[09:00] ComfyUI local builds के लिए एक quantized MiniMax-H3 variant trending है

MiniMax-H3 छवि मॉडल का एक समुदाय-परिमाणित संस्करण इस सप्ताह Hugging Face की ट्रेंडिंग सूची में ऊपर बढ़ रहा है। रिपॉजिटरी, realrebelai/MiniMax-H3_GGUFs, 3 अगस्त, 2026 को प्रकाशित की गई थी, और पहले से ही लगभग 174,862 डाउनलोड और 191 लाइक पर है, जो एक पुनःपैकेजिंग के लिए असामान्य रूप से उच्च जुड़ाव है। इसे Comfy-Org/MiniMax-H3 का GGUF परिमाणित बिल्ड के रूप में टैग किया गया है, जो आपको एक साथ दो बातें बताता है: यह MiniMax H परिवार का एक छवि मॉडल है, और प्रारूप वह परिमाणित कंटेनर है जो उपभोक्ता हार्डवेयर पर मॉडल चलाने के लिए llama.cpp और Ollama में लोकप्रिय है।

पब्लिशर ने मौजूदा MiniMax-H3 चेकपॉइंट को GGUF में लपेटा, जो कि स्थानीय-अनुमान प्रशंसकों द्वारा मॉडल को सिकोड़ने का तरीका है ताकि यह केवल एक छोटी विश्वसनीयता ट्रेड-ऑफ के साथ होम GPU पर फिट हो सके। comfyui टैग का शामिल होना इस आर्टिफैक्ट को सीधे नोड-आधारित छवि जनरेशन वर्कफ़्लो की ओर इंगित करता है जिसे कई होम उपयोगकर्ता पहले से चलाते हैं। वह संयोजन, ओपन-वेट H-श्रृंखला छवि मॉडल प्लस GGUF पैकेजिंग प्लस ComfyUI संगतता, तेज़ अपनाने का नुस्खा है जब कोई नया परिवार आता है, और डाउनलोड गिनती सुझाव देती है कि लोग पहले से ही इसे खींच रहे हैं।

बिल्डर्स के लिए, यह ब्रिज आर्टिफैक्ट है: कोई भी जो अपने बॉक्स पर ComfyUI चला रहा है अब H3 छवि मॉडल को स्थानीय टूलचेन के लिए पैकेज्ड के रूप में रखता है instead of needing a cloud backend. देखने योग्य एक बात यह है कि इस विशिष्ट रिपॉजिटरी पर लाइसेंस फ़ील्ड, जिसे अज्ञात के रूप में सूचीबद्ध किया गया है और यह मूल मॉडल के लाइसेंस से अलग है, इसलिए ऊपर बनाई गई किसी भी चीज़ को शिप करने से पहले पुनर्वितरण शर्तों की पुष्टि करना worth है।

[10:33] अमेज़न का टेक्सास डेटा सेंटर अमेरिका के सबसे बड़े जलवायु प्रदूषक की मेज़बानी कर सकता है

अमेज़न एक नए टेक्सास डेटा सेंटर के परिसर में एक समर्पित बिजली संयंत्र बनाने की योजना बना रहा है, और वह संयंत्र अमेरिका में जलवायु प्रदूषण के सबसे बड़े एकल स्रोत के रास्ते पर है। इस सप्ताह न्यूयॉर्क टाइम्स का यह ढांचा है, जो इस परियोजना को एक मार्कर के रूप में मानता है कि AI बिल्डआउट अब कितनी कच्ची ऊर्जा एक सुविधा के पीछे लॉक करने को तैयार है।

सेटअप मायने रखता है क्योंकि जनरेटर ग्रिड के बाद की बात नहीं है — यह साइट की प्राथमिक आपूर्ति है। जनरेशन को ऑन-साइट रखने से डेवलपर इंटरकनेक्शन कतारों और ग्रिड बॉटलनेक्स से बच सकता है, लेकिन यह डेटा सेंटर के उत्सर्जन को एक क्षेत्रीय मिश्रण के बजाय एक एकल बिंदु स्रोत पर केंद्रित भी करता है। हाइपरस्केल AI कैंपस के लिए, इसका मतलब है कि जलवायु पदचिह्न एक साइट पर केंद्रित है instead of spreading across a utility's portfolio.

यह कहानी Hacker News पर 234 अंकों पर उतरी और TechCrunch के AI डेस्क द्वारा पहले प्रकाशित की गई, जिसने ग्रिड-क्षमता और परमिटिंग प्रश्नों के सामान्य मिश्रण को आकर्षित किया। आगे देखने की बात यह है कि क्या अन्य हाइपरस्केलर्स अपने AI प्रशिक्षण और अनुमान भार बढ़ते रहने पर ऑन-साइट टेम्पलेट की नकल करते हैं, और क्या टेक्सास रेगुलेटर्स एक एकल-सुविधा उत्सर्जन रिकॉर्ड को परमिटिंग फ्लैशपॉइंट के रूप में मानते हैं।

[11:48] OpenAI ने Astra के लिए प्रारंभिक साइबर चेक प्रकाशित किए

OpenAI ने 7 अगस्त को अपने मॉडल Astra के लिए प्रारंभिक साइबरसिक्योरिटी मूल्यांकन पोस्ट किए, साथ ही वे कदम भी बताए जो वह सुरक्षा सुरक्षाएं और सुरक्षा नियंत्रणों को मजबूत करने के लिए उठा रहा है। ढांचा वह है जिसे कंपनी क्रिटिकल साइबर क्षमताओं का अगला सीमांत कहती है।

पोस्ट स्वयं जानबूझकर पतली है। यह परीक्षण श्रेणियों, हमला सतहों, या मूल्यांकन परिणामों की गणना नहीं करती। जो यह पुष्टि करती है वह यह है कि Astra पर संरचित साइबर कार्य प्रगति पर है और OpenAI काम अभी भी जारी रहते हुए सारांश स्तर पर प्रकाशित करने को तैयार है।

पोस्ट के आसपास का Hacker News थ्रेड 204 के स्कोर तक पहुंचा, जो इस बात का संकेत है कि समुदाय में OpenAI के नए मॉडलों के लिए साइबर जोखिम को कैसे संभाल रहा है, इसमें सक्रिय रुचि है। श्रोताओं के लिए व्यावहारिक बात यह है कि यह एक क्षमता बयान नहीं, बल्कि मूल्यांकन और प्रकटीकरण के लिए एक सार्वजनिक प्रतिबद्धता है। फ्रंटियर मॉडल जोखिम को ट्रैक करने वाले किसी भी व्यक्ति को अधिक ठोस संख्याओं और नामित सुरक्षा उपायों के साथ अनुवर्ती पोस्ट की उम्मीद करनी चाहिए।

एक बात देखने योग्य है कि क्या अगले दौर के मूल्यांकन विशिष्ट परीक्षण श्रेणियों और नामित नियंत्रणों के साथ आते हैं, या OpenAI अभी के लिए सारांश स्तर पर रहता है।

[12:55] शोध डाइजेस्ट: जब AI वैज्ञानिक संख्याएं चलाते हैं लेकिन अर्थ चूक जाते हैं

Fisher-R1-14B नामक एक नया ओपन-वेट AI एजेंट विशेष रूप से यह जांचने के लिए प्रशिक्षित किया गया था कि क्या सांख्यिकीय निष्कर्ष वास्तव में डेटा से आते हैं — बस यह नहीं कि कोड चला या नहीं। शोधकर्ताओं ने P-Bench बनाया, जो अर्थशास्त्र, जीव विज्ञान और चिकित्सा में फैले 425 यथार्थवादी परिकल्पना-परीक्षण कार्यों का एक सेट है, जो मौजूदा बेंचमार्क द्वारा चूकने वाले एक विफलता तरीके को उजागर करने के लिए: एजेंट विश्लेषण को स्वच्छ रूप से निष्पादित कर सकते हैं फिर भी गलत अनुमान लगा सकते हैं जब सांख्यिकीय धारणाएं पूरी नहीं होतीं। Fisher-R1 को सिंथेटिक कार्यों पर प्रशिक्षित किया गया था जिसमें reinforcement learning का उपयोग किया गया जो सांख्यिकीय रूप से वैध उत्तरों को पुरस्कृत करता है। P-Bench पर इसने GPT-5.4 और DeepSeek-V4-Pro से बेहतर प्रदर्शन किया, बेंचमार्क में एकल-परीक्षण सफलता में लगभग 21% अधिक स्कोर किया। व्यावहारिक निष्कर्ष: यदि आप किसी AI एजेंट को डेटासेट का सारांश देने या A/B परीक्षण चलाने दे रहे हैं, तो आत्मविश्वासपूर्ण लगने वाला p-value काफी नहीं है — एजेंट को यह भी जांचना होगा कि उसकी सांख्यिकीय धारणाएं वास्तव में डेटा के अनुरूप हैं या नहीं।

[13:46] शोध डाइजेस्ट: चिकित्सा निवासी की तरह नैदानिक AI को प्रशिक्षित करना

डॉक्टर मरीजों से बातचीत को संभालना सीखने में सालों बिताते हैं — सही सवाल पूछना, निदान को संकुचित करना, चेतावनी के संकेतों को पकड़ना। ResidencyRL नामक एक नए तरीके से AI एजेंटों को उसी तरह प्रशिक्षित किया जाता है, उन्हें 60 संवाद विनिमयों तक के अनुकरणीय क्लिनिक दौरों से गुजारकर और ऐसे रोगियों के साथ जो विरोध कर सकते हैं, भ्रमित कर सकते हैं, या लक्षण छिपा सकते हैं। एजेंट को नैदानिक सटीकता, सुरक्षा, संचार, और खतरनाक चेतावनी संकेतों के पकड़े जाने पर स्कोर किया जाता है। जो परिणाम मायने रखता है: इसने एक बेसलाइन मॉडल की तुलना में छूटे हुए लाल-झंडा लक्षणों की दर को 31% तक कम किया, और अंधेरे नैदानिक चिकित्सकों ने अधिकांश साथ-पक्ष तुलनाओं में इसे पसंद किया। कौशल एक अलग नैदानिक बेंचमार्क में भी स्थानांतरित हुए, जो सुझाव देता है कि प्रशिक्षण एक परीक्षण में ओवरफिटिंग के बजाय सामान्यीकृत करता है। बिल्डर्स के लिए, यह एक कार्यशील टेम्पलेट है: एक बड़े भाषा मॉडल को अनुकरणित, विपरीत 'रोगियों' के साथ जोड़ें और इसे उन व्यवहारों पर स्कोर करें जो वास्तव में बिस्तर पर मायने रखते हैं।

[14:40] DeepSeek Hugging Face पर V4-Flash जारी करता है उदार MIT लाइसेंस के साथ

Hugging Face पर एक नया DeepSeek मॉडल ट्रेंड कर रहा है। deepseek-ai org द्वारा 31 जुलाई को प्रकाशित इस रेपो deepseek-ai/DeepSeek-V4-Flash-0731 ने पहले ही लगभग 954,000 डाउनलोड और लगभग 3,000 लाइक प्राप्त कर लिए हैं — जिस प्रकार का समुदाय स्वागत आप तब देखते हैं जब एक नया ओपन-वेट मॉडल आता है और कुछ ही दिनों में स्थानीय अनुमान सेटअप में खींच लिया जाता है।

नाम में 'Flash' लेबल V4 परिवार में एक हल्के-वेट सिबलिंग की ओर इशारा करता है, जो सबसे भारी reasoning कार्यभार के बजाय रोजमर्रा के टेक्स्ट जनरेशन और संवादात्मक उपयोग के लिए लक्षित है। मॉडल टेक्स्ट-जनरेशन और संवादात्मक के रूप में टैग किया गया है, safetensors प्रारूप में आता है, और transformers टैग वहन करता है, इसलिए बिना रूपांतरण के मानक Hugging Face अनुमान पाइपलाइन में लोड होता है। यही वह कॉन्फ़िगरेशन है जो स्थानीय-AI बिल्डर्स वास्तव में चाहते हैं: एक चेकपॉइंट जो मौजूदा टूलचेन में फिट हो।

लाइसेंस MIT है, जो बिल्डर्स के लिए सबसे अनुकूल स्तर है जो वेट्स के ऊपर फाइन-ट्यून, पुनर्वितरित, या उत्पाद शिप करना चाहते हैं बिना कॉपीलेफ्ट की चिंता के। रेपो में eval-results टैग भी है, जो सुझाव देता है कि DeepSeek ने औपचारिक मूल्यांकन चलाए और वे परिणाम वेट्स के साथ प्रकट किए।

बिल्डर्स के लिए, चैट-स्टाइल एजेंट्स, लोकल असिस्टेंट्स और स्मॉल-स्केल फाइन-ट्यून्स के लिए यह रिलीज़ नज़र रखने लायक है। डाउनलोड काउंट और ट्रेंडिंग स्टेटस से पता चलता है कि अन्य बिल्डर्स पहले ही इसे अपने स्टैक्स में शामिल करना शुरू कर चुके हैं। एक बात ध्यान देने योग्य है: जब इंडिपेंडेंट बेंचमार्क्स आएंगे, तो यह देखना होगा कि V4-Flash, रियल एजेंट और टूल-यूज़ वर्कलोड्स पर बड़े V4 सिबलिंग्स के खिलाफ कैसा प्रदर्शन करता है।

[16:09] Comfy-Org का सिंगल-फाइल MiniMax-H3 फाइन-ट्यून 6M डाउनलोड्स हासिल कर रहा है

एक नया ओपन-वेट रिपॉजिटरी, Comfy-Org/MiniMax-H3, 30 जुलाई को दिखाई देने के बाद Hugging Face हब पर ट्रेंड कर रहा है। इसे Comfy-Org द्वारा प्रकाशित किया गया है और इसमें "diffusion-single-file" और "comfyui" के टैग्स हैं, जिसमें base_model टैग इसे MiniMaxAI/MiniMax-H3 के फाइन-ट्यून के रूप में पहचानता है।

यह कॉम्बिनेशन बिल्डर्स को बिल्कुल स्पष्ट बताता है कि आर्टिफैक्ट क्या है: एक सेल्फ-कंटेन्ड डिफ्यूज़न चेकपॉइंट, जिसे ComfyUI वर्कफ्लो में सीधे ड्रॉप करने के लिए तैयार है, न कि मल्टी-शार्ड मॉडल रिलीज़ जिसे रीअसेंबल करने की जरूरत है। सिंगल-फाइल फॉर्मैट यहां प्रैक्टिकल डिटेल है, क्योंकि इस तरह पैकेज्ड डिफ्यूज़न चेकपॉइंट्स को सीधे लोड किया जा सकता है बिना यूज़र को अलग-अलग वेट शार्ड्स या कॉन्फ़िगरेशन स्प्लिट्स को स्टिच करने की आवश्यकता के।

पुल नंबर्स हैं जो इसे ट्रेंडिंग लिस्ट में लाए हैं। रिपॉजिटरी में छह मिलियन से अधिक डाउनलोड्स और लगभग 1,107 लाइक्स दिखाए गए हैं, जो हब लिस्टिंग के लिए एक मजबूत सिग्नल है कि लोकल इमेज-जेनरेशन यूज़र्स पहले ही इसे अपनाना शुरू कर चुके हैं। लाइसेंस "other" के रूप में सूचीबद्ध है, जिसका मतलब है कि डाउनस्ट्रीम बिल्डर्स कमर्शियल शिपिंग से पहले रिपो के लाइसेंस फाइल को पढ़ें, और region:us टैग पब्लिशर की जियोग्राफी के बारे में एक हिंट देता है।

अभी लोग इससे क्या बना सकते हैं यह सीधा है: एक लोकल ComfyUI पाइपलाइन जो MiniMax-H3 फैमिली के आउटपुट्स को एक फाइल से लोड करती है, न कि मल्टी-स्टेज डाउनलोड से। एजेंट स्टैक्स के लिए जो क्लाउड राउंड-ट्रिप के बिना इमेज-जेनरेशन लेग चाहते हैं, यह तरह का ड्रॉप है जो डेवलपर को दोपहर में इंटीग्रेशन का प्रोटोटाइप बनाने देता है।

एक बात ध्यान देने योग्य है: क्योंकि बेस MiniMaxAI/MiniMax-H3 के फाइन-ट्यून है, न कि स्क्रैच से रिलीज़, डाउनस्ट्रीम बिहेवियर पैरेंट मॉडल को ट्रैक करेगी। अपस्ट्रीम कोई ब्रेकिंग चेंज होता है तो यहां भी आएगा, इसलिए पैरेंट रिपॉजिटरी की रिलीज़ नोट्स पर नज़र रखना worth है।

[17:50] स्केल पर नॉलेज डिस्टिलेशन का एक सस्ता रास्ता

MultiverseComputingCAI द्वारा 10 अगस्त को प्रकाशित एक नया Hugging Face ब्लॉग पोस्ट बताता है कि नॉलेज डिस्टिलेशन को स्केल पर चलाने के लिए काफी सस्ता बनाया जा सकता है। नॉलेज डिस्टिलेशन एक बड़े मॉडल के आउटपुट्स की नकल करने के लिए एक छोटे मॉडल को ट्रेन करने की तकनीक है — यह तब उपयोगी है जब आप एक सस्ता, फास्ट मॉडल चाहते हैं जो फिर भी बड़े जैसा व्यवहार करे। पोस्ट का हेडलाइन फ्रेमिंग यह है कि इस तरह की ट्रेनिंग, जो सामान्यतः कम्प्यूट-हंग्री होती है, के पास अब एक अधिक सस्ता रास्ता है।

उपलब्ध सोर्स मैटेरियल में कोई चेंजलॉग नहीं, कोई बेंचमार्क नंबर नहीं, कोई पैरामीटर काउंट नहीं, और कोई स्पेसिफिक मैकेनिज्म नहीं है — केवल टाइटल itself। तो यहां जो वेरिफाइबल है वह यह है कि MultiverseComputingCAI ने Hugging Face पर एक रेसिपी-स्टाइल पोस्ट प्रकाशित की है जो डिस्टिलेशन के लिए एक सस्ते रास्ते की वकालत करती है, और इससे ज्यादा कुछ नहीं। कितना सस्ता, कितना स्केलेबल, या कौन से मॉडल्स पर यह लागू होता है, इस बारे में कोई भी दावा अनुमान होगा जब तक कि पूरी पोस्ट न पढ़ी जाए।

आज डिस्टिलेशन पाइपलाइन चलाने वाले बिल्डर्स के लिए, यह पढ़ने योग्य है कि दावा किया गया इफिशिएंसी गेन वास्तविक वर्कलोड पर लागू होता है या नहीं। किसी भी प्रोडक्शन ट्रेनिंग वर्कफ्लो को बदलने से पहले पोस्ट बॉडी में असली नंबर और मेथड देखें।

[19:01] Intel Customer Engagement को मजबूत करने और ग्रोथ को तेज करने के लिए Leadership Appointment की घोषणा करता है

SANTA CLARA, Calif., August 7, 2026 – Intel Corporation ने आज Dean Jarnac को executive vice president और chief sales officer के रूप में नियुक्ति की घोषणा की। Jarnac Intel के वैश्विक बिक्री संगठन का नेतृत्व करेंगे—Intel की ग्राहक संबंधों और अपने उत्पाद पोर्टफोलियो में client, data center, AI, networking, और ASICs के साथ go-to-market execution को मजबूत करेंगे। "ग्राहक फोकस और execution Intel की रणनीति के केंद्र में हैं..."

यह पोस्ट Intel Announces Leadership Appointment to Strengthen Customer Engagement and Accelerate Growth सबसे पहले Newsroom पर दिखी। प्राथमिक स्रोत ऊपर दिए गए विशिष्ट उत्पाद या वर्कफ्लो परिवर्तन का समर्थन करता है; यह प्रदर्शन, संगतता, या deployment के बारे में व्यापक दावों का समर्थन नहीं करता है। इस पर निर्भर होने से पहले, एक वास्तविक वर्कफ्लो के खिलाफ स्रोतित परिवर्तन का परीक्षण करें।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily