
NVIDIA Jetson Orin Nano 2 की नई सिलिकॉन पर गति दोगुनी
आज का AgentStack Daily NVIDIA के Jetson Orin Nano 2 की नई सिलिकॉन पर डबल थ्रूपुट, IBM के Granite 4.2 8B का OpenRouter पर 131K संदर्भ विंडो के साथ उपलब्ध... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-109/
🎧 Listen to Episodeएपिसोड 109 — 01 सितंबर, 2026
[00:00] एपिसोड हुक
OpenClaw ने 31 अगस्त, 2026 को v2026.8.1 शिप किया, जो एक रिलीज है जो एजेंट डेवलपर्स के लिए लंबे समय चलने वाले, मल्टी-डिवाइस और क्रेडेंशियल-संवेदनशील वर्कफ्लो को आसान बनाने पर केंद्रित है। इस रिलीज में खोजने योग्य बातचीत इतिहास, एक पुनर्निर्मित सेटिंग्स फ्लो जो मौजूदा सब्सक्रिप्शन, API कुंजियों और लोकल मॉडल का पुन: उपयोग करता है न कि नए क्रेडेंशियल मांगता है, और क्रेडेंशियल रोटेशन के लिए एक कड़ा कंट्रोल पैनल जोड़ा गया है। Hermes Agent उसी दिन v2026.8.31 के साथ लैंड हुई जिसमें सेशन निरंतरता, मल्टी-डिवाइस हैंडऑफ और डिवाइसों में क्रेडेंशियल पुन: उपयोग में समान सुधार हैं। सेटअप समय ध्यान देने योग्य रूप से गिरता है और दोनों रिलीज में क्रेडेंशियल हैंडलिंग स्वच्छ हो जाती है। ये दोनों एक ही दिन आते हैं क्योंकि घंटों और हार्डवेयर में चलने वाले एजेंटों को स्टेटफुल निरंतरता की आवश्यकता है, और टूलिंग जो मध्य-सेशन में टूट जाती है वह अब स्वीकार्य नहीं है क्योंकि एजेंट प्रोडक्शन वर्कफ्लो में अधिक एम्बेडेड हो रहे हैं।
[02:00] एजेंट स्टैक रिलीज रीडआउट: OpenClaw v2026.8.1; Hermes Agent v2026.8.31
OpenClaw ने 31 अगस्त को v2026.8.1 शिप किया जिसमें परिवर्तनों का एक सेट है जो Gateway को फ्लैशियर की तुलना में दैनिक उपयोग में अधिक उपयोगी बनाता है। सबसे उपयोगकर्ता-दृश्य जीत खोजने योग्य इतिहास है: आप अब सटीक शब्दों या वाक्यांशों द्वारा दृश्य बातचीत टेक्स्ट खोज सकते हैं और मिलान परिणाम से आसपास के संदेश फिर से खोल सकते हैं, यह योगदानकर्ता @hercial61 के लिए धन्यवाद है।
बड़ा इन्फ्रास्ट्रक्चर शिफ्ट "Gateway से परे सेशन" है, जो आपको पेयर्ड डिवाइस या क्लाउड वर्कर्स पर काम चलाने, सेशन वर्कस्पेस को उसके साथ ले जाने और बाद के क्लाउड सेशन के लिए वार्म मशीनों और प्रोजेक्ट सीड्स का पुन: उपयोग करने देता है। व्यवहार में, इसका मतलब है कि एक लंबे समय चलने वाला बिल्ड या रिसर्च टास्क आपके लैपटॉप पर रुक सकता है और बिना अपना स्थान खोए एक बड़े क्लाउड वर्कर पर फिर से शुरू हो सकता है।
दो एडिशन कंट्रोल और प्राइवेसी जोड़ते हैं। प्राइवेट क्रेडेंशियल रिक्वेस्ट आपके एजेंट को एक मास्क्ड प्रॉम्प्ट के माध्यम से सीक्रेट के लिए पूछने देती हैं जो चैट में या मॉडल स्वयं के लिए कभी वैल्यू एक्सपोज नहीं करता, एक ऑप्ट-इन प्रॉक्सी के साथ जो केवल उन गंतव्यों के लिए प्रोटेक्टेड-सीक्रेट सब्सटीट्यूशन की अनुमति देता है जिन्हें आपने स्वीकृत किया है। और अब आप एक बार रिकरिंग वर्क को मंजूर कर सकते हैं: किसी ऑटोमेशन को सटीक ऑपरेशन के लिए अनुमति दें, बाद में उस अनुमति का निरीक्षण करें या रद्द करें, और जब भी जॉब या ऑपरेशन बदले तो ताजा अनुमति की आवश्यकता करें।
एक ब्रेकिंग चेंज भी है जो ध्यान देने योग्य है। बंडल किया गया OpenProse प्लगइन और /prose कमांड हटा दिया गया है। openclaw doctor --fix चलाने से पुराना कॉन्फ़िगरेशन साफ होता है और अपस्ट्रीम Agent Skill माइग्रेशन की ओर पॉइंट करता है। मौजूदा .prose सोर्स फाइलें रखी जाती हैं, इसलिए प्रोज़ वर्क स्वयं गायब नहीं होता, लेकिन सरफेस एरिया चला गया।
अन्य हाइलाइट्स: एक ड्यूरेबल सेशन प्रोग्रेस कार्ड जो रीलोड को सurvives करता है और वेब और नेटिव चैट में सबएजेंट एक्टिविटी और एडिट को ट्रैक करता है; स्ट्रक्चर्ड एजेंट प्रश्न कार्ड, बटन या प्लेन टेक्स्ट के माध्यम से स्किप विकल्प के साथ उत्तरित; इन-चैट विजेट जिन्हें सेशन डैशबोर्ड पर पिन किया जा सकता है और इमेज के रूप में एक्सपोर्ट किया जा सकता है; और अमीर ऑडियो और वीडियो हैंडलिंग, Apple और Android क्लाइंट पर वीडियो अपलोड के साथ नेटिव प्लेबैक कंट्रोल सहित।
v2026.8.1 का आकार कम रफ एज और अधिक ड्यूरेबल सेशन है। अगर आप लंबे समय चलने वाले या मल्टी-डिवाइस वर्कफ्लो पर रोक लगाए हुए हैं, तो यह रिलीज फिर से देखने की है।
[03:19] IBM का Granite 4.2 8B OpenRouter पर 131K context के साथ लॉन्च
IBM ने OpenRouter पर Granite 4.2 8B जोड़ा है, जो इसके कॉम्पैक्ट reasoning मॉडल को ecosystem में किसी भी बिल्डर के लिए एक API कॉल दूर रखता है। मॉडल ibm-granite/granite-4.2-8b के तहत सूचीबद्ध है और 131,072-token context window के साथ आता है — substantial codebases, long documents, या extended multi-turn agent traces के लिए पर्याप्त जगह, जब तक कि कुछ summarized नहीं होना पड़े।
Granite 4.2 8B एक dense model है, meaning हर parameter हर forward pass पर उपयोग किया जाता है, mixture-of-experts structure के बजाय। IBM इसे mathematics, code generation, multilingual dialogue, और agentic workflows के लिए positioning कर रहा है जिन्हें multi-step reasoning की जरूरत है, और listing configurable reasoning effort के लिए support की पुष्टि करती है, जिसमें full और low-effort दोनों modes शामिल हैं। यह toggle मायने रखता है: एक builder एक कठिन math problem पर deeper reasoning मांग सकता है, फिर उसी agent के भीतर सस्ते classification या routing calls के लिए low-effort पर जा सकता है।
Builders के लिए, practical shape सीधी है। जो कुछ भी currently एक mid-size open reasoning model को जा रहा है — chain-of-thought math, structured code generation, multilingual chat — वह अब OpenRouter पर Granite 4.2 8B के माध्यम से route करने का candidate है। 131K context उन tasks को खोलता है जहां entire input बस छोटी windows में fit नहीं होती, जैसे एक whole repository plus issue description को एक prompt में डालना।
ध्यान देने वाली एक बात: कैसे Granite 4.2 8B same scale के peers के खिलाफ standard reasoning benchmarks पर perform करता है। 4,096 max output token ceiling और long context window के साथ, model agent loops के लिए बना दिखता है जहां input भारी है और reasoning bounded है — production pipeline में swap करने से पहले एक benchmark run worth है।
[05:00] A Voice-Agent Latency Benchmark That Labels Its Own Numbers
30 अगस्त, 2026 को MarkTechPost पर पोस्ट किया गया एक नया benchmark inference APIs को latency microscope के तहत रखता है जो voice और realtime agents पर सीधे निशाना साधता है। Premise स्पष्ट है: voice agents latency पर long before they break on intelligence टूट जाती हैं, और time to first token — prompt भेजने और output का पहला टुकड़ा वापस पाने के बीच का अंतर — वह number है जिसकी ओर most teams पहले पहुंचते हैं। लेखक तर्क देता है कि TTFT providers की तुलना शुरू करने के लिए सही जगह है लेकिन वहां रुकने के लिए गलत।
Benchmark का coverage voice stack में हर layer को शामिल करता है, सिर्फ LLM को नहीं। यह speech-to-text, text-to-speech, और direct speech-to-speech paths के माध्यम से language model के साथ-साथ चलता है, ताकि एक builder देख सके कि पूरे pipeline में delays कहां जमा हो सकती हैं। हर latency figure provenance द्वारा भी tagged है, जिसमें numbers independently measured, vendor-published, या vendor-measured on the vendor's own product के रूप में marked हैं। वह distiction मायने रखता है: एक API बेचने वाली कंपनी द्वारा रिपोर्ट किया गया TTFT और एक neutral third party द्वारा gemessen TTFT same claim नहीं है, भले ही slide पर milliseconds समान दिखें।
Builders के लिए, practical takeaway यह है कि TTFT एक useful starting filter है लेकिन अकेले में ही rarely पर्याप्त है। Benchmark का labeling scheme readers को actually trust करने वाली measurement category के लिए filter करने देता है, इससे पहले कि वे provider pick करें, और four-layer sweep दिखाता है कि latency उन जगहों पर छिप सकता है जहां एक single-metric dashboard कभी surface नहीं करेगी।
[06:29] Meta का Muse Code beta से बाहर आया, custom agents के लिए SDK के साथ
Meta का Muse Code आज अपने प्रयोगात्मक चरण से बाहर आ गया, और बिल्डर्स के लिए मुख्य बात यह है कि इस बार यह एक असली SDK के साथ-साथ सब्सक्रिप्शन प्लान के साथ आया है। अब तक, Muse Code तक पहुंच सीमित और नियंत्रित थी; इस रिलीज़ से यह एक अधिक पारंपरिक डेवलपर सतह बन जाती है।
मुख्य बात SDK है। यह एजेंट रनटाइम को एक्सपोज करता है ताकि डेवलपर्स सीधे कस्टम एजेंट एम्बेड कर सकें और बाहरी टूल्स को जोड़ सकें, बजाय इसके कि वे जो कुछ भी Meta डिफ़ॉल्ट में देता है उस तक सीमित रहें। यह Muse Code को एक बंद प्रयोग से एक प्लेटफॉर्म में बदल देता है जिस पर आप कोई प्रोडक्ट बना सकते हैं।
SDK के साथ-साथ, नया सब्सक्रिप्शन टायर उस पहुंच के साथ व्यावसायिक शर्तें जोड़ता है — तो यह सिर्फ एक फ्री प्रीव्यू नहीं है, यह एक पेड प्रोडक्ट की ओर एक रास्ता है जिसके साथ सपोर्ट और उपयोग अधिकार हैं जिनकी आप योजना बना सकते हैं। कस्टम एजेंट अब एम्बेड किए जा सकते हैं, टूल कॉल्स इंटीग्रेट किए जा सकते हैं, और इसके नीचे एक प्राइसिंग सतह है।
उन बिल्डर्स के लिए जो Meta के स्टैक पर कस्टम एजेंट शिप करने के लिए एक स्थिर रास्ते का इंतज़ार कर रहे थे, यही वह पल है। प्रयोगात्मक अस्वीकरण गायब है, और अब एक असली टूल इंटीग्रेशन स्टोरी है। आगे देखने वाली बात यह है कि Meta स्केल पर उपयोग की कीमत कैसे तय करता है और क्या तीसरे पक्ष के एजेंट SDK बाहरी हाथों में आने के बाद महत्वपूर्ण संख्या में दिखने लगते हैं।
[07:54] OpenClaw 2.0 आया है जिसमें तेज़ सेटअप और एक स्पष्ट सुरक्षा कहानी है
OpenClaw Foundation ने 31 अगस्त को OpenClaw 2.0 शिप किया, जो v2026.8.1 टैग किया गया, और योगदानकर्ता संख्याएं अपने आप में कहानी बताती हैं: 933 योगदानकर्ता, जिनमें से 569 पहली बार करने वाले थे, और 16,000 से अधिक पुल रिक्वेस्ट मर्ज किए गए, जो इस प्रोजेक्ट ने अब तक स्वीकृत हर PR का लगभग आधा है।
उपयोगकर्ता-सामने के बदलाव अधिक ठोस हैं। सेटअप अब मौजूदा सब्सक्रिप्शन, API कुंजियाँ और स्थानीय मॉडल को पुनः उपयोग करता है, जिससे आपको शुरू से क्रेडेंशियल फिर से कॉन्फ़िगर नहीं करने को कहा जाता। पुनर्निर्मित Control UI टेस्ट-हार्नेस स्टार्टअप को लगभग 1.6 सेकंड से घटाकर 575 मिलीसेकंड करता है, जो छोटा लगता है जब तक आप दिन में दर्जनों बार पैनल लॉन्च और रीलॉन्च नहीं कर रहे।
शेयर्ड क्लाउड सेशंस असली मल्टीप्लेयर जोड़ते हैं ताकि कई लोग एक ही स्पेस में काम कर सकें, लेकिन डॉक्स एक स्पष्ट रेखा खींचते हैं: वे सेशंस सुरक्षा सीमा नहीं हैं। अनुमतियाँ अभी भी एक गेटवे के माध्यम से चलती हैं, और विश्वास तय करने का एकमात्र स्थान वही है।
बिल्डर्स के लिए, यह संयोजन तेज़ इटरेशन लूप और नए साथियों के लिए आसान ऑनबोर्डिंग पथ का मतलब है, बिना सुरक्षा मॉडल के नीचे बदलाव के।
[08:57] Lightricks' LTX-2.5 एक मल्टी-मॉडल वीडियो वर्कहॉर्स के रूप में ट्रेंडिंग है
Lightricks का LTX-2.5 Hugging Face पर ट्रेंड कर रहा है, और आंकड़े बयां बयां कर रहे हैं — 23 जुलाई को रिपॉजिटरी बनाने के बाद से 12 लाख से अधिक डाउनलोड, साथ ही 2,400 से अधिक लाइक। इस मॉडल में एक सिंगल डिफ्यूजन चेकपॉइंट के लिए क्षमता टैग की व्यापक श्रेणी है: इमेज-टू-वीडियो, टेक्स्ट-टू-वीडियो, वीडियो-टू-वीडियो, इमेज-टेक्स्ट-टू-वीडियो, ऑडियो-टू-वीडियो, टेक्स्ट-टू-ऑडियो, और वीडियो-टू-ऑडियो। व्यावहारिक रूप से, वही वेट एक स्टिल इमेज, टेक्स्ट प्रॉम्प्ट, या दूसरी क्लिप से वीडियो जनरेशन चला सकते हैं, और ऑडियो जनरेशन भी इसमें शामिल है बजाय अलग मॉडल में रहने के।
Lightricks ने वीडियो क्रिएशन के लिए LTX लाइन बनाई, और यह रिलीज इतनी जल्दी ट्रेंडिंग लीडरबोर्ड पर आई यह सुझाव देती है कि ओपन-वेट कम्युनिटी इसे सेल्फ-होस्टेड पाइपलाइन के लिए अपना रही है। एजेंट या क्रिएटर वर्कफ्लो के लिए लोकल इन्फरेंस स्टैक चलाने वाले बिल्डर्स एक मॉडल खींच सकते हैं जो कई वीडियो और ऑडियो टास्क कवर करता है अलग चेकपॉइंट स्टिच करने की बजाय। एक कंसोलिडेटेड लोकल पाइपलाइन मेंटेन करना आसान है, और डाउनलोड नंबर सुझाव देते हैं कि लोग अपने GPU से वोट कर रहे हैं।
यह देखना दिलचस्प है कि कम्युनिटी वास्तव में क्या शिप करती है जब ऑडियो-वीडियो पेयरिंग को रियल प्रोडक्शन वर्कफ्लो में टेस्ट किया जाता है डेमो क्लिप की जगह।
[10:07] Anthropic का MHS Standard AI Agents को Lab Hardware को सुरक्षित रूप से ऑपरेट करने देता है
Anthropic Model Hardware Standard, या MHS नामक एक चीज खोल रहा है — एक शेयर्ड ड्राइवर स्पेसिफिकेशन जो AI agents को लेज़र, रिएक्टर, और बेंच-टॉप इंस्ट्रूमेंट जैसे फिजिकल डिवाइस को सुरक्षित रूप से ऑपरेट करने देता है। कोर क्लेम सीधी है: इंस्ट्रूमेंट इंटीग्रेशन जो पहले लैब्स को हफ्तों या महीनों लगती थी अब घंटों में गिर सकती है।
दो शुरुआती आंकड़े प्रीव्यू को बांधते हैं। Carnegie Mellon के रिसर्चर्स के मुताबिक, कच्चे उपकरण लेकर आए और आठ घंटे में तैयार dose-response curve लेकर निकल गए। QuEra पर, लेजर relock प्रोसीजर की सक्सेस रेट 700 ट्रायल में 58 प्रतिशत से 99.3 प्रतिशत चढ़ गई, उस वर्कफ्लो को MHS-संगत ड्राइवर पर शिफ्ट करने के बाद।
दिलचस्प डिज़ाइन चॉइस यह है कि सेफ्टी कहां रहती है। MHS मॉडल-अग्नोस्टिक है और MCP पर पहुंची जा सकती है, वही प्लंबिंग जो agents पहले से टूल कॉल करने और फाइलें पढ़ने के लिए उपयोग करते हैं। सेफ्टी लिमिट्स खुद डिवाइस ड्राइवर के अंदर रहती हैं एजेंट को बताने वाले प्रॉम्प्ट में नहीं, ताकि मॉडल की गलती हार्डवेयर द्वारा रोकी जा सके before it can cause damage। यह शिफ्ट ही कैजुअल लैब डेमो को कुछ बनाती है जिस पर रिसर्चर्स और ऑपरेटर्स वास्तव में भरोसा कर सकें।
बिल्डर्स के लिए, व्यावहारिक टेकअवे यह है कि लैब और डिवाइस टीमों के पास अब एक कैंडिडेट स्टैंडर्ड है जिसके आसपास एकजुट होना है। फिजिकल इंस्ट्रूमेंट को AI के साथ इंटीग्रेट करने वाले किसी को भी देखना चाहिए कि कौन से वेंडर्स MHS-कम्प्लायंट ड्राइवर शिप करते हैं, और तय करना चाहिए कि ड्राइवर-लेवल गार्डरेल अपनी मौजूदा रिव्यू स्टैक के साथ कहां फिट होते हैं। अगली चीज देखना यह है कि क्या अधिक इंस्ट्रूमेंट मेकर्स प्रीव्यू में शामिल होते हैं, क्योंकि MHS तभी उपयोगी बनता है जब सपोर्टेड डिवाइस की कैटलॉग वास्तव में बढ़ती है।
[11:43] एक NVIDIA Earth2Studio ट्यूटोरियल वेदर मॉडल को Wind-Power Forecasts में बदलता है
29 अगस्त को प्रकाशित एक नया ट्यूटोरियल Google Colab नोटबुक में NVIDIA Earth2Studio के साथ बैच्ड एन्सेम्बल वेदर फोरकास्ट चलाने की प्रक्रिया बताता है। व्यावहारिक पेचीदगी Earth2Studio के कंपोनेंट इंस्टॉल करने में है Colab के मौजूदा CUDA-इनेबल्ड PyTorch सेटअप को तोड़े बिना — एक परिचित परेशानी उनके लिए जिन्होंने मैनेज्ड एनवायरनमेंट के ऊपर डोमेन टूलकिट लेयर करने की कोशिश की है।
एक बार इंस्टॉल करने के बाद, वर्कफ़्लो NVIDIA के FCN प्रॉग्नॉस्टिक मॉडल को लोड करता है और GFS, U.S. ग्लोबल फोरकास्ट सिस्टम से वायुमंडलीय प्रारंभिक स्थितियां प्राप्त करता है। एकल निर्धारक पूर्वानुमान उत्पन्न करने के बजाय, यह एन्सेम्बल जेनरेट करने के लिए विवर्तित प्रारंभिक स्थितियों के साथ मॉडल को कई बार चलाता है — एक उत्तर के बजाय संभावित भविष्यों का एक बंडल। यह संरचना किसी भी चीज़ के लिए मायने रखती है जहां अनिश्चितता हेडलाइन नंबर से अधिक मायने रखती है।
ट्यूटोरियल फिर एक कस्टम विंड-पावर डायग्नोस्टिक परत करता है। यह प्रत्येक एन्सेम्बल सदस्य से 10-मीटर विंड घटक लेता है और उन्हें टरबाइन कैपेसिटी फैक्टर्स में बदल देता है — मूल रूप से, हवा उस पल में विंड फार्म की रेटेड आउटपुट का कितना अंश वास्तव में उत्पन्न करेगी। परिणाम विंड पावर आउटपुट का संभावना वितरण है, न कि केवल एक एकल विंड स्पीड रीडिंग।
यह पैटर्न सामान्यीकृत होता है। एक बिल्डर अपना खुद का डायग्नोस्टिक लिख सकता है — सोलर इरिडियंस से पैनल आउटपुट, वर्षा से बाढ़ जोखिम, तापमान से ग्रिड मांग — और फोरकास्टिंग पाइपलाइन को फिर से बनाए बिना एन्सेम्बल में इसे जोड़ सकता है। Earth2Studio बैच्ड एक्जीक्यूशन को हैंडल करता है, इसलिए कस्टम कोड को केवल वायुमंडलीय चर पढ़ने और उन्हें उन इकाइयों में बदलने की आवश्यकता होती है जो किसी डोमेन विशेषज्ञ के लिए मायने रखती हैं।
एक बात ध्यान देने योग्य है: जैसे-जैसे अधिक कस्टम डायग्नोस्टिक साझा किए जाते हैं, टूलकिट ऊर्जा, कृषि, और अवसंरचना टीमों के लिए एक सामान्य-उद्देश्य वायुमंडलीय-से-निर्णय परत में विकसित हो सकता है जिन्हें बिंदु पूर्वानुमानों से अधिक संभाव्य पूर्वानुमानों की आवश्यकता होती है।
[13:29] OpenAI कैलिफोर्निया बिल पर किशोर AI सुरक्षा उपायों का समर्थन करता है
OpenAI ने सार्वजनिक रूप से California SB 1119 का समर्थन किया, एक राज्य बिल जिसका उद्देश्य किशोरों के लिए जो AI उत्पादों का उपयोग करते हैं उनके लिए उम्र-उपयुक्त सुरक्षा उपाय बनाना है। 31 अगस्त की तारीख वाली घोषणा में विधायन को एक सावधानीपूर्ण संतुलन के रूप में प्रस्तुत किया गया है: युवा उपयोगकर्ताओं की सुरक्षा करना जबकि उनकी इन उपकरणों के साथ सीखने, बनाने और खोज करने की क्षमता को संरक्षित रखना।
यह समर्थन मायने रखता है क्योंकि यह सबसे बड़ी AI कंपनियों में से एक को एक विशिष्ट युवा सुरक्षा ढांचे का समर्थन करते हुए रिकॉर्ड पर रखता है, न कि इसका विरोध करते हुए। एक ऐसी इंडस्ट्री के लिए जो अक्सर नियमन के खिलाफ रही है, एक बिल का सार्वजनिक समर्थन, भले ही यह एक संकीर्ण आबादी पर केंद्रित हो, यह संकेत देता है कि OpenAI का मानना है कि नियामक फर्श कहां होनी चाहिए: किशोरों के प्रवेश पर व्यापक प्रतिबंध के बजाय उम्र-उपयुक्त सुरक्षा उपाय।
बिल्डर्स के लिए, व्यावहारिक निहितार्थ यह है कि उम्र-उपयुक्त डिज़ाइन एक स्वैच्छिक सर्वोत्तम अभ्यास से कैलिफोर्निया में राज्य-स्तरीय अपेक्षा के करीब आ रहा है। जो उत्पाद किशोर उपयोगकर्ताओं तक पहुंचते हैं, उन्हें संभवतः डिफ़ॉल्ट सुरक्षा उपायों और छोटे उपयोगकर्ताओं के खातों को कैसे संभाला जाता है, इसके बारे में स्पष्ट अपेक्षाओं का सामना करना होगा, भले ही विशिष्टताएं विधायी प्रक्रिया में बाद में आएं।
एक बात देखने योग्य है कि SB 1119 कैलिफोर्निया विधानमंडल में कैसे आगे बढ़ता है और अंततः इसके सुरक्षा उपाय किस रूप में आते हैं। विधेयक के तंत्र, उम्र-उपयुक्त क्या गिना जाता है से लेकर कौन से उत्पाद इसके दायरे में आते हैं और अनुपालन कैसे मापा जाता है, यह निर्धारित करेगा कि OpenAI का समर्थन राज्य में संचालित AI डेवलपर्स के लिए ठोस दायित्वों में परिवर्तित होता है या नहीं।
[14:52] शोध डाइजेस्ट: सेल्फ-इम्प्रूविंग AI सबसे मानवीय कदम पर विफल: यह जानना कि क्या सीखना है
जब आप एक AI को भौतिकी अनुसंधान में बेहतर होने के लिए कहते हैं, तो यह वास्तव में क्या करता है? ASPIRE नामक एक नया बेंचमार्क परीक्षण करता है कि क्या AI एजेंट इस तरह के अस्पष्ट लक्ष्यों से स्वयं-सुधार कर सकते हैं, जिसमें वास्तविक मूल्यांकन एजेंट से छिपा रहता है। निष्कर्ष निराशाजनक है: एजेंट प्रशिक्षण लूप चलाने और अपने स्वयं के स्कैफोल्डिंग को संपादित करने में ठीक हैं, लेकिन वे लगातार गलत प्रशिक्षण डेटा चुनते हैं और संकीर्ण स्व-परीक्षणों पर भरोसा करते हैं जो वास्तविक प्रगति को प्रतिबिंबित नहीं करते। वेट-स्तर के लाभ दुर्लभ और अस्थिर हैं, और सबसे अच्छा स्व-विकसित सेटअप अभी भी एक हाथ से डिज़ाइन किए गए संदर्भ से पीछे रहता है। स्थानीय सुधार कभी-कभी प्रशिक्षण जारी रहने पर गायब हो जाते हैं। बिल्डर्स के लिए निहितार्थ यह है कि स्व-सुधार कम्प्यूट या आर्किटेक्चर से अवरुद्ध नहीं है। यह लक्ष्य व्याख्या से अवरुद्ध है। एक एजेंट जो 'बेहतर भौतिकविद' का अर्थ नहीं समझता, प्रशिक्षण डेटा के माध्यम से पीसता रहेगा बिना वास्तव में प्रगति किए। स्वायत्त शिक्षण प्रणालियों के निर्माण के लिए, पाठ यह है कि स्व-विकास का सबसे कठिन हिस्सा सीखने का कदम नहीं है। यह तय करना है कि पहले सीखने के लिए क्या है।
[15:53] NEEDLE Benchmark हर घंटे वेब खोज क्वेरी को फिर से बनाता है तोकिंग को रोकने के लिए
एक खोज एजेंट, अन्य बातों के अलावा, एक प्रोग्राम है जो जानता है कि वेबपेज कैसे फेच करना है। यह सामान्य बेंचमार्क को नरम लक्ष्य बना देता है। किसी सार्वजनिक URL पर एक स्थिर प्रश्न-उत्तर फ़ाइल छोड़ दें, और एक चतुर एजेंट उत्तर कुंजी डाउनलोड कर सकता है, उसे वापस दोहरा सकता है, और बिना कुछ वास्तव में प्राप्त किए एक परिपूर्ण पुनर्प्राप्त स्कोर पोस्ट कर सकता है। NEEDLE टीम का सीधा तर्क है: अगर स्वर्ण लेबल किसी सार्वजनिक डेटासेट में हैं, तो एजेंट मूल्यांकन के बीच में उन्हें ले सकता है और पूरी तरह से पुनर्प्राप्त छोड़ सकता है।
इस सप्ताह Keenable AI द्वारा ओपन-सोर्स किया गया NEEDLE उस छेद पर हमला करता है हर घंटे अपनी क्वेरी सेट को फिर से बनाकर। प्रश्नों के कम अंतराल पर पुनर्जनित होने पर, सार्वजनिक वेब पर कोई विहित फ़ाइल नहीं होती जिसे एजेंट मemorize या स्क्रैप कर सके। एक मॉडल जो अच्छा स्कोर करना चाहता है, उसे लाइव वेब पर अपने खोज टूल को इंगित करना होगा और ताजी सामग्री पर तर्क करना होगा, जो लीडरबोर्ड को गेम करना बहुत कठिन बनाता है।
व्यावहारिक प्रभाव रिट्रीवल-ऑगमेंटेड या एजेंटिक खोज शिप करने वाले किसी भी व्यक्ति पर पड़ता है। स्थिर मूल्यांकन सेट चुपचाप फुलाने योग्य रहे हैं, क्योंकि परीक्षण сами सार्वजनिक वेब पर रहते हैं जिसे एजेंट क्रॉल कर सकते हैं। NEEDLE-शैली रोटेशन बेंचमार्क स्कोर को ईमानदार प्रदर्शन के करीब लाता है और खोज एजेंटों की तुलना करते समय बिल्डर्स को एक अधिक विश्वसनीय मानक देता है। अगले लिए देखना: क्या अन्य बेंचमार्क लेखक प्रति-घंटा रिफ्रेश पैटर्न कॉपी करते हैं, और क्या मॉडल विक्रेता अपने मॉडल कार्ड में NEEDLE नंबर प्रकाशित करना शुरू करते हैं।
[17:19] Google's EnvHarness स्थिर एजेंट बेंचमार्क को स्व-सुधार प्रशिक्षण दुनिया में बदल देता है
Google Cloud AI Research, वाशिंगटन यूनिवर्सिटी इन सेंट लुई और UNC चैपल हिल के साथ मिलकर, Apache-2.0 के तहत EnvHarness जारी किया है — एक पतली रैपर परत जो एक स्थिर एजेंट बेंचमार्क लेती है और इसे नीति के प्रशिक्षण के रूप में अनुकूली बनाती है। बिंदु सरल है: एक बार बेंचमार्क में महारत हासिल हो जाए, यह सिखाना बंद कर देता है, इसलिए प्रशिक्षण लूप संकेत खो देता है।
EnvHarness एक फ्रोजन वातावरण और प्रशिक्षु एजेंट के बीच बैठता है, मानक reset()/step() इंटरफ़ेस बोलता है जिसकी मौजूदा एजेंट कोड पहले से अपेक्षा है। कार्य और मानव-निर्मित वेरिफायर अछूते छोड़ दिए जाते हैं। जो बदलता है वह उनके चारों ओर की रैपर है, जो यह फिर से आकार दे सकती है कि एजेंट क्या देखता है और प्रत्येक रीसेट पर सफलता के रूप में क्या गिना जाता है।
रैपर स्वयं एक LLM द्वारा लिखा गया है जिसे EnvRigger कहा जाता है। यह एजेंट के रोलआउट देखता है, निदान करता है कि नीति कहां विफल हो रही है या ठहराव आ रहा है, और नई रैपर्स लिखता है जो उन विशिष्ट अंतरालों को लक्षित करके नई प्रशिक्षण कौशल खोदती हैं। प्रभावी रूप से, बेंचमार्क एक पाठ्यक्रम बन जाता है जो मांग पर � exactly वहीं कठिन हो जाता है जहां एजेंट सबसे कमज़ोर है।
संख्याएं पांच बेंचमार्क से आती हैं। इस प्रक्रिया के माध्यम से खोदे गए कौशल ने हेल्ड-आउट टास्क स्कोर में 9.0 अंकों तक की वृद्धि की, और परिणामी नीतियों ने 9.8% कम निष्पादन चरणों में उन्हें पहुंचाया। बेहतर जनरलाइज़ेशन और छोटे ट्रैजेक्टरी एजेंट पाठ्यक्रम के लिए उपयोगी परिणामों की जोड़ी है।
निर्माताओं के लिए, व्यावहारिक बदलाव यह है कि आप एक प्रशिक्षण लूप को पहले से विश्वसनीय बेंचमार्क की ओर इंगित कर सकते हैं और अगले दौर की निगरानी स्वयं उत्पन्न करने दें, बजाय कि खुद कठिन कार्यों को हाथ से लिखने के। खुला प्रश्न यह है कि EnvRigger के रैपर यहां उपयोग किए गए पांच बेंचमार्क से परे कितनी अच्छी तरह सामान्यीकृत करते हैं, और क्या मौजूदा एजेंट हार्नेस सीधे इस परत को अपनाएंगे।
[19:02] रिसर्च डाइजेस्ट: PaperGym AI को वास्तविक पेपर पढ़कर प्लान करना सिखाता है
PaperGym नामक एक नया फ्रेमवर्क AI सिस्टम को वैज्ञानिक अनुसंधान की योजना बनाना सिखाने के लिए एक ताजा दृष्टिकोण अपनाता है। प्लानिंग वह हिस्सा है जहां एक रिसर्च असिस्टेंट तय करता है कि कौन से प्रयोग चलाने हैं और क्यों, और शोधकर्ता इसे किसी भी AI वैज्ञानिक का निर्णायक कौशल मानते हैं। समस्या यह है कि कोई एक सही उत्तर नहीं है, इसलिए यह बताना मुश्किल है कि AI की योजना कितनी अच्छी थी।
PaperGym की अंतर्दृष्टि वास्तविक पेपर की संरचना को प्रशिक्षण मैदान के रूप में उपयोग करना है। यह पेपर के बताए गए उद्देश्य और पृष्ठभूमि से प्रश्न निकालता है, फिर तरीकों और प्रयोगों से निर्णय मानदंड निकालता है, दोनों हिस्सों को अलग रखता है ताकि मॉडल सिर्फ अंक कमाने के लिए पेपर को पैराफ्रेज न कर सके। इस तरह प्रशिक्षित, एक 8-बिलियन-पैरामीटर Qwen3 मॉडल ने ResearchQA बेंचमार्क पर 73.48 प्राप्त किया, जो बहुत बड़े Kimi K2.6 को हराया। टीम ने पाइपलाइन और 20,000 पेपर का कोरपस जारी किया ताकि अन्य समूह उसी सेटअप पर रिसर्च-प्लानिंग असिस्टेंट को प्रशिक्षित कर सकें।
[20:02] NVIDIA का Jetson Orin Nano 2 नई सिलिकॉन पैक करता है, स्पीड दोगुनी करता है
NVIDIA ने Jetson Orin Nano 2 नामक एक नया एंट्री-लेवल एज AI बोर्ड की घोषणा की है। मुख्य दावा सरल है: कंपनी का कहना है कि यह जिस Jetson Orin Nano को बदल रहा है उससे दोगुना तेज है, और यह बोर्ड के केंद्र में पिछले चिप का पुनः उपयोग करने के बजाय एक पूर्ण नया Orin सिस्टम-ऑन-चिप लगाकर इसे प्राप्त करता है।
यह पोजिशनिंग इसलिए मायने रखती है क्योंकि मूल Orin Nano एज पर इंफरेंस चलाने वाले किसी भी व्यक्ति के लिए डिफ़ॉल्ट बजट विकल्प रहा है। उसी स्तर पर थ्रूपुट दोगुना करना मौजूदा प्रोजेक्ट्स के लिए एक महत्वपूर्ण अपग्रेड पाथ का मतलब है, और नई सिलिकॉन एंट्री-लेवल बोर्ड के लिए छत को ऊपर उठाती है।
नया SoC Ampere आर्किटेक्चर पर बना है, जिस पर NVIDIA ने मूल Orin लाइन में उपयोग किया था, लेकिन यह इस स्लॉट के लिए एक ताजा चिप है, पुनर्चक्रित भाग नहीं। NVIDIA ने अभी तक घोषणा में पर-वर्कलोड बेंचमार्क संख्याएं प्रकाशित नहीं की हैं, इसलिए "दोगुना तेज" का दावा फिलहाल कंपनी के अपने फ्रेमिंग पर टिका है बजाय स्वतंत्र माप के। यह विवरण देखने योग्य है क्योंकि dev kit शिप होती है और तृतीय पक्ष इसे वास्तविक वर्कलोड से गुजारते हैं।
जिन निर्माताओं के पास पहले से मैदान में Nano-आधारित डिज़ाइन है, व्यावहारिक सवाल यह है कि नया SoC सॉफ्टवेयर रीट्यूनिंग की मांग करता है या ड्रॉप-इन की तरह व्यवहार करता है। किसी भी तरह, लाइनअप का एंट्री-लेवल प्राइस-टू-परफॉर्मेंस पॉइंट अभी बदल गया है, और जो भी प्रोजेक्ट वर्तमान में पुराने Nano को स्पेसिफाई कर रहा है वह इस बोर्ड के विरुद्ध दूसरी नजर से देखने योग्य है।