
AgentStack Daily: OpenAI ChatGPT और Codex को व्यावसायिक परिणामों से जोड़ने हेतु एनालिटिक्स पिच करता है
OpenAI ने ChatGPT और Codex को व्यावसायिक परिणामों से जोड़ने के लिए एनालिटिक्स पेश किया, GitHub Copilot के 14 सितंबर बैच में मॉडल विकल्प, Sentry हुक और एडमिन... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-115/
🎧 Listen to Episodeएपिसोड 115 — 19 सितंबर, 2026
[00:00] एपिसोड हुक
OpenAI Pitches Analytics to Tie ChatGPT and Codex to Business Outcomes शीर्षक एक घनी चक्र को समेटता है। GitHub Copilot का 14 सितंबर का बैच मॉडल विकल्प, Sentry hook और एडमिन टूल जोड़ता है, Linkup Releases Open Sparse Embedder SPARSEUP for Fast Retrieval, OpenAI Used Its Own Models to Design a Chip Called Jalapeño एपिसोड की शुरुआत पूरी करते हैं, जिसके बाद मॉडल, टूलिंग और उनके पीछे की इन्फ्रास्ट्रक्चर पर गहराई से चर्चा होती है। हर कहानी को एक जैसा व्यवहार मिलता है — क्या आया, उसके पीछे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।
[02:00] OpenAI Pitches Analytics to Tie ChatGPT and Codex to Business Outcomes
OpenAI ने 16 सितंबर को व्यापार टीमों के लिए एक how-to गाइड प्रकाशित की, जो दो उत्पादों — ChatGPT Work और Codex analytics — पर निर्भर करती है, जो AI अपनाने को मापनीय परिणामों से जोड़ने का तंत्र है। यह फ्रेमिंग उपयोग डेटा को व्यक्तिगत उत्पादकता और निरंतर AI निवेश के लिए व्यापार मामले के बीच की परत के रूप में स्थापित करती है।
गाइड एनालिटिक्स के लिए तीन ठोस उपयोगों को उजागर करती है: यह समझना कि टीमें वास्तव में उपकरणों का उपयोग कैसे कर रही हैं, उस उपयोग के खिलाफ खर्च को ट्रैक करना, और यह पहचानना कि कहां कर्मचारियों को अधिक मूल्य पाने के लिए प्रशिक्षण की आवश्यकता है। लक्ष्य अपनाने को ऐसी भाषा में बदलना है जिस पर नेतृत्व कार्य कर सके, न कि इसे अस्पष्ट उत्पादकता कहानी पर छोड़ देना।
बिल्डर्स और टीम लीडर्स के लिए, व्यावहारिक निहितार्थ यह है कि OpenAI अब आंतरिक उपयोग एनालिटिक्स को एक समर्पित गाइड के लायक उत्पाद सतह के रूप में मान रहा है। जो टीमें पहले से ChatGPT Work या Codex का उपयोग कर रही हैं, उनके पास जारी रोलआउट के लिए मामला बनाते समय उपयोग और खर्च के आंकड़ों का संदर्भ देने का रास्ता है।
एक बात पर नजर रखें: एनालिटिक्स वास्तव में कितनी विस्तृत होती है। गाइड परिणामों की भाषा में बोलती है, लेकिन अगला परीक्षण यह है कि क्या डेटा किसी विशेष वर्कफ़्लो को व्यावसायिक मीट्रिक से जोड़ने के लिए पर्याप्त गहराई तक जाता है, या कुल संख्याओं पर रुक जाता है।
[02:08] GitHub Copilot's September 14 batch adds model options, Sentry hook, and admin tools
GitHub का 14 सितंबर का Copilot साप्ताहिक रिलीज एक साथ कई व्यावहारिक अपग्रेड लेकर आया, 18 सितंबर को प्रकाशित। ये सुधार मॉडल पिकर, कोड रिव्यू, एडमिन कंट्रोल और Copilot ऐप itu तक फैले हैं।
डेवलपर्स के पास अब Copilot में नए मॉडल चयन विकल्प हैं, जो टीमों को यह चुनने में अधिक लचीलापन देता है कि कौन सा अंतर्निहित मॉडल कम्प्लीशन और चैट को संभालता है। Copilot ऐप में Sentry इंटीग्रेशन आया है, ताकि एरर मॉनिटरिंग उस वर्कफ़्लो में शामिल हो जाए जहां आप पहले से काम कर रहे हैं। अगर आप Sentry में क्रैश रिपोर्ट देख रहे हैं, तो आप बिना कॉन्टेक्स्ट-स्विचिंग टूल्स के ऐप के अंदर ही फिक्स कवरसेशन में जा सकते हैं।
कोड रिव्यू को अपडेट मिले हैं जिन्हें पोस्ट आगे ongoing work के रूप में फ्लैग करती है। एडमिन्स को भी उसी अपडेट में कॉन्फ़िगरेशन अपडेट मिले हैं, जो उन किसी भी व्यक्ति के लिए मायने रखता है जो संगठन भर में Copilot को मैनेज कर रहे हैं — संबंधित कंट्रोल शायद हिल गए हों।
पोस्ट में नए एजेंट फीचर्स का भी टीज़र है, हालांकि सोर्स उन्हें नाम देने से पहले ही कट हो जाता है। यह देखना worth है क्योंकि Copilot के अंदर एजेंट क्षमताएं वह जगह हैं जहां competitive ground बदलती रहती है।
इसे एक बैच्ड वीकली ड्रॉप के रूप में पढ़ें, एक सिंगल फ्लैगशिप फीचर के बजाय। व्यावहारिक कदम छोटा है: मॉडल पिकर पर एक नज़र डालें, Sentry हुक को try करें अगर आपकी टीम पहले से Sentry का उपयोग करती है, और एडमिन कंसोल को उन नए टॉगल्स के लिए ज़रूर देख लें जिनके बारे में अभी तक नहीं बताया गया है।
[03:29] Linkup Releases Open Sparse Embedder SPARSEUP for Fast Retrieval
Linkup Research ने SPARSEUP रिलीज़ किया है, एक 149-मिलियन-पैरामीटर open-source sparse embedding मॉडल, और मुख्य आंकड़ा 56.4 nDCG@10 है, एक ranking-quality स्कोर जहां higher better है, BEIR-13 पर, एक स्टैंडर्ड retrieval benchmark। Linkup इसे 150M पैरामीटर से कम के अंतर्गत best public sparse encoder result बताता है जो उसके पास है। मॉडल Apache 2.0 के तहत आता है, ताकि इसका उपयोग, modification, और commercial serving बिना licensing friction के किया जा सके।
Sparse embedding एक retrieval approach है जहां प्रत्येक document एक vector द्वारा प्रस्तुत किया जाता है जिसमें mostly zeros होते हैं, केवल कुछ active entries के साथ। वह sparsity ही पूरा पॉइंट है: यह search systems को classical inverted indexes का उपयोग करने देती है, वह data structure जो क्लासिक search engines को चलाती है, हर query के लिए expensive neural comparisons चलाने के बजाय। SPARSEUP अपने vectors को sparse तीन tricks का उपयोग करके रखता है: एक logit shift जो expansion से पहले low-relevance terms को दबाता है, एक top-12 expansion जो प्रति टोकन केवल बारह highest-scoring terms रखता है, और case folding जो capitalisation differences को collapse करता है ताकि same word slots wasted न करे।
Seismic inverted index के साथ जोड़े जाने पर, SPARSEUP लगभग 380 microseconds per query में 97% recall हिट करता है। यही वह हिस्सा है जो operationally मायने रखता है: commodity CPU hardware पर sub-millisecond retrieval, GPU के बिना। जो टीमें बड़े पैमाने पर retrieval-augmented generation pipelines चला रही हैं, उनके लिए यह cost curve बदल देता है।
मॉडल ModernBERT backbone पर बना है, original BERT text encoder का एक modern rewrite। यह एक CPU node पर आराम से फिट होने लायक छोटा है और product के अंदर ship करने के लिए permissive है।
यह अभी क्यों मायने रखता है: dense retrievers ने leaderboards पर dominance रखी है, लेकिन उन्हें serve करना अधिक महंगा है और GPU memory की जरूरत है। SPARSEUP उन बिल्डर्स के लिए एक credible open alternative प्रदान करता है जो पहले से inverted-index search stacks चलाते हैं और that architecture को पीछे छोड़े बिना neural quality चाहते हैं।
[05:20] OpenAI ने Jalapeño नामक चिप डिज़ाइन करने के लिए अपने स्वयं के मॉडल का उपयोग किया
इस महीने IEEE Spectrum का एक लेख विस्तार से बताता है कि OpenAI ने Jalapeño कोडनेम वाली एक कस्टम चिप डिज़ाइन करते समय अपने स्वयं के बड़े भाषा मॉडल पर भरोसा किया। यह कहानी, जो मध्य सितंबर में Hacker News पर सामने आई और लगातार चर्चा का विषय बनी, Jalapeño को एक आंतरिक सिलिकॉन प्रयास के रूप में प्रस्तुत करती है जहां आंतरिक AI टूलिंग ने डिज़ाइन प्रक्रिया में प्रत्यक्ष भूमिका निभाई।
व्यावहारिक निष्कर्ष फीडबैक लूप है। वही मॉडल वर्ग जिसे OpenAI प्रशिक्षित करता और परोसता है, अब उस हार्डवेयर को आकार देने में मदद कर रहा है जिस पर वे कार्यभार चलते हैं। ऐतिहासिक रूप से, चिप डिज़ाइन मानव इंजीनियरों, इलेक्ट्रॉनिक डिज़ाइन ऑटोमेशन टूल्स और फाउंड्री के साथ लंबे पुनरावृत्ति चक्रों पर निर्भर करता है। उस लूप में फ्रंटियर LLM को लाना लेआउट विकल्पों, सत्यापन और ट्रेड-ऑफ़ की तेज़ खोज का संकेत देता है, हालांकि प्रकाशित सामग्री यह निर्दिष्ट नहीं करती कि मॉडल ने किन डिज़ाइन चरणों में सहायता की या काम का कितना हिस्सा स्वचालित था।
अभी के लिए, सार्वजनिक विवरण पतले हैं। लेख कोडनेम का नाम बताता है और आंतरिक मॉडल के उपयोग की पुष्टि करता है, लेकिन प्रोसेस नोड, फाउंड्री पार्टनर, प्रदर्शन लक्ष्य या समयसीमा का खुलासा नहीं करता। यह इसे उत्पाद विशिष्टता शीट के बजाय दिशा-यात्रा साक्ष्य के रूप में छोड़ देता है। दिलचस्प फॉलो-अप यह देखना होगा कि OpenAI बेंचमार्क नंबर प्रकाशित करता है या नहीं, Jalapeño प्रशिक्षण, इन्फरेंस या दोनों के लिए है, और अन्य प्रयोगशालाएं अपने स्वयं के समान मॉडल-संचालित सिलिकॉन कार्यक्रमों को औपचारिक रूप देती हैं या नहीं।
[06:40] Federal Register ने संक्षेप में एक चीनी AI टूल चलाया जिसे FBI ने दुर्भावनापूर्ण बताया
Ars Technica की 18 सितंबर की रिपोर्ट के अनुसार, Federal Register, एक अमेरिकी सरकारी वेबसाइट, ने संक्षेप में एक ओपन सोर्स चीनी AI खोज टूल चलाया जिसे FBI ने दुर्भावनापूर्ण बताया है। यह कहानी ताज़ा ध्यान आकर्षित कर रही है कि तृतीय-पक्ष AI घटक कितनी आसानी से सरकारी अवसंरचना के अंदर समाप्त हो सकते हैं। चूंकि टूल ओपन सोर्स है, इसे किसी अन्य लाइब्रेरी जैसी आसानी से अपनाया जा सकता है - एक कॉन्फ़िगरेशन परिवर्तन और पुनः तैनाती - जो ठीक वही कम-घर्षण मार्ग है जो सत्यापन को कठिन बनाता है। Federal Register का अमेरिकी सरकारी गतिविधियों के आधिकारिक रिकॉर्ड के रूप में यह भूमिका इसे अधिक बनाती है एक नियमित प्राप्ति टिप्पणी से अधिक। बिल्डर्स के लिए निष्कर्ष सीधा है: जब आप किसी उत्पाद में पुनर्प्राप्ति या खोज परत जोड़ते हैं, तो आप उसके लेखक की उत्पत्ति को भी अपनी ज़िम्मेदारी में ले रहे हैं, और आपके उपयोगकर्ता उस श्रृंखला को बिना जाने ही इनherit करते हैं। इस बात पर ध्यान दें कि कौन सा टूल उपयोग में था, यह कितने समय तक चला, और इस प्रतिक्रिया में प्राप्ति नियमों की समीक्षा की जाती है या नहीं।
[07:45] xAI ने Grok Voice Transcribe 2.0 शिप किया, स्ट्रीमिंग सटीकता लीडरबोर्ड में शीर्ष पर
xAI ने अभी-अभी Grok Voice Transcribe 2.0 जारी किया है, अपना नवीनतम speech-to-text मॉडल, जो समान मूल्य पर संस्करण 1.0 से दोगुना सटीकता का दावा करता है। यह Grok Voice स्टैक के पीछे के ऑडियो फाउंडेशन मॉडल पर बना है जो पहले से ही Tesla वाहनों, ग्राहक-सहायता लाइनों और भौतिक उत्पादों में वॉयस एजेंटों में चलता है।
सार्वजनिक Artificial Analysis लीडरबोर्ड पर, Grok Voice Transcribe 2.0 32 स्ट्रीमिंग मॉडल में सटीकता के लिए पहले स्थान पर है। xAI का कहना है कि उसने विशेष रूप से सबसे कठिन वास्तविक-दुनिया के ऑडियो को लक्षित किया: अस्थिर फोन लाइनें, प्रतिस्पर्धी आवाज़ें, स्थानीय लहजे, और बोले गए क्रेडेंशियल जैसे फोन नंबर या ईमेल पते।
आंतरिक रूप से, xAI ने चार प्रोडक्शन-व्युत्पन्न सेट पर शब्द त्रुटि दर का परीक्षण किया - टेलीफोनी ऑडियो, Grok के साथ बातचीत, बोले गए खाता कोड, और छोटे बहुभाषी वॉयस कमांड। नया मॉडल चारों पर 1.0 में सुधार करता है, और टेलीफोनी पर इसके खिलाफ परीक्षित हर मॉडल से आगे है।
बहुभाषी सुविधा मुख्य लाभ है। यह मॉडल दर्जनों भाषाओं को संभालता है, स्वचालित रूप से पहचानता है कि कौन सी बोली जा रही है, और एक ही पास में रिकॉर्डिंग के दौरान मध्य-बीच होने वाले स्विच को फॉलो करता है। शॉर्ट-फ्रेज सेट पर — कार में कमांड जैसी स्थितियों के बारे में सोचें — वर्ड एरर रेट 20.6% से गिरकर 6.8% हो गया।
फीचर सेट व्यापक है: बैच और स्ट्रीमिंग ट्रांसक्रिप्शन, कॉन्फिडेंस स्कोर के साथ वर्ड-लेवल टाइमस्टैम्प, बिना अतिरिक्त लागत के स्पीकर डायराइज़ेशन, 8-चैनल तक का मल्टीचैनल ट्रांसक्रिप्शन, प्रति अनुरोध 100 डोमेन टर्म तक के लिए की टर्म बायसिंग, नंबरों और करेंसी के लिए टेक्स्ट फॉर्मेटिंग, फिलर वर्ड रिमूवल, और वॉइस एजेंट्स के लिए स्मार्ट टर्न डिटेक्शन। मौजूदा API इंटीग्रेशन बिना कोड बदलाव के सटीकता में सुधार पाते हैं।
मूल्य निर्धारण बैच के लिए $0.10 प्रति घंटा और स्ट्रीमिंग के लिए $0.20 प्रति घंटा पर बना हुआ है। Atlassian पहले से ही Loom ट्रांसक्रिप्ट को Grok Voice Transcribe 2.0 के माध्यम से रूट कर रहा है, और इस घोषणा में एक Cursor वर्कफ़्लो शामिल है जहां रिकॉर्ड किया गया Loom एक्शन प्लान सीधे कोड में बदल जाता है। वर्शन 2.0 जल्द ही Speech-to-Text API में डिफ़ॉल्ट बन जाएगा, जिसमें 1.0 आने वाले हफ्तों में बंद कर दिया जाएगा।
[09:38] रिसर्च डाइजेस्ट: RAFT: रिट्रीवल दैट ट्रैक्स व्हीयर अ सपोर्ट केस एक्चुअली इज़
अधिकांश कस्टमर सपोर्ट टूल्स प्रत्येक टिकट को एक स्टैंडअलोन डॉक्यूमेंट की तरह मानते हैं। RAFT नामक एक नया फ्रेमवर्क एक अलग दृष्टिकोण अपनाता है: यह ट्रैक करता है कि समस्या अपने जीवनचक्र में कहां है, ताकि कोई फंसा हुआ केस किसी और के समान केस की शुरुआत से नहीं, बल्कि बीच से उधार ले सके।
टीम ने इसे वास्तविक सपोर्ट केस कैसे खुलते हैं, इसके आसपास बनाया — एक फ्रोज़न पेज के बजाय टाइमलाइन एंट्री की चेन। जब एक नया टिकट किसी पुराने केस के मध्यवर्ती चरण से मेल खाता है, तो सिस्टम उस ट्रैजेक्टरी का बाकी हिस्सा आगे लाता है, एजेंट को एक रोडमैप देता है कि आगे क्या कोशिश करना है। एक वैकल्पिक सिमिलैरिटी ग्राफ संबंधित केस को जोड़ता है।
वैनिला रिट्रीवल और एक लोकप्रिय ग्राफ-बेस्ड अप्रोच के खिलाफ टेस्ट किया गया, RAFT ने प्रगति के हर चरण पर केस-हिट सटीकता बढ़ाई, सबसे मजबूत बेसलाइन पर सांख्यिकीय रूप से महत्वपूर्ण लाभ के साथ। शोधकर्ताओं ने मूल्यांकन के लिए Microsoft Learn Windows Server डॉक्यूमेंटेशन और Apache Jira टिकट्स का उपयोग किया, और बेंचमार्क और कोड जारी किया। व्यावहारिक परिणाम: एंटरप्राइज सपोर्ट एजेंट्स को वायर करने वाले बिल्डर्स के पास अब रिट्रीवल का एक ब्लूप्रिंट है जो समस्याओं के वास्तव में विकसित होने के तरीके से मेल खाता है, न कि बस इनटेक पर वे कैसे दिखती हैं।
[10:46] OpenAI ने ऑस्ट्रेलियाई युवा सुरक्षा ब्लूप्रिंट प्रकाशित किया
OpenAI ने ऑस्ट्रेलियाई युवा सुरक्षा ब्लूप्रिंट प्रकाशित किया है, एक छह-स्तंभ रोडमैप जो ऑस्ट्रेलिया में युवा लोगों के लिए AI इंटरैक्शन को सुरक्षित बनाने पर केंद्रित है। 18 सितंबर, 2026 को जारी, यह फ्रेमवर्क AI टूल्स के युवा उपयोगकर्ताओं के लिए एक सुरक्षात्मक और सशक्तिकरण गाइड के रूप में प्रस्तुत है।
यह दस्तावेज़ AI उत्पादों द्वारा नाबालिगों को कैसे संभाला जाता है, इस पर चल रही वैश्विक जांच के बीच आता है। ऑस्ट्रेलिया से जुड़े इस क्षेत्र-विशिष्ट फ्रेमवर्क को प्रकाशित करके, OpenAI सार्वजनिक रूप से संकेत दे रहा है कि युवा सुरक्षा अब केवल एक आंतरिक नीति चिंता नहीं, बल्कि उत्पाद-स्तर की प्राथमिकता बन रही है।
जो बिल्डर्स, पैरेंट्स और एजुकेटर्स ले सकते हैं वो скромा है लेकिन ध्यान देने योग्य है: ब्लूप्रिंट ऑस्ट्रेलियाई बाजार के लिए यूथ सेफ्टी को फोकस एरिया के रूप में नामित करता है, यह इशारा करते हुए कि ऑस्ट्रेलिया में भविष्य का प्रोडक्ट व्यवहार एज-अप्प्रोप्रिएट डिफॉल्ट्स, कंटेंट गार्डरेल्स, या युवा उपयोगकर्ताओं के लिए मजबूत सुरक्षा की ओर बदल सकता है। व्यावहारिक सवाल यह है कि क्या छह स्तंभ ChatGPT या अन्य OpenAI प्रोडक्ट्स में दृश्य फीचर बदलावों में बदलते हैं, या क्या दस्तावेज़ मुख्य रूप से आंतरिक निर्णयों और नियामक बातचीत को आकार देता है। फॉलो-अप घोषणाओं पर नजर रखना worth है जो ब्लूप्रिंट को specific प्रोडक्ट अपडेट्स से जोड़ती हैं, न कि इसे standalone पॉलिसी टेक्स्ट के रूप में छोड़ती हैं।
युवा उपयोगकर्ताओं को प्रभावित करने वाले कंज्यूमर-फेसिंग AI प्रोडक्ट्स पर काम करने वाले बिल्डर्स के लिए, प्रमुख लैब्स से औपचारिक youth-safety ब्लूप्रिंट्स का अस्तित्व खुद एक signal है। इस तरह के दस्तावेज़ीकरण tend to set expectations के लिए कि नियामक, स्कूल और पैरेंट्स आगे क्या देखेंगे, भले ही विशिष्टताएं कंपनी-आंतरिक रहें।
[12:12] Hex turns agent answers into share-ready visualizations with GPT-6 Astra
Hex अपने डेटा एजेंट्स से कुछ ऐसा वापस करा रहा है जो आप actually एक coworker को भेज सकते हैं। 16 सितंबर को, OpenAI featured एक write-up जिसमें बताया गया कि Hex ने GPT-6 Astra को उन एजेंट्स में कैसे जोड़ा है ताकि उनके answers interactive visualizations के रूप में आएं, न कि plain text or tables के रूप में। फ्रेमिंग बताने वाली है: OpenAI raw accuracy की जगह presentability पर जोर देता है, और Hex कहता है कि employees उन चीजों को साझा करने पर गर्व feel करती हैं जो एजेंट्स produce करते हैं।
मैकेनिज्म सिद्धांत में सरल है। Hex के डेटा एजेंट्स analytical work करते हैं, और Astra visual layer संभालता है, एजेंट के answer को chart या small report में बदलता है जो same flow के अंदर रहती है। कोई separate design pass नहीं, कोई manual cleanup step नहीं।
Hex का पहले से उपयोग करने वाली टीमों के लिए, व्यावहारिक बदलाव यह है कि query और deliverable एक step में collapse हो जाते हैं। एक user जो एजेंट से question पूछता है उसे कुछ ready to circulate मिलता है, बाद में massage करने के लिए raw result नहीं। समान एजेंट टूल्स बनाने वालों के लिए, signal यह है कि visual artifact increasingly part बन रहा है जो एजेंट डिफ़ॉल्ट रूप से आपको owes करता है।
एक बात देखने योग्य है: वे auto-generated visuals कितनी often तब hold up करते हैं जब कोई stakeholder उनके through click करना शुरू करता है। "Interactive" announcement में बहुत काम कर रहा है।
[13:29] Jev: एक सस्ता, तेज़ स्पेशलिस्ट मॉडल जो केवल Route और Classify करने के लिए बनाया गया है
TypeSafe ने 16 सितंबर को Jev रिलीज़ किया, इसे "System One Model" कहकर — Kahneman की fast, automatic thinking rather than slow, deliberate reasoning के प्रति जानबूझकर nod। पिच जानबूझकर narrow है। Jev केवल decide, classify, route, और score करने के लिए बनाया गया है। कोई generation नहीं, कोई chat नहीं, कोई reasoning chains नहीं।
Tradeoff speed और cost का है। TypeSafe का दावा है कि Jev 100 से अधिक गुना तेज़ चलता है और उसी तरह की lightweight triage को handle करने वाले छोटे frontier LLMs की तुलना में 200 गुना से अधिक सस्ता है। ये आंकड़े खुद कंपनी से आए हैं, इसलिए independent benchmarks matter करेंगे, लेकिन framing स्पष्ट है: एक yes-or-no job के लिए generalist को भुगतान करना बंद करो।
यह अंतर बिल्डर्स के लिए मायने रखता है। आज प्रोडक्शन में LLM API खर्च का एक बड़ा हिस्सा छोटे निर्णय कॉल पर जाता है — यह पता लगाना कि उपयोगकर्ता का क्या इरादा है, किस एजेंट को क्वेरी को संभालना चाहिए, क्या ड्राफ्ट रिस्पॉन्स भेजना सुरक्षित है। इनमें से अधिकांश कॉल को सत्तर अरब पैरामीटर वाले जनरलिस्ट की जरूरत नहीं है। उन्हें तेज क्लासिफिकेशन या रूटिंग निर्णय की जरूरत है। Jev सीधे इसी गैप को भरने के लिए बनाया गया है।
अगर आंकड़े बने रहे, तो किसी भी टीम के लिए जो मल्टी-एजेंट स्टैक चला रही है, उसका तुरंत का प्रयोग यह होगा कि क्लासिफायर या राउटर लेयर को Jev से बदला जाए और लेटेंसी, प्रति कॉल लागत और सटीकता को मापा जाए, जो भी छोटा मॉडल उस समय उस सीट पर बैठा हो। जीत स्मार्ट जवाब नहीं है। यह सस्ती प्लंबिंग है।
[14:55] जैसे-जैसे फंडिंग और हाइप बढ़ता है, वर्ल्ड मॉडल लैब्स चुप रहते हैं
वर्ल्ड मॉडल कंपनियों के पास पैसे और प्रेस की भरमार है, लेकिन यह बताने को बहुत कम है कि वे क्या शिप कर रहे हैं। 18 सितंबर की एक TechCrunch डिस्पैच बिना किसी लाग-लपेट के यह बात साफ करती है: संस्थापकों के पास जाएं, उनके डेटा सप्लायर्स के पास जाएं, और पूछें कि ये स्पैशियल और फिजिकल सिम्युलेटर वास्तव में क्या करने में सक्षम हैं, और ज्यादातर मामलों में आपको खामोशी मिलेगी।
यह लेख कार्यकारी सुइट से लेकर सिस्टम में डेटा देने वाले पार्टनर्स तक की अपारदर्शिता को ट्रेस करता है। संस्थापक आर्किटेक्चर विवरण, ट्रेनिंग डेटा संरचना, या निकट-अवधि प्रोडक्ट प्लान साझा करने से इनकार करते हैं। डेटा सप्लायर्स, जो अक्सर अपनी गोपनीयता समझौतों से बंधे होते हैं, यह पुष्टि नहीं करेंगे कि वे किस वर्ल्ड-मॉडल लैब के साथ काम करते हैं या वे किस प्रकार के ट्रैजेक्टरीज, वीडियो, या सेंसर स्ट्रीम्स में योगदान दे रहे हैं।
यह मायने रखता है क्योंकि वर्ल्ड मॉडल्स को रोबोटिक्स, सिम्युलेशन और एम्बॉडिड AI के लिए अगले प्लेटफॉर्म लेयर के रूप में पिच किया जा रहा है। अगर खरीदार और डेवलपर्स को किसी दिए गए मॉडल की क्षमताओं, इसके प्रशिक्षण के बारे में, या किस डेटा ने इसकी भौतिकी की समझ को आकार दिया, इसके बारे में सीधे जवाब नहीं मिलते, तो उनसे विश्वास पर ही प्रतिबद्ध होने को कहा जा रहा है। इस क्षेत्र के पास अंधेरे में बनाने के लिए फंडिंग है, लेकिन प्रकटीकरण की कमी तब तक स्वतंत्र मूल्यांकन लगभग असंभव बनाती है जब तक कि कोई पब्लिक डेमो या तकनीकी पेपर मामले को जबरदस्ती सामने नहीं लाता।
बिल्डर्स के लिए, व्यावहारिक निष्कर्ष यह है कि किसी भी वेंडर के दावों पर वर्कफ्लो बाजी लगाने से पहले एक काम करने वाला नमूना, रिकॉर्ड किया हुआ डेमो, या प्रकाशित मूल्यांकन मांगें। जब तक लैब्स खुलते नहीं, तब तक एकमात्र विश्वसनीय सिग्नल वह है जो सिस्टम वास्तव में आपके हाथों में करता है।
[16:29] क्या HF एब्लिटरेटेड मॉडल्स के खिलाफ कदम उठाने जा रहा है?
Baseten ने बुधवार को अपने Base Labs रिसर्च आर्म के साथ मिलकर एक नया सेफ्टी इन्फ्रास्ट्रक्चर स्टैंडर्ड लॉन्च किया, जो ओपन-वेट मॉडल्स के लिए सेफ्टी इवैल्यूएशन और मॉनिटरिंग इन्फ्रास्ट्रक्चर बनाने के लिए Hugging Face और Goodfire AI के साथ पार्टनरशिप की है। यह घोषणा ओपन-वेट मॉडल्स की सुरक्षा को लेकर बहस के बीच आती है — जिन्हें एब्लिटरेशन नामक उभरती तकनीक के माध्यम से उनकी सुरक्षा हटाकर खतरनाक बनाया जा सकता है। यह कंपनी का प्रकाशित पॉलिसी स्टैंड है, लागू कानून या नवीनतम शिप किया गया मॉडल क्षमता नहीं। तंत्र मॉडल वेट्स पर नियंत्रण है: ओपन वेट स्वतंत्र निरीक्षण और लोकल डिप्लॉयमेंट का समर्थन करते हैं, जबकि प्रतिबंधित फ्रंटियर वेट्स सुरक्षा चिंताओं के कारण प्रोवाइडर के नियंत्रण में रहते हैं। ओपन मॉडल चुनने वाले बिल्डर्स को इस बताई गई स्थिति को वर्तमान कानून से अलग करना चाहिए और स्टैक में बदलाव करने से पहले ठोस लाइसेंस या एक्सेस परिवर्तनों का इंतजार करना चाहिए।
[17:17] टर्नरी LLMs के लिए 1.58-बिट बैरियर तोड़ना
Hacker News स्कोर 242; चर्चा: https://news.ycombinator.com/item?id=49732931; हेडलाइन-केवल स्रोत — पूरी कहानी के लिए अपर्याप्त। arxiv.org पर प्राथमिक स्रोत केवल इन कथित तथ्यों का समर्थन करता है; असमर्थित विशिष्टताओं को जानबूझकर छोड़ दिया गया है। प्राथमिक स्रोत ऊपर बताए गए विशिष्ट उत्पाद या वर्कफ़्लो परिवर्तन का समर्थन करता है; यह प्रदर्शन, संगतता, या परिनियोजन के बारे में व्यापक दावों का समर्थन नहीं करता। इस पर निर्भर होने से पहले, वास्तविक वर्कफ़्लो के खिलाफ स्रोत पर आधारित परिवर्तन का परीक्षण करें।
[17:41] Microsoft ने TauGrid को ओपन-सोर्स किया: GPU AI वर्कलोड के लिए एक Kubernetes-Native स्टैक
Microsoft की AKS इंजीनियरिंग टीम ने 28 अगस्त, 2026 को TauGrid को ओपन-सोर्स किया, tau CLI, Kueue क्यूईंग, KubeRay ऑर्केस्ट्रेशन, GPU नोड स्वास्थ्य निगरानी और अवलोकन को एक Helm इंस्टॉल में पैक किया। यह MIT लाइसेंस्ड है और अब GPU नोड्स, kubectl और Helm 3.0 या उसके बाद के संस्करण वाले किसी भी Kubernetes 1.30+ क्लस्टर पर परिनियोजन योग्य है। Microsoft Open-Sources TauGrid: A Kubernetes-Native Stack for GPU AI Workloads शीर्षक वाली पोस्ट पहले MarkTechPost पर प्रकट हुई। प्राथमिक स्रोत ऊपर बताए गए विशिष्ट उत्पाद या वर्कफ़्लो परिवर्तन का समर्थन करता है; यह प्रदर्शन, संगतता, या परिनियोजन के बारे में व्यापक दावों का समर्थन नहीं करता। इस पर निर्भर होने से पहले, वास्तविक वर्कफ़्लो के खिलाफ स्रोत पर आधारित परिवर्तन का परीक्षण करें।