DeepSeek V4.1-Flash मिलियन-टोकन स्मृति को FP4 कैश में पैक करता है — Episode 113 cover art
Episode 113·17 सितंबर 2026·45:15

DeepSeek V4.1-Flash मिलियन-टोकन स्मृति को FP4 कैश में पैक करता है

DeepSeek V4.1-Flash FP4 कैश में मिलियन-टोकन संदर्भ के साथ उतरा। Cohere ने 50 भाषाओं को कवर करने वाला 218B खुले-भार (open-weights) अनुवाद मॉडल जारी किया। Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-113/

🎧 Listen to Episode

एपिसोड 113 — 11 सितंबर, 2026

[00:00] एपिसोड हुक

DeepSeek ने आज V4.1 Flash लॉन्च किया, जो इसके नए Causal Encoder-Decoder आर्किटेक्चर पर बना पहला मॉडल है — एक स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स डिज़ाइन जो प्रति टोकन 8 अरब पैरामीटर एक्टिवेट करता है जबकि इंफरेंस कंप्यूट को घने तुलनीय मॉडलों से काफी नीचे रखता है। यह रिलीज़ एक पूर्ण तकनीकी रिपोर्ट और एक परमिसिव लाइसेंस के तहत ओपन वेट के साथ आती है, जो V3 के बाद DeepSeek का पहला आर्किटेक्चरल बदलाव है। यह रिलीज़ उसी सप्ताह आई है जब OpenAI ने दावा किया कि उसका एक अनडिस्क्लोज़्ड इंटरनल मॉडल Navier–Stokes मिलेनियम प्राइज़ समस्या को हल कर लिया है, लेकिन एक NYU गणितज्ञ और एक Anthropic में कार्यरत सहयोगी ने सार्वजनिक रूप से दावा किया कि उन्होंने पहले यही परिणाम प्राप्त किया — एक प्राथमिकता विवाद जो अब खुले मंचों में फैल रहा है और सवाल उठा रहा है कि गणितीय ब्रेकथ्रू को कैसे श्रेय दिया जाना चाहिए जब दावे के पीछे का मॉडल स्वयं अप्रकटित है।

[02:00] DeepSeek ने नए आर्किटेक्चर पर V4.1 Flash लॉन्च किया

DeepSeek ने V4.1 Flash रिलीज़ किया, एक स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल जो कंपनी के नए Causal Encoder-Decoder (CED) आर्किटेक्चर पर बना पहला है। यह मॉडल प्रत्येक टोकन को केवल अपने वेट के एक हिस्से से गुज़ारता है — इनपुट पर 8 अरब पैरामीटर एक्टिव, आउटपुट पर 16 अरब — क्योंकि यह हर पैरामीटर को हर पास पर नहीं चलाता, जो स्टैंडर्ड MoE एफिशिएंसी प्ले है। इसमें दस लाख टोकन का कॉन्टेक्स्ट विंडो है, जो एक लंबी किताब या एक बड़े कोडबेस को एक ही प्रॉम्प्ट में रखने के लिए काफी बड़ा है, और प्रति कॉल जनरेटेड रिस्पॉन्स 4,096 टोकन पर सीमित है। V4.1 Flash DeepSeek के अपने प्रोवाइडर के तहत OpenRouter पर लिस्टेड है, इसलिए मौजूदा OpenRouter इंटीग्रेशन SDK बदलाव के बिना नए मॉडल id पर पॉइंट कर सकते हैं। बिल्डर्स के लिए दिलचस्प सवाल यह है कि व्यवहार में CED, DeepSeek के पहले शिप किए गए ट्रांसफॉर्मर-ओनली डिज़ाइन से कैसे अलग है — V4.1 Flash इस नए आर्किटेक्चर पर पहला मॉडल है, और यह कैसा परफॉर्म करता है, वह अगले मॉडल के लिए उम्मीदें तय करेगा।

[02:09] OpenAI का Navier-Stokes दावा एक काउंटरक्लेम से मिलता है

OpenAI का कहना है कि उसने Navier–Stokes एक्ज़िस्टेंस और स्मूथनेस समस्या हल कर ली है, जो मई 2000 से खुली 1 मिलियन डॉलर की सात मिलेनियम प्राइज़ चुनौतियों में से एक है। यह परिणाम एक अनरिलीज़्ड मॉडल द्वारा प्राप्त किया गया था जिसका नाम कंपनी ने प्रकट नहीं किया है।

कुछ ही दिनों में, एक प्रतिस्पर्धी दावा सामने आया। NYU के गणित प्रोफेसर Tristan Buckmaster, और Levent Alpöge, एक प्रतिष्ठित गणितज्ञ जो अब Anthropic में हैं, ने एक PDF पोस्ट किया जिसमें उन्होंने समान समस्या पर अपने लगभग एक साल के प्रयास का वर्णन किया, जो काफी हद तक Claude और OpenAI के Codex प्रोडक्ट, विशेषकर GPT-5.6 Sol मॉडल के जरिए किया गया। उनका कहना है कि उन्होंने 15 अगस्त को अपना ब्रेकथ्रू हासिल किया।

इसके बाद प्रोवेनेंस के बारे में एक सार्वजनिक विवाद हुआ। Buckmaster लिखते हैं कि गणितीय रूमर मिलने के बाद, उन्होंने OpenAI से संपर्क किया और पता चला कि कंपनी की एक समानांतर टीम समान दृष्टिकोण का उपयोग कर रही थी। जब उन्होंने पूछा कि OpenAI ने अपना पहला प्रॉम्प्ट कब भेजा, उन्हें अंततः बताया गया कि यह उनके काम की खबर कंपनी तक पहुंचने के बाद था। जब उन्होंने पूछा कि क्या मॉडल के ट्रेनिंग में उनके Codex सेशंस को छुआ था — जहां प्रोजेक्ट का हर ड्राफ्ट रहता था — OpenAI ने कहा कि मॉडल ने यूजर डेटा नहीं देखा, लेकिन ट्रेनिंग सवाल का जवाब नहीं दिया।

OpenAI ने Buckmaster के पब्लिश करने का इंतज़ार करने या उनके पेपर के सह-ऑथर बनने की पेशकश की। Simon Willison के Weblog द्वारा इस सप्ताह सारांशित यह एपिसोड, Hacker News पर 1,300 से अधिक अपवोट हासिल कर चुका है।

गणितज्ञों और बिल्डर्स के लिए, खुला सवाल यह नहीं है कि कौन सी लैब पहले लाइन क्रॉस कर गई। सवाल यह है कि क्या फ्रंटियर मॉडल में पहले से ही उन प्राइवेट रिसर्च सेशंस के निशान मौजूद हैं जिन्हें ग्राहक अपना मान रहे थे।

[03:46] मेटा का Muse पर्सनल AI ऐप धीमी शुरुआत के साथ आ रहा है

मेटा का नया ऐप है Muse, जिसे एक पर्सनल AI एजेंट के रूप में प्रस्तुत किया गया है — सॉफ्टवेयर जो आपके लिए काम संभालता है, न कि बस चैट विंडो में सवालों के जवाब देता है। TechCrunch AI के अनुसार, लॉन्च मेटा के अन्य हालिया ऐप डेब्यू की तुलना में धीमी शुरुआत पर है, जिसमें Meta AI असिस्टेंट और Threads शामिल हैं। यह तुलना मायने रखती है क्योंकि मेटा ने पिछले कुछ सालों में खुद को एक विश्वसनीय कंज्यूमर AI कंपनी के रूप में स्थापित करने की कोशिश की है, और एक पर्सनल-एजेंट ऐप वही श्रेणी है जिसकी ओर पूरा उद्योग दौड़ रहा है।

लॉन्च ने इस क्षेत्र पर सबसे गौर से देखने वाले लोगों का ध्यान खींचा। इस खबर के आसपास Hacker News पर चर्चा 655 पॉइंट्स तक पहुंच गई, जो एक तकनीकी दर्शकों से वास्तविक जिज्ञासा का संकेत देती है, भले ही मुख्यधारा का प्रसार मेटा शायद चाहता था उससे कमजोर दिख रहा हो। ऐप खुद ai.meta.com/muse पर है, जो सुझाव देता है कि मेटा इसे अपने AI कार्य का विस्तार मान रहा है, न कि एक अलग सोशल प्रोडक्ट के रूप में।

बिल्डर्स और AI वॉचर्स के लिए, कदम है बुकमार्क करना और इंतजार करना। दिलचस्प सवाल यह है कि क्या मेटा Muse को Facebook, Instagram, और WhatsApp में गहरे हुक वाला एक असली प्लेटफॉर्म प्ले के रूप में मानता है, या एक और प्रयोगात्मक साइडबार के रूप में। कुछ हफ्तों में फिर से देखना उचित है एक बार जब स्वतंत्र समीक्षकों ने वास्तव में इसका उपयोग किया हो और प्रारंभिक-अपनाने की वक्र स्पष्ट हो गया हो।

[05:09] Raschka का Ahead of AI GPT-6 Astra की रीज़निंग का विश्लेषण करता है

Sebastian Raschka का Ahead of AI न्यूज़लेटर OpenAI के GPT-6 Astra पर एक विस्तृत नज़रिया प्रकाशित करता है, और यह पीस Hacker News पर 512 पॉइंट्स तक पहुंच गया। Astra OpenAI का सबसे क्षमाशाली मॉडल है जो व्यापारिक ग्राहकों को लक्षित करता है, और Raschka दो तकनीकी विचारों पर ध्यान केंद्रित करते हैं जिनके बारे में प्रैक्टिशनर्स बार-बार पूछते रहते हैं: लूप्ड ट्रांसफॉर्मर्स और छिपी हुई रीज़निंग।

यह लेख OpenAI की स्थिति और उन जानकारियों के बीच के अंतर पर आता है जो इंजीनियर्स वास्तव में एक नए मॉडल के बारे में जानना चाहते हैं। Raschka Astra को एक प्रणाली के रूप में प्रस्तुत करते हैं जिसमें उन्नत रीज़निंग, कंप्यूटर-उपयोग क्षमताएं, और मजबूत लेखन और डिज़ाइन निर्णय क्षमता है, फिर वे आर्किटेक्चरल अवधारणाओं के बारे में बताते हैं जो समझा सकती हैं कि यह पिछले GPT रिलीज़ से अलग क्यों व्यवहार करता है। यह प्रस्तुति मायने रखती है क्योंकि 'रीज़निंग' और 'कंप्यूटर उपयोग' वही विशेषताएं हैं जिनका मूल्यांकन करने के लिए टीमों से कहा जाएगा।

बिल्डर्स के लिए, मूल्य एक सावधान विश्लेषण रखने में है न कि लॉन्च घोषणा और दर्जनों बिखरे हुए थ्रेड्स को स्किम करने में। कोई भी जो तय कर रहा है कि क्या Astra के माध्यम से अपना उत्पादन वर्कफ़्लो रूट करना है, या बस यह जानने के लिए उत्सुक है कि व्यवहार में लूप्ड ट्रांसफॉर्मर का क्या मतलब है, एक केंद्रित पठन प्राप्त करता है।

Raschka ने 9 सितंबर को यह पीस प्रकाशित किया, और चर्चा थ्रेड एक उपयोगी जगह है जहां देखा जा सकता है कि प्रैक्टिशनर्स कौन से आर्किटेक्चरल सवाल उठा रहे हैं। नए मॉडल के लिए वर्कफ़्लो को सौंपने से पहले, इस लेख को किसी भी आंतरिक परीक्षण योजना के साथ जोड़ना उचित है।

[06:27] 50 भाषाओं में Cohere का Open-Weights 218B अनुवाद मॉडल

Cohere ने North Small Translate को open-weighted किया है, एक मशीन अनुवाद मॉडल जो 50 भाषाओं में Cohere के WMT26 मूल्यांकन पर 83.6 स्कोर करता है। यह मॉडल Mixture-of-Experts डिज़ाइन का उपयोग करता है, जो एक मॉडल बनाने का तरीका है जिसमें कुल 218 अरब पैरामीटर हैं लेकिन किसी भी एक टेक्स्ट टोकन के लिए केवल लगभग 25 अरब को सक्रिय करता है। बाकी के पैरामीटर निष्क्रिय रहते हैं जब तक कि मॉडल को उनकी आवश्यकता नहीं होती, यही कारण है कि इतने बड़े मॉडल को बहुत छोटे मॉडल की लागत प्रोफाइल के साथ चलाया जा सकता है।

वेट्स गैर-व्यावसायिक उपयोग के लिए मुफ्त हैं, और व्यावसायिक लाइसेंसिंग Cohere Model Vault या RWS Language Weaver के माध्यम से होती है। बिल्डर्स के लिए, इसका मतलब है कि कोई भी अनुसंधान या आंतरिक उपकरणों के लिए मॉडल डाउनलोड कर सकता है और सेल्फ-होस्ट कर सकता है, जबकि जो कंपनियां किसी उत्पाद में अनुवाद शिप करना चाहती हैं उनके पास उत्पादन अधिकारों के लिए वेंडर पथ है।

व्यावहारिक निष्कर्ष: एक ही मॉडल में 50-भाषा अनुवाद, और इस पैमाने पर पहला विश्वसनीय open-weight विकल्प जो स्पष्ट व्यावसायिक मार्ग के साथ भी आता है। यदि आप व्यापक भाषा पोर्टफोलियो को कवर करने के लिए अलग-अलग अनुवाद API को जोड़ रहे हैं, तो एक मॉडल जो उन सभी को संभालता है एक सार्थक रूप से सरल आर्किटेक्चर है।

[07:37] NVIDIA का BioIR H100s पर प्रोटीन-फोल्डिंग थ्रूपुट को लगभग तीन गुना बढ़ाता है

NVIDIA ने 10 सितंबर को BioNeMo Inference Runtime, या BioIR के बारे में विस्तार से बताया — एक Python लाइब्रेरी जो NVIDIA GPU पर बायोमॉलिक्युलर स्ट्रक्चर-प्रेडिक्शन मॉडल को तेज करती है जबकि plain PyTorch के अंदर रहती है।

हेडलाइन नंबर 8xH100 सिस्टम में चल रहे 1,000 ह्यूमन डायमर टारगेट पर मैच्ड बेंचमार्क से आता है। BioIR-एक्सेलेरेटेड Boltz-2 ने प्रति GPU-घंटे 58.5K सफलतापूर्वक फोल्डेड रेजिड्यू फोल्ड किए, जबकि उसी हार्डवेयर पर torch-compiled ओपन-सोर्स इम्प्लीमेंटेशन के लिए 20.2K था। यह 2.90x थ्रूपुट लाभ है।

BioIR तीन ऑप्टिमाइज़ेशन स्टैक करके काम करता है। पहला, यह वर्कलोड के लिए ट्यून किए गए कस्टम कर्नेल चुनता है। दूसरा, यह CUDA Graph कैप्चर का उपयोग करता है, जो दोहराए जाने वाले GPU ऑपरेशन को एक एकल पुनर्प्रयोज्य ग्राफ के रूप में रिकॉर्ड करता है। तीसरा, यह Ray के साथ रेप्लिका को स्केल करता है ऐसे तरीके से कि प्रत्येक GPU पर एक पूर्ण मॉडल कॉपी रखता है, इसलिए प्रत्येक एक्सेलेरेटर Boltz-2 के एक स्लाइस के बजाय एक पूरा इंस्टेंस चलाता है।

रनटाइम सिर्फ एक रिसर्च डेमो नहीं है। NVIDIA कहता है कि BioIR ने हाल ही में AlphaFold Database विस्तार को पावर दिया, जो 4,777 प्रोटीयोम से drawn लगभग 31 मिलियन कैंडिडेट प्रोटीन कॉम्प्लेक्स तैयार किए। यह वह तरह का वर्कलोड है जहां 2.90x लाभ यह बदलता है कि एक लैब स्ट्रक्चरल डेटाबेस को कितनी बार रिफ्रेश कर सकती है।

Boltz-2 या H100 हार्डवेयर पर समान फोल्डिंग मॉडल चलाने वाले किसी भी व्यक्ति के लिए, BioIR एक नया फ्रेमवर्क नहीं बल्कि एक Python drop-in है। यह उन PyTorch वर्कफ्लो को बनाए रखता है जो डेवलपर्स पहले से उपयोग करते हैं जबकि प्रत्येक GPU-घंटे से अधिक फोल्डेड स्ट्रक्चर निकालते हैं। खुला सवाल यह है कि क्या Boltz-2 से परे अन्य स्ट्रक्चर-प्रेडिक्शन बैकबोन पर भी वही लाभ दिखाई देते हैं, और क्या BioIR पैटर्न जल्द ही अधिक BioNeMo मॉडल में लैंड होगा।

[09:10] DeepSeek का V4.1-Flash मिलियन-टोकन मेमोरी को FP4 कैश में समेटता है

DeepSeek AI ने 10 सितंबर, 2026 को V4.1-Flash जारी किया, और यह रिलीज उस वर्कलोड को लक्षित करती है जो सभी को सिरदर्द दे रहा है: मिलियन-टोकन एजेंट रन।

V4.1-Flash एक मल्टीमॉडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है। इसकी बैकबोन में 552 बिलियन पैरामीटर हैं, जिसमें अतिरिक्त 196 बिलियन पैरामीटर हैं जिन्हें DeepSeek Engram कहता है, और मॉडल एक मिलियन-टोकन कॉन्टेक्स्ट विंडो स्वीकार करता है। सादे शब्दों में, यह एक कॉल में एक छोटी लाइब्रेरी के बराबर टेक्स्ट, कोड या इमेज पढ़ने के लिए बना है।

दिलचस्प इंजीनियरिंग दो जगहों पर है। पहला, FP4 KV कैश कम्प्रेशन। हर ट्रांसफॉर्मर एक चल रहे स्क्रैचपैड को बनाए रखता है जिसे KV कैश कहते हैं, जो अनिवार्य रूप से एक रिकॉर्ड है कि प्रत्येक इनपुट टोकन ने अब तक किस पर ध्यान दिया है। FP4 उस स्क्रैचपैड में प्रत्येक नंबर को 4 बिट्स में समेट देता है, जिससे GPU पर मिलियन-टोकन प्रॉम्प्ट को जारी रखने के लिए आवश्यक मेमोरी और बैंडविड्थ में नाटकीय कटौती होती है। दूसरा, क्रॉस-लेयर अटेंशन रीयूज़ आसन्न लेयर्स को उस स्क्रैचपैड के हिस्सों को साझा करने देता है बजाय उन्हें शुरू से दोबारा कंप्यूट करने के।

यह अभी क्यों मायने रखता है: लॉन्ग-हॉरिज़न एजेंट्स ने LLM सर्विंग को इनपुट-भारी काम बना दिया है। रिपीटेड प्री-फिल्स, जहां मॉडल हर टर्न में पूरे मिलियन-टोकन प्रॉम्प्ट को फिर से पढ़ता है, KV कैश एंट्रीज़ जमा करते हैं जो GPU मेमोरी, SSD क्षमता और इंटरकनेक्ट बैंडविड्थ पर दबाव डालती हैं। DeepSeek का मानना है कि कैश को कम्प्रेस करना और लेयर्स को अटेंशन स्टेट साझा करने देना अधिक मेमोरी खरीदने से सस्ता जवाब है।

बिल्डर्स के लिए, व्यावहारिक सवाल यह है कि FP4 कैशिंग प्लस शेयर्ड अटेंशन रियल एजेंट ट्रेसेस पर थ्रूपुट बनाए रखती है या नहीं, जैसे कोड रेपो, मल्टी-आवर ब्राउज़िंग सेशन और लंबे डॉक्यूमेंट रिव्यू, न कि सिर्फ सिंथेटिक लॉन्ग-कॉन्टेक्स्ट बेंचमार्क पर। अगर ऐसा होता है, तो समुदाय रेसिपी की एक लहर उम्मीद करें जो वही ट्रिक अन्य ओपन-वेट मॉडल्स पर पोर्ट करें।

[10:51] OpenAI और GSA ने गवर्नमेंट AI की लागत को शून्य किया

OpenAI और U.S. General Services Administration योग्य संघीय, राज्य, स्थानीय और जनजातीय सरकारों के लिए एक नया सौदा ला रहे हैं। 10 सितंबर को घोषित इस व्यवस्था के तहत, योग्य एजेंसियां लाइसेंस शुल्क में $0 देंगी और उपयोग लागत पर 50% छूट पाएंगी, साथ ही OpenAI से विस्तारित साइबर डिफेंस सपोर्ट मिलेगा।

यह पार्टनरशिप सार्वजनिक क्षेत्र में AI एक्सेस बढ़ाने और उन सुरक्षा चिंताओं को संबोधित करने के लिए डिज़ाइन की गई है जिन्होंने सरकारी अपनाने को धीमा किया है। साइबर डिफेंस सपोर्ट घोषणा में स्पष्ट है, जिसका मतलब है कि OpenAI छूट वाले एक्सेस के साथ तकनीकी सुरक्षा उपायों को बंडल कर रहा है, न कि सुरक्षा को अलग प्रोक्योरमेंट के रूप में मान रहा है।

Govtech स्पेस में बिल्डर्स के लिए, यह उन AI-संचालित सेवाओं को प्रोटोटाइप करने की लागत बाधा को कम करता है जिन्हें सरकारी सिस्टम से इंटरफेस करने की जरूरत है। राज्य, स्थानीय और जनजातीय एजेंसियां जो पहले एंटरप्राइज AI बजट को जस्टिफाई नहीं कर सकती थीं, अब प्रयोग करने का एक वित्त पोषित रास्ता रखती हैं, और उन एजेंसियों के साथ काम करने वाले कॉन्ट्रैक्टर्स को प्रपोज़ल के लिए एक स्पष्ट प्राइसिंग बेसलाइन मिलती है।

आगे देखने योग्य: हजारों अधिकार क्षेत्रों में पात्रता व्यवहार में कैसे परिभाषित की जाती है, "विस्तारित साइबर रक्षा समर्थन" वास्तव में डिलीवरी में क्या कवर करता है, और क्या Anthropic, Google, या ओपन-सोर्स फाउंडेशन जैसे प्रतिस्पर्धी प्रदाता अपने स्वयं के सरकारी आधार की रक्षा के लिए समान प्रस्तावों के साथ प्रतिक्रिया करते हैं।

[12:03] OpenAI ने Codex harness को प्रबंधित Agents API में बदल दिया

10 सितंबर को, OpenAI ने Agents API पेश किया, जो एजेंट बनाने और लॉन्च करने के लिए एक प्रबंधित क्लाउड सेवा है। यह Codex harness द्वारा संचालित है, जिसे OpenAI अब एक होस्टेड उत्पाद के रूप में उजागर कर रहा है, न कि डेवलपर्स के अपने मशीनों पर चलाने की चीज़।

Agents API डेवलपर्स के लिए तीन चीजें संभालती है। पहला, ऑर्केस्ट्रेशन: सेवा एजेंट के चरणों को क्रमबद्ध करती है और कॉल के बीच कार्य को रूट करती है, ताकि डेवलपर को अपना खुद का शेड्यूलर या स्टेट मशीन सेटअप नहीं करना पड़े। दूसरा, लंबे-चलने वाले सत्र: एक एजेंट अलग-अलग इंटरैक्शन में बना रह सकता है, जिसके बजाय हर बार जब कोई उपयोगकर्ता वापस आता है तब रीसेट होने के बजाय। तीसरा, टूल उपयोग: एजेंट बाहरी टूल्स और सिस्टम को कॉल कर सकता है, प्रबंधित सेवा उन कॉल्स को मध्यस्थता करती है, डेवलपर के प्रॉक्सी के बजाय।

पिच सीधी है। एजेंट चलाने के लिए ऑर्केस्ट्रेशन इन्फ्रास्ट्रक्चर खड़ा करने के बजाय, आप Agents API को कॉल करते हैं और एक क्लाउड-आधारित एजेंट भेजते हैं। OpenAI harness संचालित करता है; डेवलपर इस बात पर ध्यान केंद्रित करता है कि एजेंट को क्या करना चाहिए और वह किन टूल्स तक पहुंच सकता है। लॉन्च OpenAI को अन्य प्रबंधित एजेंट प्लेटफॉर्म के समान लेन में लाता है, लेकिन एक सामान्य रनटाइम के बजाय Codex को अंतर्निहित इंजन के रूप में उपयोग करके।

आगे देखने योग्य है कि टूल-उपयोग अनुमतियां कैसे स्कोप की जाती हैं और सेवा एजेंट और बाहरी सिस्टम जिन्हें वह कॉल करता है के बीच प्रमाणीकरण कैसे संभालती है। Agents API 10 सितंबर से लाइव है, और यह पहली बार है जब Codex harness को एक सामान्य-उद्देश्य प्रबंधित उत्पाद के रूप में पेश किया गया है जिस पर कोई भी बना सकता है।

[13:35] शोध डाइजेस्ट: AI हॉल्यूसिनेशन पकड़ने का एक नया तरीका, और उन्हें आधा करना

शोधकर्ताओं ने एक नया तरीका बनाया है जो फ्लैग करता है जब एक AI मॉडल तथ्यों का आविष्कार करता है। उनकी पाइपलाइन एक बार में कई कोणों से जवाब की जांच करती है: एक प्रशिक्षित क्लासिफायर निर्धारित करता है कि प्रत्येक दावा विश्वसनीय है या नहीं, एक अनिश्चितता स्कोर उन हिस्सों को फ्लैग करता है जिनके बारे में मॉडल खुद अनिश्चित है, और एक अंशांकन चरण उन संकेतों को एक तुलनीय पैमाने पर रखता है। मानक HaluEval बेंचमार्क पर, सिस्टम ने प्रश्न उत्तर, सारांश, और संवाद में झूठे दावों को सटीक रूप से पहचाना।

टीम ने यह भी दिखाया कि एक बार जब आप हॉल्यूसिनेशन को पहचान सकते हैं तो क्या करना है। उन्होंने Qwen2.5-0.5B नामक एक छोटे ओपन-सोर्स मॉडल को एक प्राथमिकता-प्रशिक्षण तकनीक के साथ फाइन-ट्यून किया जो मॉडल को सच्चे जवाब चुनने के लिए पुरस्कृत करती है बनाम झूठे बनाने के लिए। इससे मॉडल की हॉल्यूसिनेशन दर लगभग आधी हो गई।

बिल्डर्स के लिए, यह एक व्यावहारिक नुस्खा है: एक डिटेक्टर को प्राथमिकता प्रशिक्षण के साथ मिलाएं, और आपको एक मॉडल मिलता है जो स्वीकार करता है जब वह अनुमान लगा रहा है और सीखता है कि कम अनुमान कैसे लगाएं।

[14:30] GitHub Copilot adds Jira tie-in and an adaptive CLI

GitHub ने 10 सितंबर को Copilot वीकली रिकैप प्रकाशित किया, जिसमें 7 सितंबर के आसपास किए गए परिवर्तनों को शामिल किया गया। पोस्ट में तीन आइटम हैं। Copilot ऐप को Jira इंटीग्रेशन मिलता है, जो Copilot वर्कस्पेस में इश्यू-ट्रैकर कॉन्टेक्स्ट लाता है। Copilot CLI "एडाप्टिव मॉडल ऑर्केस्ट्रेशन" को Project HydraFusion के नाम से लॉन्च करता है, जो CLI को एकल मॉडल तक सीमित रखने के बजाय काम बदलने पर अनुकूल रूप से मॉडल को समन्वयित करने का तरीका देता है। पोस्ट में Visual Studio Code के अंदर नए एजेंट ऑटोमेशन की भी घोषणा है, हालांकि चेंजलॉग सारांश specific क्षमताओं को सूचीबद्ध करने से पहले कट जाता है। सब को मिलाकर, GitHub Copilot को उसकी मूल एकल-चैट सतह से आगे प्रोजेक्ट-ट्रैकिंग टूल्स और अंदर-CLI मॉडल चॉइस के साथ गहरे संबंधों की ओर ले जा रहा है। VS Code वाले हिस्से का पूरा विवरण लिंक की गई पोस्ट में देखना बाकी है।

[15:18] OpenAI's Agents API Goes Live in Public Beta

OpenAI ने 10 सितंबर को Agents API को पब्लिक बीटा में डाला, और अब हर डेवलपर इसका उपयोग कर सकता है। पिच सीधी है: यह वही हार्नेस और इन्फ्रास्ट्रक्चर है जो Codex को पावर देता है, खोल दिया गया ताकि कोई भी इसे अपने प्रोडक्ट में वायर कर सके।

जो अंतर मायने रखता है वह यह है कि किसके पास क्या है। OpenAI हार्नेस को होस्ट और मेंटेन करता है, इसलिए टीम अपडेट, रनटाइम पैच और ऑर्केस्ट्रेशन लेयर को हैंडल करती है। डेवलपर्स तय करते हैं कि एजेंट का असली कंप्यूट कहां चलता है। तीन ऑप्शन हैं: एक OpenAI-मैनेज्ड सैंडबॉक्स, डेवलपर का खुद का इन्फ्रास्ट्रक्चर, या पार्टनर सैंडबॉक्स। आखिरी ऑप्शन वह है जिसकी डेटा टीमों को परवाह होगी — अगर आपको कंप्यूट को किसी specific एनवायरनमेंट के अंदर रखना है, तो आप इसे मैनेज्ड पाथ के बजाय अपने खुद के स्टैक पर पॉइंट कर सकते हैं।

यह आज ही डिप्लॉय करने योग्य, लाइव प्रोडक्ट है, वेटलिस्ट नहीं। यह मायने रखता है: हार्नेस बिल्डर्स खुद जो चला रहे थे अब एक API कॉल से पहुंच योग्य है, OpenAI इसे अप-टू-डेट रखने की जिम्मेदारी लेते हुए।

एक चीज जिस पर नजर रखनी चाहिए: जब डेवलपर्स के पास प्रोडक्शन में एजेंट हों तो OpenAI हार्नेस अपडेट कैसे हैंडल करता है। अगर लाइव एजेंट्स के नीचे ऑर्केस्ट्रेशन बदलता है, तो यह स्थिरता का सवाल बन जाता है, क्योंकि ज्यादा टीमें पब्लिक बीटा के खिलाफ शिप करेंगी।

[16:33] A Self-Hosted TikTok and Douyin Download API Just Hit v5.0.3

TikTok और Douyin के लिए एक सेल्फ-होस्टेड स्क्रैपर ने एक नया रिलीज लॉन्च किया है, और इसे चलाने के तरीकों की विविधता ही खबर है। Evil0ctal ने 11 सितंबर, 2026 को Douyin_TikTok_Download_API v5.0.3 पुश किया। रेपो अब 20,000 से ज्यादा GitHub स्टार्स पर है।

टूल की पिच सीधी है: TikTok और Douyin से वॉटरमार्क के बिना वीडियो डाउनलोड करें, और इसके साथ पोस्ट, प्रोफाइल, कमेंट्स और प्लेलिस्ट के बारे में स्ट्रक्चर्ड डेटा निकालें। जो v5.0.3 को दिलचस्प बनाता है वह यह है कि उस डेटा को कितने सतहों पर एक्सपोज किया गया है। अंदर की तरफ, एक async REST API रिक्वेस्ट्स को हैंडल करती है। उसके ऊपर, प्रोजेक्ट एक Model Context Protocol (MCP) सर्वर, एक CLI और एक वेब कंसोल लॉन्च करता है। इसका मतलब यह है कि उसी आर्काइव को एजेंट द्वारा क्वेरी किया जा सकता है, टर्मिनल से स्क्रिप्ट किया जा सकता है, या ब्राउज़र टैब में देखा जा सकता है।

डिप्लॉयमेंट जानबूझकर घर्षण-मुक्त रखा गया है: एक सिंगल docker compose up API को एक PostgreSQL आर्काइव के साथ लाता है, ताकि फेच किए गए वीडियो और मेटाडेटा रन के बीच बने रहें। प्रोजेक्ट एक सेल्फ-हीलिंग आइडेंटिटी पूल पर भी निर्भर करता है, जो कुकीज या फिंगरप्रिंट्स को रोटेट करता है जिनका उपयोग स्क्रैपर प्लेटफॉर्म्स को अपनी पहचान देने के लिए करता है। व्यवहार में, यह रोटेशन ही टूल को TikTok और Douyin के स्क्रैपर के खिलाफ निरंतर कैट-एंड-माउस खेल में जीवित रहने देता है — प्रोजेक्ट का अपना कॉन्ट्रिब्यूशन लेयर नए ब्लॉक्स को एब्जॉर्ब करता है, हर यूजर को हाथ से क्रेडेंशियल्स पैच करने के बजाय।

बिल्डर्स के लिए, जो चीज बकाया है वह है MCP सर्वर। कोई भी एजेंट या चैट क्लाइंट जो पहले से MCP बोलता है, अब TikTok और Douyin अकाउंट्स को स्ट्रक्चर्ड डेटा सोर्सेज के रूप में ट्रीट कर सकता है — पोस्ट्स, प्रोफाइल्स, कमेंट्स, और प्लेलिस्ट्स को डिमांड पर पुल करना — बिना स्क्रैपर स्क्रैच से लिखे। क्रिएटर्स और रिसर्चर्स जो अपना प्राइवेट आर्काइव चाहते हैं, होस्टेड स्क्रैपर के मंथली बिल के बजाय, उन्हें अपने ऑन-रैंप के रूप में एक सिंगल Docker कमांड मिलता है। एक चीज जिस पर अगला ध्यान देना है: सेल्फ-हीलिंग आइडेंटिटी पूल कितनी देर तक गति बनाए रखता है अब जब दोनों प्लेटफॉर्म्स ऑटोमेटेड एक्सेस को टाइट करना जारी रखते हैं।

[18:31] OpenAI का Data एजेंट कंपनी फाइल्स को चैट से डैशबोर्ड में बदलता है

OpenAI ने ChatGPT Work में एक Data एजेंट जोड़ा है, जिसकी घोषणा 10 सितंबर को कंपनी के न्यूज चैनल के माध्यम से की गई। एजेंट का बताया गया उद्देश्य सीधा है: कंपनी के डेटा से कनेक्ट करें, इनसाइट्स सरफेस करें, और इंटरैक्टिव डैशबोर्ड असेंबल करें — नेचुरल-लैंग्वेज प्रॉम्प्ट से, स्प्रेडशीट या SQL क्वेरी के बजाय।

यह आखिरी टुकड़ा ही मतलबपूर्ण शिफ्ट है। जिस ऑडियंस की घोषणा में बात की गई है वह 'हर कोई' है, एनालिस्ट्स नहीं, मतलब प्रोडक्ट उस व्यक्ति के लिए पोजिशन किया गया है जो बिजनेस सवाल के सबसे करीब है जिसे आमतौर पर रिक्वेस्ट फाइल करनी पड़ती है और इंतज़ार करना पड़ता है। एक नेचुरल-लैंग्वेज इंटरफेस जो जवाब और विज़ुअल आर्टिफैक्ट दोनों प्रोड्यूस करता है, सवाल-पूछने वाले, एनालिस्ट, और डैशबोर्ड टूल के बीच टिपिकल हैंडऑफ को गिरा देता है।

जो घोषणा वास्तव में कन्फर्म करती है वह संकरी है: Data agent नामक एक प्रोडक्ट, ChatGPT Work के अंदर एक घर, तीन क्षमताएं (कनेक्ट, अनकवर, बिल्ड डैशबोर्ड), और एक नेचुरल-लैंग्वेज इंटरफेस। जो उसने स्पेसिफाई नहीं किया है वह है कि कौन से डेटा सोर्सेज नेटिवली कनेक्ट करते हैं, क्या डैशबोर्ड एडिटेबल आर्टिफैक्ट्स हैं या वन-ऑफ आउटपुट्स, या एक्सेस कंट्रोल्स कैसे काम करते हैं।

बिल्डर्स और ऑपरेटर्स के लिए, व्यावहारिक सवाल यह है कि क्या यह वर्कफ्लो को रिप्लेस करता है या एक नया जोड़ता है। घोषणा का ईमानदार मतलब यह है कि OpenAI कंपिटीटर्स के उसी दरवाजे को बंद करने से पहले कन्वर्सेशनल एनालिटिक्स लेयर पर दावा ठोक रहा है। अगला ध्यान देने योग्य: एजेंट सोर्स साइटेशंस को कैसे हैंडल करता है, और क्या डैशबोर्ड कन्वर्सेशन से स्टैंडअलोन डेलिवरेबल्स के रूप में बचते हैं।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily