TobyOnFitnessTech
किमी के-3 2.8T पैरामीटर पर पहुंचता है, मूल्य अधिक है — Episode 89 cover art
Episode 89·20 जुलाई 2026·45:44

किमी के-3 2.8T पैरामीटर पर पहुंचता है, मूल्य अधिक है

Moonshot's Kimi K3 arrives at 2.8 trillion parameters with pricing that pressures Western frontier labs. Prism-ML's Ternary-Bonsai-27B trends on the leaderboards as a local-AI power move for resource-constrained setups. Codebase Memory MCP slashes coding-agent token consumption by 99%, reshaping how developers budget context. NVIDIA and Hugging Face publish a fine-tuning scaling guide for video and image models. Medicare's WISeR pilot places AI in prior-authorization workflows across six states. Research spotlights: LongStraw pushes RL training beyond two million tokens, while VideoChat3 advances open video models toward generalist use. Plus the Agent Stack Release Readout with Codex rust-v0.144.6, FastMCP 3.4.4, and Unity-MCP 10.1.0. Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-89/

🎧 Listen to Episode

एपिसोड 089 — 19 जुलाई, 2026

[00:00] एपिसोड हुक

Moonshot AI ने 16 जुलाई, 2026 को Kimi K3 जारी किया, जो डेवलपर्स के सामने पहली बार 2.8-ट्रिलियन-पैरामीटर का ओपन मॉडल लेकर आया — 3-ट्रिलियन क्लास में break करने वाली पहली खुले तौर पर उपलब्ध रिलीज। जो हिस्सा चोट करता है वह कीमत है: Moonshot एक प्रीमियम मांग रहा है जो K3 को peers से ऊपर रखता है, और प्रारंभिक बेंचमार्क suggest करते हैं कि यह पिछले ओपन-वेट फ्रंटियर कंटेंडर्स को पीछे छोड़ देता है। API टियर्स में कीमत विवरण अभी भी आ रहे हैं। इसके अलावा, OpenAI ने 18 जुलाई को Codex CLI rust-v0.144.6 शिप किया, एक केंद्रित बग फिक्स जो GPT-5.6 Sol, Terra, और Luna टियर्स के लिए बंडल्ड मॉडल मेटाडेटा को रिफ्रेश करता है और उनके कॉन्टेक्स्ट विंडोज को सही करता है। और Hugging Face पर, prism-ml का Ternary-Bonsai-27B ट्रेंडिंग सूची में चढ़ रहा है — एक 27-अरब-पैरामीटर चैट मॉडल जो 2-बिट टर्नरी प्रिसिजन पर GGUF में शिप किया गया है, जो लोकल इंफरेंस बजट को लक्षित करता है।

[02:00] Agent Stack Release Readout: OpenAI Codex rust-v0.144.6

OpenAI ने इस सप्ताह अपने Codex CLI में एक छोटा लेकिन मूलभूत बग फिक्स जारी किया: rust-v0.144.6 ने 18 जुलाई को लैंड किया और तीन GPT-5.6 मॉडल टियर्स के लिए बंडल्ड मेटाडेटा को टाइट कर दिया — Sol, Terra, और Luna। फिक्स उनके कॉन्टेक्स्ट विंडोज को 272,000 टोकन तक सही करता है और हार्नेस के साथ आने वाले बंडल्ड निर्देशों को रिफ्रेश करता है।

यह मायने रखता है क्योंकि Codex एक कोडिंग एजेंट है, और एक एजेंट जो सोचता है कि उसके पास जितना कॉन्टेक्स्ट है उससे अधिक है — या कम — वह चुपचाप गलत व्यवहार कर सकता है। अगर हार्नेस 200K विंडो का दावा करता है लेकिन असली मॉडल 272K का समर्थन करता है, तो बिल्डर्स टेबल पर उपयोगी जगह छोड़ देते हैं। अगर हार्नेस 400K का दावा करता है लेकिन मॉडल 272K पर सीमित है, तो एजेंट लंबे सत्रों को चुपचाप ट्रंक कर देगा या काम को अस्वीकार कर देगा जो आराम से फिट होना चाहिए। किसी भी दिशा में एक समस्या है। यह रिलीज दोनों पक्षों को एक ही जगह लाती है, जो आप एक मेटाडेटा रिफ्रेश से चाहते हैं।

बदलाव एक ही इंजीनियर से दो पुल रिक्वेस्ट में आया। पहला ने 0.144 लाइन में बंडल्ड मॉडल मेटाडेटा को रिफ्रेश किया। दूसरा ने हॉटफिक्स को विशेष रूप से GPT-5.6 प्रॉम्प्ट्स और कॉन्टेक्स्ट तक सीमित कर दिया, ताकि उसी रिलीज पर अन्य मॉडल परिवार अछूते रहें। जो कोई भी आज GPT-5.6 वेरिएंट के साथ Codex चला रहा है, यह अपडेट लेने योग्य है, खासकर लंबे चलने वाले refactors या मल्टी-फाइल migrations शुरू करने से पहले, जहां 200K और 272K विंडो के बीच का अंतर एजेंट को एक पास में खत्म होने या बीच में रुकने में फर्क कर सकता है।

बिल्डर्स के लिए, व्यावहारिक सबक सीधा है। अगर आप स्क्रिप्ट्स या CI में Codex पिन करते हैं, तो वर्जन बंप करें और एक प्रतिनिधि सत्र फिर से चलाएं ताकि पुष्टि हो सके कि एजेंट अब आधिकारिक GPT-5.6 स्पेसक्स के रूप में व्यवहार करता है। कॉन्टेक्स्ट नंबर एजेंट की योजना, उसकी कार्यशील स्मृति में क्या रख सकता है, और वह एक बार में आपके रिपॉजिटरी के कितने हिस्से पर तर्क कर सकता है, इसका वास्तविक इनपुट है। आपके रिलीज नोट्स में एक लाइन के लायक, परीक्षण के कुछ मिनट के लायक।

अगला क्या देखना है: 0.144 लाइन पर अन्य मॉडल परिवारों के लिए मेटाडेटा रिफ्रेश करने वाला कोई भी फॉलो-अप पैच, या कोई 0.145 रिलीज जो इन फिक्सेस को एक व्यापक ड्रॉप में समेकित करता है।

[03:26] Moonshot ने 2.8T पैरामीटर पर Kimi K3 गिराया — कीमत चोट करती है

Moonshot AI ने आज सुबह Kimi K3 लॉन्च किया, और मुख्य आंकड़ा 2.8 ट्रिलियन पैरामीटर है — जिसे वे "3-ट्रिलियन क्लास" कह रहे हैं उसका पहला खुले तौर पर उपलब्ध मॉडल। परिप्रेक्ष्य में बताएं तो, यह उनके पिछले K2.6 से दोगुने से ज्यादा है, और यह DeepSeek के 1.6-ट्रिलियन v4 Pro को पीछे छोड़कर खुले-वेट क्राउन पर कब्जा कर लिया है।

बेंच परिणाम आंखें खोलने वाले हैं। Artificial Analysis के प्राइवेट लॉन्ग-होराइज़न नॉलेज वर्क टेस्ट पर, K3 का बेंचमार्क Elo 1547 है — K2.6 से 732 पॉइंट की छलांग, और Claude Fable 5 के बाद दूसरे नंबर पर। इसने Arena.ai के Frontend Code लीडरबोर्ड पर भी टॉप स्थान हासिल किया, एक ऐसे एरीना में Claude Fable 5 को हराया जो मॉडलों को असल जैसी वेब इंटरफेस बनाने में कितनी अच्छाई से मापता है। Moonshot के सेल्फ-रिपोर्टेड आंकड़ों के मुताबिक, K3 ने Claude Opus 4.8 max और GPT-5.5 high को हराया है, लेकिन Claude Fable 5 और GPT-5.6 Sol से अभी भी पीछे है।

लेकिन यहां सबसे जरूरी बात है जो बिल्डर्स के लिए मायने रखती है: प्राइसिंग प्रति मिलियन इनपुट टोकन के लिए $3 और आउटपुट के लिए $15 है। यह K3 को Anthropic के Claude Sonnet के समान टियर में रखता है — और इसे सबसे महंगा मॉडल बनाता है जो किसी चीनी लैब ने अब तक शिप किया है, जो K2.6 के $0.95 इनपुट और $4 आउटपुट से काफी बड़ी छलांग है। Artificial Analysis के पर-टास्क व्यू में, K3 $0.94 प्रति टास्क पर है, जो GPT-5.6 Sol के $1.04 के करीब है और Opus 4.8 के $1.80 का लगभग आधा है, हालांकि ओपन-वेट पियर्स से अभी भी ज्यादा है। सिल्वर लाइनिंग: K3 उनके इंटेलिजेंस इंडेक्स पर K2.6 की तुलना में 21% कम आउटपुट टोकन का उपयोग करता है, इसलिए बिल उस दर से धीरे-धीरे बढ़ता है जितना पर-टोकन रेट संकेत देता है।

आप इसे अभी Moonshot की वेबसाइट या API के जरिए आज़मा सकते हैं, 27 जुलाई तक ओपन-वेट ड्रॉप का वादा है। जिस बात पर नज़र रखनी चाहिए वह यह है कि क्या वह ओपन रिलीज़ वही प्राइसिंग मैथ रखती है — या क्या यही वह चीज़ है जो कम्युनिटी को असल में चलाने को मिलती है।

[05:17] Prism-ML का Ternary-Bonsai-27B लोकल-AI पावर मूव के तौर पर ट्रेंडिंग पर

एक मॉडल जिसका नाम Ternary-Bonsai-27B है, वह 4 जुलाई को Hugging Face ट्रेंडिंग लिस्ट पर आया, और वजह है कंप्रेशन। Prism-ML ने GGUF फॉर्मेट में 27-बिलियन-पैरामीटर चैट मॉडल शिप किया है जिसमें वेट 2-बिट टर्नरी प्रिसीज़न पर स्टोर हैं, llama.cpp के लिए पैकेज्ड और CUDA और Metal एक्सेलेरेशन के लिए टैग्ड। यह पहले ही हब पर 338,000 डाउनलोड और 760 लाइक्स क्लियर कर चुका है।

मुख्य मैकेनिक खुद क्वांटाइज़ेशन है। 2-बिट टर्नरी स्कीम हर वेट को तीन वैल्यू में से एक के रूप में स्टोर करती है, जो समान मॉडलों के टिपिकल 4-बिट GGUF बिल्ड्स की तुलना में फाइल साइज़ को कम करती है। कन्वर्सेशनल फाइन-ट्यूनिंग के साथ मिलाकर जिसके लिए रेपो टैग्ड है, यह बिल्डर्स को एक चैट-रेडी 27B देता है जो एक डाउनलोडेबल आर्टिफैक्ट के रूप में फिटता है जिसे आप सिंगल कंज्यूमर Nvidia GPU, Apple Silicon MacBook, या यहां तक कि llama.cpp के जरिए CPU-ओनली मशीन पर लोड कर सकते हैं। रेपो पर टैग्स यह बात साफ करते हैं।

कम्युनिटी का वॉल्यूम फास्ट एडॉप्शन सिग्नल करता है। लोकल-AI टिंकरर्स ट्रेंडिंग लिस्ट पर इस तरह के ड्रॉप के लिए ठीक देखते हैं: एक मॉडल जो बड़ा होने लगे, लेकिन इतना छोटा कि उसे रेंटेड क्लस्टर की जरूरत न हो। एजेंट बिल्डर्स के लिए प्रैक्टिकल पिच एक सिंगल लोकल चैट एंडपॉइंट है जिसे पर-टोकन भुगतान किए बिना स्टैक में स्वैप किया जा सके, और हॉबिस्ट के लिए यह कैपेबल मॉडल को पूरी तरह ऑफलाइन चलाने का एक तरीका है।

अगली चीज़ों पर नज़र रखनी चाहिए: llama.cpp और Ollama रियल हार्डवेयर पर टर्नरी वेट्स को कैसे हैंडल करते हैं, क्या नेबरबोरिंग प्रिसीज़न पर डेरिवेटिव क्वांट्स उसी रेपो में दिखते हैं, और जब हेड-टू-हेड रिव्यू शुरू होंगे तो मॉडल की कन्वर्सेशन क्वालिटी स्टैंडर्ड 4-बिट बेसलाइन के खिलाफ कैसी रहती है। अगर क्वालिटी बनी रही और छोटा फुटप्रिंट फास्ट टोकन पर सेकंड में तबदील होता है, तो यह तरह का ड्रॉप है जो चुपचाप "लोकल" के मतलब को फिर से तय करता है।

[07:08] Medicare का WISeR छह राज्यों में प्रायोरिटी-ऑथराइज़ेशन के लिए AI लगाता है

Medicare ने कुछ Original Medicare सेवाओं के लिए prior-authorization प्रक्रिया में AI लगाया है, और यह कार्यक्रम अब छह राज्यों में सक्रिय है। WISeR Model, जिसे CMS ने जनवरी 2026 में लॉन्च किया था, दिसंबर 2031 तक एरिज़ोना, न्यू जर्सी, ओहायो, ओक्लाहोमा, टेक्सास और वॉशिंगटन में चलेगा। छह तकनीकी कंपनियां भाग ले रही हैं, प्रति राज्य एक, और उनके भुगतान उन समीक्षाओं से रोकी गई देखभाल की लागत से जुड़े हैं।

यह ठोस बदलाव है: स्थापित कवरेज मानदंडों और अपव्यय, धोखाधड़ी या नुकसान के उच्च जोखिम वाली सेवाओं की चुनिंदा सूची के लिए, AI टूल भुगतान से पहले दावों की जांच करते हैं। उदाहरणों में त्वचा और ऊतक स्थानापन्न, विद्युत तंत्रिका-उत्तेजक इम्प्लांट और ऑस्टियोआर्थराइटिस के लिए घुटने का आर्थोस्कोपी शामिल हैं। आपातकालीन मामले और केवल अंतःस्थापित सेवाएं बाहर हैं, जैसे वे स्थितियां जहां देरी से रोगी को नुकसान का जोखिम हो। और महत्वपूर्ण बात, भुगतान अस्वीकार करने के प्रत्येक अंतिम सिफारिश को एक लाइसेंस प्राप्त चिकित्सक को बनाना होगा। AI केस प्रस्तुत करता है; एक मनुष्य अनुमोदन देता है।

प्रदाता सेवा प्रदान करने से पहले prior authorization का अनुरोध कर सकते हैं, या वितरण के बाद भुगतान-पूर्व समीक्षा का सामना कर सकते हैं। समय के साथ अनुपालन बनाए रखने वाले प्रदाता गोल्ड-कार्ड छूट के लिए अर्हता प्राप्त कर सकते हैं जो समीक्षा को पूरी तरह छोड़ देती है। कवरेज नियम नहीं बदलते, Medicare Advantage प्रभावित नहीं है, और लाभार्थी अपने Original Medicare प्रदाता की पसंद बनाए रखते हैं।

प्रोत्साहन संरचना वह हिस्सा है जिस पर नजर रखनी चाहिए। CMS भाग लेने वाले विक्रेताओं को उन खर्चों के आधार पर भुगतान करता है जिन्हें उनकी समीक्षाएं रोकती हैं, फिर प्रदाता अनुभव जैसे प्रक्रिया उपायों के लिए उस आंकड़े को समायोजित करता है। सरल भाषा में: कंपनियां तब अधिक कमाती हैं जब उनका AI अधिक संदिग्ध सेवाओं को चिह्नित करता है, इसलिए डिज़ाइन को यह साबित करना होगा कि यह आक्रामक अस्वीकृतियों को पुरस्कृत नहीं कर रहा है या आवश्यक देखभाल को धीमा नहीं कर रहा है। तेज़ निर्णयों और कम लागत के वादों को छह साल के साक्ष्य की आवश्यकता वाले लक्ष्यों के रूप में मानें, प्रदर्शित परिणामों के रूप में नहीं। अपील डेटा के पहले दौर और प्रदाता-अनुभव स्कोर पर नज़र रखें; यह सबसे पहला असली संकेत होगा कि यह वास्तव में काम करता है या नहीं।

[08:59] NVIDIA और Hugging Face ने वीडियो और इमेज मॉडल को फाइन-ट्यून करने के लिए एक स्केलिंग गाइड प्रकाशित किया

17 जुलाई को, Hugging Face और NVIDIA ने 'Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers' शीर्षक से एक संयुक्त ब्लॉग प्रकाशित किया। पोस्ट को उन टीमों के लिए एक व्यावहारिक मार्गदर्शिका के रूप में प्रस्तुत किया गया है जो मौजूदा इमेज और वीडियो टूल के पीछे मौजूद जनरेटिव सिस्टम की श्रेणी - डिफ्यूज़न मॉडल को कस्टमाइज़ करना चाहती हैं - दोनों कंपनियों के बुनियादी ढांचे का उपयोग करके।

यह संयोजन दो नामित टुकड़ों पर केंद्रित है: NVIDIA का NeMo Automodel और Hugging Face का Diffusers लाइब्रेरी। ब्लॉग वर्कफ़्लो को एक ऐसे तरीके के रूप में प्रस्तुत करता है जो वीडियो और इमेज जनरेशन के लिए फाइन-ट्यूनिंग को बिना शुरू से एक कस्टम ट्रेनिंग लूप लिखे स्केल करने का तरीका है। यह फ्रेमिंग महत्वपूर्ण है क्योंकि वीडियो मॉडल को फाइन-ट्यून करना ऐतिहासिक रूप से एक भारी कंप्यूट काम रहा है, और प्रलेखित नुस्खे पतले रहे हैं।

बिल्डर्स के लिए, व्यावहारिक सवाल यह है कि यह आज क्या अनलॉक करता है। ब्लॉग एक शुरुआती बिंदु है - इसमें कोई नया मॉडल, नया चिप, या होस्टेड सर्विस की घोषणा नहीं है। यह लिखावट है कि दोनों स्टैक्स को एक साथ कैसे जोड़ा जा सकता है, जिसका लक्ष्य बड़े पैमाने पर फाइन-ट्यूनिंग को खुले समुदाय के लिए अधिक पुनरुत्पादन योग्य बनाना है।

एक कारण कि यह तरह का गाइड अभी आता है: ओपन-सोर्स डिफ्यूज़न इकोसिस्टम परिपक्व हो गया है कि ट्रेनिंग कोड अब बाधा नहीं है। यह जानना कि कौन से नॉब्स घुमाने हैं और GPU में वर्कलोड को कैसे वितरित करना है, यही बाधा है। ट्यूटोरियल जो एक जगह पर वे विकल्प प्रलेखित करते हैं, वे टीमों को हफ्तों की ट्रायल एंड एरर बचाते हैं।

आगे क्या देखना है: फॉलो-अप पोस्ट जो विशिष्ट समर्थित मॉडल परिवारों के नाम बताते हैं, मल्टी-GPU रन पर वास्तविक बेंचमार्क नंबर, और किसी भी समुदाय पुनरुत्पादन। जब तक वे प्रकट नहीं होते, सबसे सुरक्षित पठन यह है कि यह एक प्रलेखन मील का पत्थर है, उत्पाद लॉन्च नहीं - फाइन-ट्यूनिंग कार्य की योजना पहले से बना रही टीमों के लिए उपयोगी, और बाकी सभी के लिए बुकमार्क करने योग्य।

[10:47] रिसर्च डाइजेस्ट: LongStraw पुश करता है RL ट्रेनिंग को 20 लाख टोकन से आगे

आज की रिसर्च हाइलाइट है LongStraw, एक नया सिस्टम जो टीमों को रिइन्फोर्समेंट लर्निंग के साथ AI एजेंट्स को ट्रेन करने देता है 20 लाख से अधिक टोकन के कॉन्टेक्स्ट विंडो पर — बिना ज़्यादा GPU की ज़रूरत के।

यहाँ वो गैप है जिसे भरने की कोशिश की गई है। आधुनिक इन्फरेंस सिस्टम पहले से ही लगभग दस लाख टोकन लंबी बातचीत और दस्तावेज़ों को हैंडल कर सकते हैं। लेकिन ट्रेनिंग स्टेप जो रिइन्फोर्समेंट लर्निंग के ज़रिए एजेंट्स को सिखाता है, पीछे रह गया है, अक्सर 256K टोकन पर सीमित। AI एजेंट्स के लिए जो लंबे स्ट्रीम ऑफ टूल कॉल्स, दस्तावेज़ों और पिछले फैसलों को संभालते हैं, यह मिसमैच मायने रखता है — आप एक बहुत छोटी मेमोरी पर ट्रेनिंग कर रहे हैं जितनी एजेंट रनटाइम पर अंततः उपयोग करेगा।

LongStraw एक आर्किटेक्चर-अवेयर एक्जीक्यूशन स्टैक है जो फिक्स्ड GPU बजट में दस लाख टोकन रिइन्फोर्समेंट-लर्निंग पोस्ट-ट्रेनिंग को फिट करता है। इसे ऐसे सोचें जैसे एजेंट्स को उन प्रकार की बिखरी हुई, मल्टी-स्टेप ट्रैजेक्टरीज़ पर ट्रेन करना जिनका वे असल में प्रोडक्शन में सामना करते हैं, न कि छोटे प्रॉक्सी पर।

ध्यान दें: ओपन-सोर्स रिलीज़ कितनी जल्दी मेजर RL ट्रेनिंग फ्रेमवर्क में आती है, और क्या एजेंट लैब्स दस लाख टोकन ट्रेनिंग को नया डिफ़ॉल्ट बनाते हैं।

[11:52] रिसर्च डाइजेस्ट: VideoChat3 पुश करता है ओपन वीडियो AI को सच्चे जनरलिस्ट यूज़ की ओर

वीडियो समझने के मॉडल लगातार बेहतर हो रहे हैं, लेकिन एक पकड़ है: अधिकांश या तो कॉर्पोरेट दीवारों के पीछे बंद हैं या केवल एक प्रकार के वीडियो पर अच्छा काम करते हैं। VideoChat3 नाम का एक नया पेपर, जो HuggingFace के डेली फीड पर ट्रेंड कर रहा है, दोनों समस्याओं को एक साथ ठीक करने की कोशिश करता है। टीम ने एक पूरी तरह से ओपन मल्टीमॉडल मॉडल बनाया है जो मोशन, लंबे वीडियो और स्ट्रीमिंग इनपुट को हैंडल कर सकता है बिना अलग स्पेशलिस्ट वर्जन की ज़रूरत के। सादे अंग्रेज़ी में, इसका मतलब है कि वही मॉडल एक स्पोर्ट्स हाइलाइट, एक कुकिंग ट्यूटोरियल और एक सिक्योरिटी कैमरा फीड देख सकता है और हर एक में असल में क्या हो रहा है समझ सकता है।

यह क्यों मायने रखता है: ओपन वेट्स प्लस ओपन ट्रेनिंग डेटा का मतलब है कि एक छोटी टीम अपने फुटेज पर फाइन-ट्यून कर सकती है बिना API फीस दिए या वीडियो किसी तीसरे पक्ष को भेजे बिना। दूसरा हुक है एफिशिएंसी का — पेपर दावा करता है कि तुलनीय ओपन मॉडल्स की तुलना में कम कंप्यूट डिमांड्स हैं, जो तब मायने रखता है जब आप इसे वर्कस्टेशन GPU पर चला रहे हों न कि डेटा सेंटर में।

ध्यान दें: यह बेंचमार्क के बाहर रियल-वर्ल्ड वीडियो पर कैसे टिकता है, और क्या कम्युनिटी वास्तव में इसे एडाप्टेशन के लिए अपनाती है।

[13:00] Codebase Memory MCP कोडिंग एजेंट टोकन यूज़ को 99% तक कम करता है

codebase-memory-mcp नाम का एक नया MCP सर्वर 8 जुलाई को वर्शन 0.9.0 जारी करता है, और यह AI-सहायित कोडिंग में सबसे बड़े घर्षण बिंदुओं में से एक को संबोधित करता है: एक मॉडल को आपके पूरे codebase तक तेज़, सस्ता एक्सेस प्रदान करना। DeusData ने इसे शून्य निर्भरताओं के साथ एक एकल स्टैटिक बाइनरी के रूप में बनाया है — आप इसे एक मशीन पर रखते हैं और यह औसत रिपॉजिटरी को मिलीसेकंड में एक निरंतर ज्ञान ग्राफ में इंडेक्स करता है। एक बार इंडेक्स होने के बाद, क्वेरी 158 प्रोग्रामिंग भाषाओं में एक मिलीसेकंड से कम समय में वापस आती हैं, और सर्वर दावा करता है कि यह मॉडल के कॉन्टेक्स्ट विंडो में कच्चा सोर्स डालने की तुलना में 99% कम टोकन का उपयोग करता है।

सरल भाषा में, MCP वह प्रोटोकॉल है जो एक AI असिस्टेंट को बाहरी टूल्स को कॉल करने की अनुमति देता है, इसलिए यह सर्वर एक ऐसा टूल बन जाता है जिसे एजेंट आपके कोड के बारे में कुछ जानने के लिए कभी भी कॉल कर सकता है। यह वर्कफ़्लो को पलट देता है: फ़ाइलों को चैट में पेस्ट करने के बजाय, एक एजेंट सर्वर से "ऑथेंटिकेशन कहाँ हैंडल होता है?" या "कौन से फंक्शन इस API को कॉल करते हैं?" जैसे सवाल पूछ सकता है और हज़ारों लाइनों के सोर्स को मॉडल के माध्यम से खींचे बिना एक केंद्रित जवाब प्राप्त कर सकता है। किसी भी MCP-सक्षम कोडिंग एजेंट में इसे वायर करने वाले डेवलपर के लिए, रोज़मर्रा का बदलाव स्निपेट्स कॉपी-पेस्ट करने से कम और असिस्टेंट को मानव की तरह रेपो में नेविगेट करने की अनुमति देने से ज़्यादा है — बस तेज़, और अप्रासंगिक फ़ाइलों पर कॉन्टेक्स्ट बजट जलाए बिना।

रिपॉजिटरी अब 32,815 GitHub स्टार्स पर है, बाइनरी मैनेज करने के लिए किसी रनटाइम के बिना इंस्टॉल होती है, और v0.9.0 रिलीज़ लगभग दो सप्ताह पहले आई थी। आगे देखने योग्य: ज्ञान ग्राफ मल्टी-मिलियन-लाइन मोनोरेपो पर कितनी अच्छी तरह टिकता है, और क्या 99% टोकन-बचत का दावा तृतीय-पक्ष बेंचमार्क में बना रहता है। लेकिन जिसके कोडिंग एजेंट को किसी टास्क के बीच में कॉन्टेक्स्ट खत्म होने की समस्या रहती है, उसके लिए यह तरह का प्लंबिंग है जो सप्ताहांत में इंस्टॉल करने योग्य है।

[14:48] FastMCP v3.4.4 Python के go-to MCP सर्वर बिल्डर के रूप में आता है

FastMCP v3.4.4 9 जुलाई को जारी हुआ, और MCP सर्वर और क्लाइंट बनाने के लिए Python लाइब्रेरी अब 26,263 GitHub स्टार्स पर है। संदर्भ के लिए, MCP — Model Context Protocol — खुला मानक है जो AI असिस्टेंट्स को बाहरी टूल्स, फ़ाइल्स और डेटा स्रोतों तक पहुँचने और उन्हें नेटिव फीचर्स की तरह कॉल करने की अनुमति देता है। PrefectHQ संगठन के तहत रखरखाव किया जाने वाला FastMCP Python-साइड टूलकिट है जो उन एंडपॉइंट्स को पब्लिश करना किसी अन्य सर्विस को लिखने जैसा आसान बनाता है, और प्रोजेक्ट खुद को तेज़ विकल्प के साथ-साथ इडियोमैटिक विकल्प के रूप में प्रमोट करता है।

पूरा मकसद घर्षण कम करना है। प्रोटोकॉल मैसेज, स्कीमा और ट्रांसपोर्ट प्लंबिंग को हाथ से रोल करने के बजाय, एक Python डेवलपर FastMCP का उपयोग करके एक फंक्शन, डेटासेट या स्क्रिप्ट को MCP सर्वर के रूप में एक्सपोज़ कर सकता है जिसे कोई भी अनुपालनशील AI क्लाइंट डिस्कवर कर सकता है और कॉल कर सकता है। टैगलाइन इसे 'Pythonic' कहती है, जिसका अर्थ है कि लाइब्रेरी का लक्ष्य Python डेवलपर्स द्वारा पहले से कोड लिखने के तरीके के अनुकूल होना है, न कि बाहरी संरचना थोपना। यह आंतरिक सिस्टम्स को रैप करने के लिए एक्टिवेशन एनर्जी कम करता है।

रिलीज़ कैडेंस एक कहानी बताता है। v3.4.4 9 जुलाई को शिप हुआ, और रिपॉजिटरी को 19 जुलाई को फिर से सक्रिय रूप से पुश किया गया। यह एक सोया हुआ प्रोजेक्ट नहीं है। 26,263 स्टार्स के साथ, FastMCP Python टीमों के लिए डिफ़ॉल्ट स्टार्टिंग पॉइंट में से एक बन गया है जो चाहती हैं कि उनके आंतरिक APIs, डेटाबेस या लोकल स्क्रिप्ट्स AI एजेंट्स से बिना हर बार वायरिंग फिर से बनाए पहुँच योग्य हों।

आगे देखने योग्य: v3.x कैसे विकसित होता है, और क्या MCP क्लाइंट साइड इकोसिस्टम FastMCP द्वारा Python साइड पर शिप किए जा रहे सर्वर-साइड एर्गोनॉमिक्स के अनुरूप बनता है। प्रोटोकॉल खुला है, सर्वर टूल्स परिपक्व हो रहे हैं, और Python टीमों के पास अब एजेंट स्टैक में जाने का एक अच्छी तरह से प्रशिक्षित रास्ता है।

[16:33] Microsoft का MCP for Beginners पाठ्यक्रम 16,700 GitHub स्टार्स पार कर गया

Microsoft का "MCP for Beginners" पाठ्यक्रम GitHub पर सबसे लोकप्रिय शिक्षण संसाधनों में से एक बन गया है, 17 जुलाई को रिपॉजिटरी पुश के बाद 16,700 से अधिक स्टार्स पर है। यह एक मुफ़्त, ओपन-सोर्स कोर्स है जो डेवलपर्स को Model Context Protocol के माध्यम से ले जाता है — उभरता मानक जो AI असिस्टेंट्स को एक अनुमान योग्य, संरचित तरीके से बाहरी टूल्स और डेटा से जोड़ने की अनुमति देता है। MCP को एक यूनिवर्सल प्लग के रूप में समझें: हर बार जब आप चाहते हैं कि कोई मॉडल फ़ाइल पढ़े, डेटाबेस क्वेरी करे, या API कॉल करे, तब कस्टम इंटीग्रेशन लिखने के बजाय, आप एक सामान्य मानक का पालन करते हुए एक MCP सर्वर बनाते हैं ताकि अलग-अलग AI क्लाइंट उससे एक ही तरह से बात कर सकें। कनेक्टर एक बार बनाएं, और कोई भी AI क्लाइंट जो उसी प्रोटोकॉल को बोलता है, उसका उपयोग कर सकता है।

पाठ्यक्रम को विशिष्ट बनाने वाली बात इसकी भाषाई विस्तार है। Microsoft .NET, Java, TypeScript, JavaScript, Rust, और Python में कार्यशील उदाहरण शिप करता है, ताकि कोई डेवलपर उस स्टैक के भीतर रह सके जिसे वह पहले से जानता है, न कि केवल साथ चलने के लिए एक नया फ्रेमवर्क उठाए। पाठ्यक्रम मॉड्यूलर, स्केलेबल, और सुरक्षित AI वर्कफ़्लो बनाने के लिए व्यावहारिक तकनीकों पर केंद्रित है — इसका अर्थ है कि आप सर्वर कंपोनेंट्स को छोटे और पुन: प्रयोज्य रखने, AI को जो छूने की अनुमति है उसके आसपास की सीमाओं को मजबूत करने, और चीजों को इस तरह से संरचित करने के पैटर्न सीखते हैं ताकि पिछले काम को फिर से लिखे बिना अतिरिक्त टूल जोड़े जा सकें।

व्यावहारिक मूल्य सीधा है: एक डेवलपर जो पहले से छह में से किसी एक भाषा को जानता है, वह बिना कॉन्टेक्स्ट-स्विच के MCP सीख सकता है, और परिणामी एकीकरण ऐसे पैटर्न का पालन करते हैं जो स्केल करने के लिए डिज़ाइन किए गए हैं क्योंकि अधिक टूल जोड़े जाते हैं। क्योंकि पाठ्यक्रम ओपन सोर्स है, टीमें पाठ्यक्रम को फोर्क करके आंतरिक प्रशिक्षण कार्यक्रमों के लिए अनुकूलित भी कर सकती हैं।

एक बात ध्यान देने योग्य है: पाठ्यक्रम बिना वर्शन वाले रिलीज़ के तेज़-गति वाले रिपॉजिटरी में रहता है, इसलिए पाठ यात्राओं के बीच बदल सकते हैं। यदि आप इसका उपयोग प्रोडक्शन कार्य के लिए दीर्घकालिक संदर्भ के रूप में कर रहे हैं, तो एक विशिष्ट कमिट को पिन करना उचित है।

[18:31] mcp-use ने फुलस्टैक MCP ऐप फ्रेमवर्क के रूप में 10,000 GitHub स्टार्स पार किए

Model Context Protocol ऐप्स बनाने के लिए एक फुलस्टैक फ्रेमवर्क ने अभी 10,000 GitHub स्टार्स पार किए हैं। 10,328 स्टार्स पर स्थित ओपन-सोर्स प्रोजेक्ट mcp-use ने 8 जुलाई को रिलीज़ 1.34.3 शिप की, और रिपॉजिटरी में 19 जुलाई तक ताज़ा पुश आए हैं। समुदाय के आकार और हाल की गतिविधि का यह संयोजन वह संकेत है जो एक सप्ताहांत प्रोटोटाइप को कुछ बदल देता है जिस पर एक टीम बना सकती है।

तो सादे शब्दों में, यह क्या है। Model Context Protocol, या MCP, वह ओपन स्टैंडर्ड है जो AI असिस्टेंट्स को बिना हर मॉडल के लिए कस्टम इंटीग्रेशन के बाहरी टूल कॉल करने और लाइव डेटा खींचने देता है। अधिकांश MCP प्रोजेक्ट सर्वर साइड पर रुक जाते हैं — आप कुछ क्षमताएं एक्सपोज़ करते हैं, एक एजेंट उन्हें डिस्कवर करता है, और बातचीत जारी रहती है। mcp-use दोनों तरफ से काम करने के लिए बनाया गया है। एक ही प्रोजेक्ट एक MCP सर्वर पब्लिश कर सकता है जिससे कोई भी कंप्लायंट एजेंट कनेक्ट हो सकता है, और एक MCP ऐप शिप कर सकता है — बटन, कार्ड, और विजेट जो ChatGPT या Claude के अंदर दिखाई देते हैं जब असिस्टेंट आपके टूल का उपयोग करने का निर्णय लेता है।

यह ड्यूल-टारगेटिंग महत्वपूर्ण है क्योंकि बिल्डर्स महीनों से चुपचाप एक ही अंतराल की शिकायत कर रहे हैं: आप सर्वर लिखते हैं, फिर एक अलग चैट-ऐप फ्रंट-एंड लिखते हैं, फिर दोनों को सिंक में रखते हैं। एक ही mcp-use प्रोजेक्ट इसे एक कोडबेस में समेटता है, जिसमें फ्रेमवर्क प्रोटोकॉल प्लंबिंग और चैट-सर्फेस रेंडरिंग को साथ-साथ संभालता है। व्यवहार में, एक कनेक्टर लिखने वाला बिल्डर को केवल एक प्रोजेक्ट बनाए रखना होता है, और अपडेट एक साथ सर्वर और चैट-सर्फेस विजेट दोनों में लैंड होते हैं।

आने वाली बात यह देखना है कि Anthropic और OpenAI अपने इन-चैट ऐप सर्फेस को कितना आगे बढ़ाते हैं। mcp-use पहले से ही दोनों के लिए आकार में है, इसलिए किसी भी प्लेटफॉर्म पर विस्तार बिना रीराइट के वहां पहुंचना चाहिए।

[20:19] GitHub Copilot उपयोग मेट्रिक्स अब प्रति रिपॉजिटरी टूटती हैं

GitHub Copilot उपयोग मेट्रिक्स उन टीमों के लिए अभी अधिक सार्थक रूप से उपयोगी हो गई हैं जो कुछ रिपॉजिटरीज़ से अधिक पर असिस्टेंट चला रही हैं। 17 जुलाई को, GitHub ने रिपॉजिटरी-स्तरीय उपयोग मेट्रिक्स को सामान्य उपलब्धता में ले जाया, Copilot उपयोग मेट्रिक्स REST API में दो नए एंडपॉइंट जोड़े। प्रत्येक Copilot coding agent और Copilot code review से जुड़ी पुल रिक्वेस्ट गतिविधि का दैनिक, प्रति-रिपॉजिटरी विवरण लौटाता है।

अब तक, वही API surface केवल organization स्तर पर aggregated होता था। एक बड़ी engineering org देख सकती थी कि Copilot ने पिछले सप्ताह कई pull requests को touch किया, लेकिन आसानी से यह बता पाना मुश्किल था कि वह सारा काम तीन repos में केंद्रित था जबकि कई अन्य quiet बैठे थे, या फिर adoption समान रूप से फैला हुआ था। नए endpoints उस gap को close करते हैं by returning a daily time series जो एक single repository तक scoped है, ताकि teams प्रति repo adoption trends chart कर सकें instead of उन्हें org-wide average से infer करने के बजाय।

Practically, यही data engineering leaders चाहते हैं since coding agent shipped। आप repos को side by side compare कर सकते हैं, देख सकते हैं कि code review coverage एक service में climbing है लेकिन दूसरे में flat है, और उस basic question का answer दे सकते हैं कि Copilot वास्तव में कहां pull requests move कर रहा है और कहां नहीं। क्योंकि endpoints plain REST हैं, existing dashboard में integration, चाहे वह एक Grafana panel हो, internal metrics page हो, या weekly leadership summary हो, एक straightforward afternoon project है custom data pipeline के बजाय — और per-repository cuts यह possible बनाते हैं कि उन repos की long tail को flag किया जाए जहां adoption कभी hold नहीं हुआ।

एक बात next पर watch करने की है: GitHub ने historically usage metrics surface को waves में expand किया है, और per-repository पहला cut है। चाहे seat-level counts हों, language breakdowns हों, या acceptance-rate cuts same shape में आएंगे, यह determine करेगा कि teams basic adoption chart से कितना आगे ले जा सकते हैं।

[22:15] Unity-MCP 10.1.0 turns your editor into a callable tool surface

Unity game developers को editor के अंदर एक more capable AI co-pilot मिला है। CoplayDev ने unity-mcp का version 10.1.0 July 13 को shipped किया, यह bridge जो large language models को Model Context Protocol के through सीधे Unity Editor से talk करने देता है, वही standard जो increasingly assistants को development tools में wire करने के लिए use हो रहा है।

Plain terms में, इसका मतलब है कि आप एक coding assistant को screenshot और prayer से बेहतर कुछ दे सकते हैं। Bridge Unity itself को एक callable tool surface के रूप में expose करता है, ताकि आपका assistant assets manage कर सके, scenes control कर सके, scripts edit कर सके, और tasks automate कर सके। Practice में इसका मतलब है files listing और renaming, scene objects querying और modifying, GameObjects पर C# scripts reading और writing, menu commands firing, और common editor workflows triggering जैसे assets reimporting या inspection के लिए screenshots capturing। Assistant आपके project structure पर guess करना बंद कर देता है और उसे read करता है।

Repository की GitHub पर 12,645 stars हैं, और latest push release के same day landed। एक community-maintained project से यह velocity एक signal है कि game engines के लिए MCP-style tooling clever demo से everyday workflow में shift हो रही है।

Solo developers और small teams के लिए, practical change यह है कि asset hygiene, scene cleanup, और routine refactors evenings खाना बंद कर देंगे। आप chat में बताएंगे कि आप क्या चाहते हैं, assistant जो actions propose करता है उसे Unity के अंदर review करेंगे, और ship करें। Larger studios के लिए, watch item governance है, क्योंकि एक बार assistant scenes और scripts manipulate कर सकता है, तो question कि कौन what prompt कर सकता है वह theoretical से operational में चला जाता है।

Next up worth tracking: क्या Unity के own first-party AI features और unity-mcp converge या compete करते हैं, since two paths into same editor rarely stay parallel for long।

[23:59] OpenAI's CFO publishes a four-metric scorecard for AI ROI

OpenAI की CFO सारा फ्रायर ने 17 जुलाई को एक AI स्कोरकार्ड प्रकाशित किया जो चार लेंस के माध्यम से निवेश पर प्रतिफल को मापता है: उपयोगी कार्य, प्रति सफल कार्य लागत, विश्वसनीयता, और कंप्यूट पर प्रतिफल। फ्रेमिंग मायने रखती है क्योंकि लेखक वित्त प्रमुख है, शोध टीम नहीं — स्कोरकार्ड AI परिनियोजन को बेंचमार्क स्कोर के साथ एक वैज्ञानिक प्रयोग के बजाय लाइन आइटम के साथ एक पूंजी परियोजना के रूप में मानता है।

उपयोगी कार्य सबसे पहले आता है, यह पूछते हुए कि AI ने वास्तव में प्रोडक्शन में कितने कार्य पूरे किए न कि उसने कितने टोकन जनरेट किए। प्रति सफल कार्य लागत इसे अर्थशास्त्र में बदल देती है: एक टीम प्रति डॉलर आउटकम पर, लीडरबोर्ड रैंकिंग पर नहीं, एक उपभोक्ता सब्सक्रिप्शन की तुलना एंटरप्राइज़ contract से कर सकती है। विश्वसनीयता तीसरा स्तंभ है, यह मापती है कि सिस्टम पहली बार में सही उत्तर देता है या नहीं या मनुष्यों को काम फिर से करना पड़ता है — अधिकांश पायलट कम आंकते हैं छिपी श्रम लाइन आइटम। कंप्यूट पर प्रतिफल लूप को पूरा करता है यह पूछकर कि संगठन को GPU या API खर्च के प्रति डॉलर कितना उपयोगी आउटपुट मिला, जो होस्टेड मॉडल, सेल्फ-होस्टेड वेट, या थर्ड-पार्टी API में प्रश्न को वेंडर-न्यूट्रल बनाता है।

बिल्डर्स और टीम लीड्स के लिए, स्कोरकार्ड एक प्रापण चेकलिस्ट और एक आंतरिक रेट्रोस्पेक्टिव टेम्पलेट के रूप में काम करता है। एक छोटी टीम प्रति प्रोजेक्ट इस तिमाही में चार नंबर लॉग कर सकती है और देख सकती है कि कौन से टूल्स अपनी जगह कमाते हैं और कौन से चुपचाप जितना बचाते हैं उससे अधिक खर्च करते हैं। यह लेख विशिष्ट आंकड़ों पर अल्प है — यह एक बेंचमार्क नहीं, फ्रेमवर्क देता है — इसलिए व्यावहारिक सवाल यह बनता है कि AI बुलबुले के बाहर वित्त और प्रापण समूह वही चार-प्रश्न फ्रेम अपनाते हैं या नहीं। अगला देखें: क्या OpenAI रेफरेंस नंबर प्रकाशित करता है जिनके विरुद्ध टीमें बेंचमार्क कर सकें, और क्या फ्रेमवर्क स्वतंत्र विश्लेषकों के वेंडर मूल्यांकन गाइड में दिखाई देता है।

[25:47] व्यावहारिक कतार

आज की कहानियों से: यदि आप GPT-5.6 वेरिएंट के साथ Codex चलाते हैं, तो rust-v0.144.6 खींचें और लंबे refactors या मल्टी-फाइल माइग्रेशन शुरू करने से पहले एक प्रतिनिधि सत्र को फिर से टेस्ट करें। Kimi K3 अब Moonshot की वेबसाइट और API के माध्यम से लाइव है, इसलिए बिल्डर्स आज ही इसके माध्यम से लंबे-संदर्भ कोडिंग और रीज़निंग कार्यों को रूट कर सकते हैं। बिल्डर्स के लिए, इसका मतलब है कि आप एक 27B चैट मॉडल खींच सकते हैं और इसे किसी सर्वर को किराए पर लिए बिना MacBook या скромной Nvidia कार्ड पर चला सकते हैं, इसे प्रोटोटाइप और एजेंट स्टैक के लिए ड्रॉप-इन लोकल एंडपॉइंट के रूप में उपयोग करें। हेल्थकेयर-से-संबंधित बिल्डर्स और पॉलिसी वॉचर्स के लिए, WISeR क्लिनिकल प्रायोर-ऑथराइज़ेशन AI के लिए एक लाइव फेडरल टेस्ट बेड बनाता है। यह उन टीमों के लिए सबसे उपयोगी है जो पहले से NVIDIA हार्डवेयर पर चल रही हैं और फाइन-ट्यून डिफ्यूज़न मॉडल के लिए एक प्रलेखित रास्ता चाहती हैं। यह मायने रखता है क्योंकि प्रशिक्षण और इंफरेंस संदर्भ के बीच का अंतर लंबे-क्षितिज एजेंट गुणवत्ता पर एक शांत छत रहा है। बिल्डर्स के लिए, जनरलिस्ट क्षमता वाले पूरी तरह से ओपन वीडियो मॉडल का मतलब है कि आप प्रति-कॉल API शुल्क का भुगतान किए बिना या संवेदनशील वीडियो किसी तीसरे पक्ष को भेजे बिना अपनी फुटेज पर वीडियो समझ का प्रोटोटाइप बना सकते हैं। यह मायने रखता है क्योंकि संदर्भ-विंडो दबाव सबसे आम कारण है कि कोडिंग एजेंट बड़े रिपॉजिटरी पर प्लॉट खो देता है — छोटे प्रॉम्प्ट और फोकस्ड लुकअप मल्टी-फाइल कार्यों को सुसंगत रखते हैं। Python टीमों के पास अब AI एजेंट में आंतरिक API, डेटाबेस और लोकल स्क्रिप्ट को जोड़ने के लिए प्रोटोकॉल लेयर को हर बार फिर से बनाने के बिना एक अच्छी तरह से समर्थित डिफ़ॉल्ट है। इसका मतलब है कि एक डेवलपर जो पहले से छह में से एक भाषा जानता है, वह बिना कॉन्टेक्स्ट-स्विच के MCP सीख सकता है, और पाठ्यक्रम के पैटर्न के विरुद्ध बना कोई भी इंटीग्रेशन पोर्टेबल रहता है क्योंकि MCP एक साझा मानक है। इसका मतलब: यदि आप पहले से Claude या ChatGPT के लिए MCP टूल्स या डेटा कनेक्टर्स बनाते हैं, तो mcp-use आपको एक प्रोजेक्ट देता है जो एक साथ किसी भी एजेंट के लिए एक सर्वर और एक चैट-सर्फेस ऐप दोनों प्रकाशित करता है। इंजीनियरिंग लीड्स अब Copilot पुल रिक्वेस्ट गतिविधि को संगठन भर में औसत करने के बजाय विशिष्ट रिपॉजिटरीज़ में श्रेय दे सकते हैं, जिससे कम-उपयोग वाली टीमों या रिपॉजिटरीज़ को खोजना आसान हो जाता है जो चुपचाप AI-भारी हो गई हैं। Unity डेवलपर्स के लिए, इसका मतलब है AI सहायता जो वास्तव में एडिटर को छूती है प्रोजेक्ट स्ट्रक्चर के बारे में अनुमान लगाने के बजाय। बिल्डर्स और टीम लीड्स के लिए, स्कोरकार्ड एक प्रापण चेकलिस्ट और एक रेट्रोस्पेक्टिव टेम्पलेट के रूप में काम करता है, क्योंकि इस तिमाही में प्रति प्रोजेक्ट चार नंबर लॉग करने से पता चलता है कि कौन से टूल्स अपनी जगह कमाते हैं।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily