Hermes Agent Four-Release Run & AI Agent सुरक्षा — Episode 103 cover art
Episode 103·18 अगस्त 2026·44:55

Hermes Agent Four-Release Run & AI Agent सुरक्षा

Hermes Agent ने पांच दिनों में चार रिलीज़ भेजी हैं। OpenAI और CodeAI ने छात्र AI साक्षरता के लिए साथ मिलकर काम किया है, और ChatGPT ने किशोर नियंत्रण लॉन्च... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-103/

🎧 Listen to Episode

एपिसोड 103 — 18 अगस्त, 2026

[00:00] एपिसोड हुक

एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.8.18, v2026.8.16.2, v2026.8.16, v2026.8.13 दिन की अगुवाई करते हैं: v2026.8.13, v2026.8.16, v2026.8.18 जिन सतहों पर बिल्डर्स हर दिन चलते हैं उनमें ठोस बदलाव लाते हैं, विवरण नीचे। आज की लाइनअप में भी: OpenAI और CodeAI पहली AI जेनरेशन की तैयारी के लिए साझेदारी करते हैं, ChatGPT टीन-फोकस्ड अनुभव लॉन्च करता है जिसमें पैरेंट कंट्रोल और मजबूत सुरक्षा उपाय हैं, वही हार्डवेयर, 33 पॉइंट्स ज्यादा GPU यूटिलाइजेशन, इसके अलावा मॉडल्स, टूलिंग और इन्फ्रास्ट्रक्चर में घनी न्यूज साइकल का बाकी हिस्सा। हर कहानी को वही ट्रीटमेंट मिलती है — क्या शिप हुआ, उसके नीचे का तंत्र, और यह वर्किंग बिल्डर्स के लिए क्या बदलता है।

[02:00] एजेंट स्टैक रिलीज रीडआउट: Hermes Agent v2026.8.18, v2026.8.16.2, v2026.8.16, v2026.8.13

Hermes Agent ने पांच दिनों में चार टैग्ड रिलीज शिप कीं: v2026.8.13 (13 अगस्त), v2026.8.16 और v2026.8.16.2 (दोनों 16 अगस्त), और v2026.8.18 (18 अगस्त)। साथ मिलकर, चार रोलअप डेस्कटॉप ऐप, CLI, गेटवे और इंस्टॉलर्स में लगभग 1,250 मर्ज्ड PRs बंडल करते हैं।

नवीनतम टैग, Hermes Agent v2026.8.18, एंड यूजर्स के लिए सबसे दिखने वाला है। यह डेस्कटॉप ग्लास और ट्रांसलूसेंसी का काम लाता है — मैट ग्लास, फ्रॉस्ट पिकर, और macOS प्री-सेलेक्ट — साथ ही टैब्ड SESSIONS|BOTS साइडबार जिसमें पर-बॉट हाइड और अनहाइड है। Bot Mode ग्रुप चैट को लॉन्ग-रनिंग मेंबर टर्न्स, Markdown रेंडरिंग, और क्रॉस-मशीन राउटिंग के लिए फिक्सेस मिलते हैं। NVIDIA SkillEvaluator Tier 1 एडवाइजरी स्कैनिंग अब स्किल इंस्टॉल पर चलती है, स्किल लैंड होने से पहले लाइसेंस और सिक्योरिटी चेक्स करती है। Cron मीडिया-सेंड कॉन्फ़िगरेबल टाइमआउट, मैन्युअल-रन अटैचमेंट्स, और सर्फेस्ड मिस्ड फायर्स के साथ हार्डन्ड है। SessionDB को इवेंट-लूप और कंटेंशन फिक्सेस मिलते हैं; hermes update कमांड अब पार्क्ड ब्रांचेस के बारे में ईमानदार है; और कानबान सरफेसेस को नेटिव OS नोटिफिकेशन मिलते हैं।

मिड-वीक टैग, v2026.8.16.2, स्ट्रक्चरल चेंजेस लाता है जो बिल्डर्स के लिए सबसे ज्यादा प्रासंगिक है। यह Hermes Agent को MCP 2.x SDK में माइग्रेट करता है जिसमें 2026-07-28 स्टेटलेस प्रोटोकॉल सपोर्ट है, Bot Mode (hermes-bots) प्लगइन को कोर टीममेट प्रोटोकॉल के साथ बंडल करता है, और CommandCode प्रोवाइडर प्लगइन जोड़ता है। सबप्रोसेस पायथन रनटाइम ओनरशिप PYTHONHOME और PYTHONPATH आइसोलेशन के माध्यम से हार्डन्ड है, और Cua Driver 0.20 रनटाइम कॉन्ट्रैक्ट्स कंप्यूटर यूज के लिए आते हैं। कानबान वर्कट्री डिस्पैच को फिक्सेस मिलते हैं, cron कंटीन्युटी फ्लैग्स गेन करता है, और डेस्कटॉप रिमोट-गेटवे प्रॉपर हेडर्स प्लस कनेक्शन सेल्फ-हीलिंग गेन करता है। cron शेड्यूलर अब सेल्फ-हील्स — EMFILE रिकवरी, स्टेल-क्लेम रिकंसिलिएशन, और वेज्ड-जॉब री-आर्म — और सेशन हैंडऑफ को डेटा-लॉस फिक्सेस मिलते हैं।

पहले का टैग, v2026.8.16, डेस्कटॉप कनेक्शंस रजिस्ट्री को मल्टी-गेटवे सपोर्ट और प्रोफाइल-स्कोप्ड रिफ्रेशेस के साथ स्टेबलाइज़ करता है, MCP हेल्थ चेक्स और डीप लिंक्स जोड़ता है, और OpenAI वायर पर LiteLLM Claude के लिए प्रॉम्प्ट कैशिंग शिप करता है। CLI को Windows अपडेट प्रोब्स, Kitty कीबोर्ड प्रोटोकॉल सपोर्ट, और चैट -c हार्डनिंग मिलती है। गेटवे पर्सिस्टेड मॉडल रूट्स, /loop कम्प्लीशन, और Telegram DM टॉपिक्स जोड़ता है।

v0.20.0 से पूरे विंडो के लिए क्यूरेटेड रिलीज नोट्स v0.21.0 में डिफर्ड हैं; इंटरवीनिंग टैग्स में कुछ भी स्किप्ड नहीं है, बस अनसमराइज़्ड है।

[03:05] OpenAI और CodeAI पहली AI जेनरेशन की तैयारी के लिए साझेदारी करते हैं

OpenAI और CodeAI मिलकर OpenAI द्वारा "पहली AI पीढ़ी" कहे जा रहे इसकी तैयारी कर रहे हैं। 18 अगस्त को OpenAI News के माध्यम से घोषित यह सहयोग डेवलपर्स की जगह छात्रों को लक्षित करता है। OpenAI इस साझेदारी को तीन लक्ष्यों के इर्दगिर्द प्रस्तुत करता है: AI साक्षरता का निर्माण, छात्रों को AI सिस्टम कैसे काम करते हैं इसके बारे में आलोचनात्मक रूप से सोचने में मदद करना, और उन्हें तकनीक का जिम्मेदारी से उपयोग करने और आकार देने के कौशल प्रदान करना।

यह दृष्टिकोण कक्षा-पहले वाला है। OpenAI और CodeAI इस प्रयास को एक ऐसी पीढ़ी की तैयारी के रूप में प्रस्तुत कर रहे हैं जो रोजमर्रा की जिंदगी में AI टूल्स का उपयोग करके बड़ी होगी। पोस्ट एक दिशा-बयान के रूप में पढ़ती है - कि कौन तकनीक सीखेगा और कैसे, न कि एक नए प्रोडक्ट रिलीज़ के रूप में।

शिक्षकों और स्कूल प्रशासकों के लिए, यह OpenAI की भागीदारी वाले AI-साक्षरता कार्यक्रम का एक प्रारंभिक संकेत है। बिल्डर्स और डेवलपर्स के लिए, अभी तक एकीकरण के लिए कोई ठोस बात नहीं है, क्योंकि स्रोत सामग्री में कोई API, SDK, या पाठ्यक्रम मॉड्यूल दिखाई नहीं देते। साझेदारी की घोषणा एक डेवलपर ड्रॉप की जगह एक ब्रांड-और-पाठ्यक्रम कहानी है।

अगला महत्वपूर्ण विवरण यह है कि CodeAI और OpenAI वास्तव में छात्रों के सामने क्या रखेंगे और कब। घोषणा लक्ष्य का नाम बताती है लेकिन अभी तक पाठ्यक्रम, ग्रेड स्तरों, या छात्रों द्वारा उपयोग किए जाने वाले विशिष्ट टूल्स का विवरण नहीं देती। यह विवरण संभवतः आएगा जैसे-जैसे साझेदारी घोषणा से कार्यान्वयन में आगे बढ़ेगी। एक खुला सवाल स्केल का है: OpenAI ने यह नहीं बताया कि साझेदारी कितने छात्रों या स्कूलों तक पहुंचना चाहती है। पीढ़ी-आकार के दावे के लिए, रोलआउट तंत्र मायने रखेंगे, और वे अभी आने वाले हैं।

[04:38] ChatGPT ने पैरेंटल कंट्रोल और मजबूत सुरक्षा उपायों के साथ टीन-केंद्रित अनुभव लॉन्च किया

OpenAI ने 18 अगस्त को टीनर्स के लिए ChatGPT लॉन्च किया - यह एक समर्पित अनुभव है जो उन युवा उपयोगकर्ताओं को लक्षित करता है जो AI के साथ काम करना सीख रहे हैं। घोषणा के अनुसार, प्रोडक्ट तीन स्तंभों पर आधारित है: मजबूत अंतर्निहित सुरक्षाएं, संतुलित सत्र आदतों को प्रोत्साहित करने के लिए बनाए गए स्वस्थ-उपयोग फीचर्स, और पैरेंट्स के लिए अतिरिक्त कंट्रोल। OpenAI ने इस लॉन्च को टीनर्स को AI के साथ सीखने, आलोचनात्मक रूप से सोचने और आत्मविश्वास बनाने में मदद करने के तरीके के रूप में प्रस्तुत किया - जवाब सिर्फ उपभोग करने की जगह।

यह रिलीज़ उस समय आती है जब स्कूल और परिवार सक्रिय रूप से तय कर रहे हैं कि बच्चों को होमवर्क और रचनात्मक काम के लिए चैटबॉट्स का उपयोग कितना और कैसे करने देना है। OpenAI टीन टियर को पूर्ण पहुंच और टूल को पूरी तरह ब्लॉक करने के बीच एक मध्यम रास्ते के रूप में प्रस्तुत कर रहा है, जिससे विकल्प और सुरक्षाएं सिर्फ ऐप स्तर पर नहीं बल्कि पैरेंट्स के हाथों में हैं।

घोषणा में विस्तृत फीचर सूची या चेंजलॉग शामिल नहीं था, इसलिए पैरेंटल कंट्रोल और स्वस्थ-उपयोग फीचर्स के विशिष्ट तंत्र अभी सार्वजनिक नहीं हैं। जो स्पष्ट है वह दर्शक है: OpenAI उस जगह को परिभाषित करने से पहले टीन लर्निंग मार्केट में अपनी जड़ें जमाना चाहता है।

[05:46] वही हार्डवेयर, 33 पॉइंट्स ज्यादा GPU यूटिलाइज़ेशन — ट्रिक ऑर्डरिंग में थी

Hugging Face Blog पर Dharma-AI की एक छोटी सी पोस्ट, जो 17 अगस्त की है, एक विशिष्ट सनसनीखेज़ दावा करती है: उसी क्लस्टर पर, टीम ने काम के ऑर्डर को बदलकर 33 पॉइंट्स GPU यूटिलाइज़ेशन हासिल किया। पोस्ट का शीर्षक है "Same Cluster, 33 Points More Utilization: What Changed Was the Order," और स्रोत सामग्री में केवल वह शीर्षक और प्रकाशन तिथि है — क्लस्टर साइज़, GPU टाइप, शेड्यूलर, या वर्कलोड क्लास की कोई विशिष्ट जानकारी नहीं।

हेडलाइन यह कहती है कि लाभ पुनर्क्रम से आया, पुनर्आर्किटेक्चर से नहीं। यह दृष्टिकोण बिल्डर्स के लिए मायने रखता है: अगर अनुक्रम में बदलाव किसी क्लस्टर के उपयोग का लगभग एक तिहाई खाली कर सकता है, तो इसका अर्थ है कि कई GPU बिल उस क्षमता के लिए भुगतान कर रहे हैं जो पहले से ही रैक में बैठी है। Dharma-AI पोस्ट ऑर्डरिंग को लीवर के रूप में प्रस्तुत करती है, न कि नए हार्डवेयर या नए फ्रेमवर्क को।

यह लेख छोटा है और स्रोत सामग्री विरल है, इसलिए व्यावहारिक निष्कर्ष सीमित है। 33 अंकों की संख्या को पोर्टेबल मानने से पहले पूरी पोस्ट पढ़ें। विभिन्न शेड्यूलर्स, विभिन्न जॉब मिश्रण, और विभिन्न प्रतिस्पर्धा पैटर्न परिणाम बदल देंगे। यह देखना उचित है कि पोस्ट ऑर्डरिंग नियम को किसी के लिए पुनरुत्पादित करने के लिए पर्याप्त विस्तार से बताती है या नहीं, या यह हेडलाइन स्तर पर ही रहती है।

[07:05] NIST और FTC ने AI एजेंट सुरक्षा नियमों पर टिप्पणी विंडो खोली

NIST और Federal Trade Commission ने 17 अगस्त को एक संयुक्त सूचना अनुरोध (RFI) जारी किया, और विषय स्वायत्त AI एजेंटों की सुरक्षा है। RFI एंटरप्राइज़ और डेवलपर वर्कफ्लो के अंदर संचालित होने वाले एजेंटों के लिए नियंत्रणों, जोखिम प्रबंधन, और जवाबदेही ढांचों पर सार्वजनिक टिप्पणी मांगता है — विशेष रूप से उन निरंतर परिनियोजनाओं में जहां एजेंट निरंतर मानव निगरानी के बिना चलते हैं।

एजेंसियों ने तीन खतरे की श्रेणियों का नाम दिया: अनधिकृत टूल निष्पादन, डेटा एक्सफिल्ट्रेशन, और मॉडल हेरफेर। यह भाषा सीधे उन एजेंटों की ओर इशारा करती है जो दीर्घकालिक सत्र रखती हैं और सिस्टम पर कार्य करती हैं, न कि केवल प्रश्नों के उत्तर देने वाली चैटबॉट्स। यह ढांचा स्पष्ट करता है कि नियामक क्रेडेंशियल्स, टूल एक्सेस, और मॉडल की अखंडता के बारे में सोच रहे हैं जब इसे अपने आप चलने के लिए छोड़ दिया जाता है।

डॉकेट है NIST-2026-0145, और टिप्पणी विंडो अक्टूबर तक चलती है। जवाब Federal Register के माध्यम से जाते हैं, जो प्रक्रिया को किसी भी व्यक्ति के लिए खुली रखता है — एक स्टार्टअप फाउंडर, एक सुरक्षा इंजीनियर, या एक शौकिया जो स्थानीय एजेंट चला रहा है, औपचारिक प्रतिक्रिया जमा कर सकता है। RFI कोई नियम नहीं है, लेकिन प्रतिक्रियाएं उन कार्य समूहों को भोजन देती हैं जो अंतिम मार्गदर्शन ड्राफ्ट करते हैं, और वे कैटलॉग आडिटरों और प्रोक्योरमेंट टीमों के लिए डिफ़ॉल्ट चेकलिस्ट बन जाते हैं।

बिल्डर्स के लिए, यह वह क्षण है जब किसी भी फ्रेमवर्क के सुदृढ़ होने से पहले ठोस नियंत्रण अंतरालों और जवाबदेही प्रश्नों को चिह्नित करना है। Federal Register डॉकेट के माध्यम से जमा करना प्रभावित करने का सीधा मार्ग है कि कोई भी अंतिम आवश्यकताएं कैसे लागू होंगी।

[08:32] शोध सार: ClawGym II दिखाता है कि एक ओपन मॉडल RL-ट्यून किया गया है जो एकाधिक एजेंट हार्नेस पर है

ClawGym II नामक एक नया फ्रेमवर्क डेवलपर्स को AI एजेंटों को उनीं हार्नेस सेटअप के माध्यम से रीइन्फोर्समेंट लर्निंग के साथ प्रशिक्षित करने देता है जिन पर वे एजेंट वास्तव में चलते हैं, न कि एक स्ट्रिप्ड-डाउन सिम्युलेटर से। शोधकर्ताओं ने एक सैंडबॉक्स सिस्टम बनाया जो समानांतर में कई प्रशिक्षण एपिसोड चलाता है, साथ ही एक प्रॉक्सी जो हार्नेस से हर मॉडल कॉल को कैप्चर करता है और उन्हें संभावित बातचीत पथों के एक पेड़ में पुनर्गठित करता है। मानक रीइन्फोर्समेंट-लर्निंग विधियों को उस पेड़ से सीखने के लिए अनुकूलित किया जाता है। दिलचस्प परिणाम है मिक्स-हार्नेस प्रशिक्षण: एक ओपन-वेट मॉडल को एक साथ दो बहुत अलग एजेंट हार्नेस पर संयुक्त रूप से अनुकूलित किया गया था। ClawGym-Bench सुइट पर, वही बेस मॉडल उन हार्नेस में से एक, Claude Code के माध्यम से प्रशिक्षित होने पर पास-एट-वन सटीकता में लगभग 14.8 प्रतिशत अंक प्राप्त करता है, और सैकड़ों ऑप्टिमाइज़ेशन स्टेप्स में उन लाभों को बनाए रखता है। बिल्डर्स के लिए, यह एक ऐसा मार्ग दिखाता है जो बिना एजेंट स्टैक को शुरू से बनाए ओपन-वेट एजेंट मॉडलों को वास्तविक, बहु-चरणीय कोडिंग और ऑफिस कार्यों में सुधारने के लिए है।

[09:30] शोध सार: Proteus लंबे-संदर्भ मेमोरी को पाठ बढ़ने पर अनुकूलित करता है

Proteus एक व्यावहारिक कमजोरी को संबोधित करता है जो मेमोरी-आधारित अनुक्रम मॉडल में होती है: वे अनुक्रम के बढ़ने के साथ उपलब्ध समान उपयोग योग्य मेमोरी क्षमता रखते हैं। यह शुरुआती टोकन को मेमोरी के बहुत अधिक हिस्से पर कब्जा करने की अनुमति देता है, बाद में आने वाली उपयोगी जानकारी को बाहर करता है।

यह तंत्र एक तंग मेमोरी बॉटलनेक से शुरू होता है और संदर्भ के विस्तार के साथ क्रमशः अधिक प्रभावी क्षमता को अनलॉक करता है। इसलिए, शुरुआती इतिहास को अधिक आक्रामक रूप से संपीड़ित करना होगा, जबकि बाद की जानकारी को बनाए रखने के लिए ताजा जगह मिलती है। पेपर के परीक्षणों में, इसने भाषा मॉडलिंग और तर्क के साथ-साथ लंबे-संदर्भ पुनर्प्राप्ति और समझ में सुसंगत लाभ उत्पन्न किए। लंबे संदर्भ की लंबाई पर सुधार बड़े हुए।

यह परिणाम महत्वपूर्ण है क्योंकि यह सुझाव देता है कि एक मॉडल को केवल एक निश्चित मेमोरी स्थिति देना गलत डिफ़ॉल्ट हो सकता है। मेमोरी क्षमता कब उपलब्ध होती है, यह बदलकर, Proteus ने कई मेमोरी आर्किटेक्चर में हस्तक्षेप को कम किया और बाद के संदर्भ प्रतिधारण में सुधार किया। एक मूर्त परिणाम यह है कि सिस्टम डिजाइन करने का एक बेहतर तरीका है जिसे लंबे इनपुट में महत्वपूर्ण जानकारी संरक्षित करने की आवश्यकता है, बिना इनपुट की शुरुआत को उपलब्ध मेमोरी पर हावी होने दिए।

[10:35] OpenAI की Defender's Window: AI और साइबर सुरक्षा पर एक रणनीतिक दृष्टिकोण

OpenAI ने 17 अगस्त को The Defender's Window शीर्षक से एक निबंध प्रकाशित किया। एक उत्पाद की घोषणा करने के बजाय, यह पोस्ट रणनीतिक रूप से देखती है कि कृत्रिम बुद्धिमत्ता हमलावरों और रक्षकों दोनों के लिए साइबर सुरक्षा को कैसे पुनर्आकार दे रही है।

यह फ्रेमिंग यह है कि वही बदलाव जो नई रक्षात्मक क्षमताएं बना रहा है, वह प्रतिद्वंद्वियों को भी नए उपकरण दे रहा है, जिसे OpenAI एक रक्षक की खिड़की खोलने के रूप में वर्णित करता है। पोस्ट तर्क देती है कि इस खिड़की को मान लेना नहीं चाहिए, बल्कि इसे सक्रिय रूप से बचाव करना चाहिए, क्योंकि AI में सुधार के साथ हमले और बचाव के बीच संतुलन बदलता रहता है।

इस फ्रेमिंग से परे, निबंध बताता है कि OpenAI अपने सुरक्षा उपायों को कैसे सुदृढ़ कर रहा है और सुरक्षा टीमों को मार्गदर्शन प्रदान करता है। स्रोत सामग्री विशिष्ट उत्पाद परिवर्तनों या नए उपकरणों की सूची नहीं देती, इसलिए पोस्ट कंपनी के 2026 में अपनी प्राथमिकताओं पर एक मुद्रा कथन के रूप में पढ़ती है।

प्रैक्टिशनर्स के लिए, मुख्य निष्कर्ष यह है कि AI-पूर्व खतरा मॉडल फिर से विचार करने योग्य हैं। सुरक्षा टीमों को विचार करना चाहिए कि AI उनकी प्रतियोगिता के दोनों पक्षों को कैसे बदल रहा है और आडिट करना चाहिए कि AI अब उनके अपने वर्कफ़्लो को कैसे पुनर्आकार दे रही है।

[11:38] दक्षिणी ओहायो नौकरियों के लिए OpenAI PORTS-Pike परियोजना में शामिल होता है

OpenAI ने 17 अगस्त को कहा कि वह PORTS-Pike परियोजना में शामिल हो गया है, जो दक्षिणी ओहायो में एक सामुदायिक निवेश पहल है, और यह हजारों स्थानीय नौकरियों को भुगतान के रूप में बता रहा है। OpenAI के न्यूज़रूम में पोस्ट किया गया यह घोषणा, इस कदम को उत्पाद परिवर्तन के बजाय क्षेत्रीय निवेश के विस्तार के रूप में प्रस्तुत करता है।

इस पोस्ट में ठोस सबूत कम हैं। OpenAI PORTS-Pike प्रोजेक्ट और दक्षिणी ओहायो क्षेत्र का नाम लेता है, और "हजारों नौकरियां" वाक्यांश का उपयोग करता है। यह PORTS-Pike में शामिल अन्य भागीदारों की कोई विशिष्ट नौकरी संख्या, डॉलर राशि, निर्माण समयसीमा, या सूची नहीं देता है। डेटा सेंटर क्षमता, बिजली व्यवस्था, या साइट से जुड़े किसी भी AI उत्पाद के बारे में कोई तकनीकी विवरण नहीं है।

यह कमी खुद एक कहानी है। घोषणा PORTS-Pike का नाम और दक्षिणी ओहायो पर क्षेत्रीय फोकस देती है, लेकिन कोई विशिष्ट नौकरी संख्या, डॉलर राशि, निर्माण समयसीमा, या भागीदार सूची नहीं देती है। ओहायो क्षेत्र में OpenAI कहां अपना जोर लगा रहा है, यह ट्रैक करने वाले श्रोताओं के लिए, यह शीर्षक पुष्टि करता है कि OpenAI अब औपचारिक रूप से PORTS-Pike प्रयास से जुड़ा है।

बिल्डर्स के लिए, यह एक नए API या मॉडल के साथ एकीकरण का विमोचन नहीं है। यह एक बुनियादी ढांचा और सामुदायिक निवेश घोषणा है। नजर रखने वाली बात यह है कि OpenAI विवरणों के साथ अनुवर्ती करता है या नहीं — नौकरी संख्या, समयसीमा, भागीदार सूची — जो "हजारों नौकरियों" को शीर्षक संख्या से मापनीय प्रतिबद्धता में बदल दे।

[13:05] OpenAI AI नीति विचारों को तैयार करने के लिए 14 बाहरी टीमों को वित्तपोषित करता है

OpenAI ने 17 अगस्त को कहा कि वह नए AI नीति विचारों को विकसित करने के लिए 14 स्वतंत्र परियोजनाओं को वित्तपोषित कर रहा है, जिसके घोषित लक्ष्य कंपनी द्वारा बुलाए जाने वाले इंटेलिजेंस एज में आर्थिक अवसर का विस्तार करना और सामाजिक लचीलेपन को मजबूत करना है।

अनुदान OpenAI शोधकर्ताओं के बजाय बाहरी टीमों को जाता है। वित्तपोषित समूह OpenAI से स्वतंत्र हैं, इसलिए परिणामी प्रस्ताव उन लोगों द्वारा लिखे जाएंगे जो कंपनी में काम नहीं करते, भले ही OpenAI काम के लिए भुगतान कर रहा है।

OpenAI ने कार्यक्रम को दो प्राथमिकताओं के इर्दगिर्द तैयार किया: आर्थिक अवसर, जो इस बात का संकेत है कि AI कार्य और उस तक पहुंच को कैसे बदलता है, और सामाजिक लचीलापन, जो संस्थानों के AI-संचालित परिवर्तन के अनुकूल होने की ओर इशारा करता है। दोनों जानबूझकर व्यापक हैं, जिससे वित्तपोषित टीमों को उनकी अनुशंसित विशिष्ट नीति उपायों पर स्वतंत्रता मिलती है।

घोषणा ने 14 अनुदानार्थियों के नाम नहीं बताए, इसलिए यह सवाल खुला है कि कौन से बाहरी आवाजें एजेंडा को आकार दे रही हैं। 14 वित्तपोषित परियोजनाएं कार्यक्रम के माध्यम से नीति विचार उत्पन्न करेंगी, परिणाम आने वाले महीनों में सामने आएंगे।

बिल्डर्स के लिए, व्यावहारिक संकेत यह है कि AI के बारे में नीति विचार फ्रंटियर लैब्स से भी अधिक व्यापक पूल से प्राप्त हो रहे हैं, और अभी वित्तपोषित प्रस्ताव 2027 और उससे आगे तैनाती निर्णयों को आकार देने वाले नियामक और श्रम ढांचों का पूर्वावलोकन हो सकते हैं।

[14:25] MiniMax-Music3 Hugging Face पर टेक्स्ट-टू-म्यूजिक ओपन वेट्स के साथ ट्रेंड कर रहा है

MiniMax-Music3 हगिंग फेस हब पर ट्रेंड कर रहा है, और शुरुआती आंकड़े वास्तविक लोकल-AI गति का संकेत देते हैं। MiniMaxAI द्वारा प्रकाशित यह टेक्स्ट-टू-ऑडियो मॉडल 7 अगस्त को बनाया गया था और पहले ही 925 लाइक्स और 11,700 से अधिक डाउनलोड एकत्र कर चुका है — अपने पहले हब पर आने वाले ओपन-वेट्स म्यूजिक मॉडल के लिए मजबूत पुल।

रिपॉजिटरी म्यूजिक जेनरेशन और टेक्स्ट-टू-म्यूजिक वर्कफ्लो के लिए टैग की गई है, और यह उस स्टैक पर है जो लोकल बिल्डर्स पहले से जानते हैं। वेट्स safetensors फॉर्मेट में आते हैं, मॉडल जेनरेशन के लिए diffusers में प्लग इन होता है, और यह PyTorch पर चलता है। रेपो में sglang-omni टैग भी है, जो इंफरेंस रनटाइम की ओर इशारा करता है जिसका उपयोग समुदाय ओमनी-स्टाइल मॉडल्स की सर्विंग के लिए करता है, जो बताता है कि चेकपॉइंट उसी लोकल सर्विंग सेटअप में फिट होने के लिए डिज़ाइन किया गया है जिसे लोग पहले से मल्टीमॉडल वर्क के लिए संचालित करते हैं।

बिल्डर्स के लिए, व्यावहारिक बदलाव एक्सेस है। diffusers compatibility वाला टेक्स्ट-टू-म्यूजिक चेकपॉइंट का मतलब है कि लोकल PyTorch सेटअप वाला कोई भी safetensors लोड कर सकता है और प्रॉम्प्टिंग शुरू कर सकता है — कोई होस्टेड एंडपॉइंट नहीं, कोई API की नहीं। sglang-omni टैग का मतलब है कि वही वेट्स ओमनी-कैपेबल लोकल स्टैक के माध्यम से भी सerved किए जा सकते हैं, जो एजेंट्स और पाइपलाइन के दरवाजे खोलता है जो एक सिंगल रनटाइम में म्यूजिक जेनरेशन को अन्य मॉडलैटी के साथ जोड़ती हैं।

जो सिग्नल अगले देखने लायक है वह यह है कि क्या समुदाय रेपो के आसपास अपना सामान्य लोकल-इन्फरेंस टूलिंग पोर्ट करता है और क्या quantized वेरिएंट फोर्क्स के रूप में दिखना शुरू होते हैं — दोनों पिछले ट्रेंडिंग ओपन-वेट ड्रॉप्स के लिए पैटर्न रहे हैं।

[15:53] Google ने मैचडे AI के लिए Gemini और Pixel को पांच फुटबॉल क्लब्स के साथ जोड़ा

Google ने प्रशंसकों के लिए मैचडे अनुभव को अपग्रेड करने के उद्देश्य से अपने Gemini AI और Pixel स्मार्टफोन को पांच वैश्विक फुटबॉल क्लब्स के साथ एक नई साझेदारी में जोड़ा है। 17 अगस्त को Google AI ब्लॉग पर पोस्ट किया गया यह घोषणा सहायकों को वहां देखने के लिए AI और स्मार्टफोन तकनीक के साथ जोड़ने के इर्दगिर्द सहयोग को फ्रेम करती है, लेकिन पोस्ट में स्वयं फीचर्स का कोई चेंजलॉग नहीं है, पांच क्लबों की कोई सूची नहीं है, और किसी भी कंज्यूमर-फेसिंग टूल के लिए कोई रिलीज नोट्स नहीं हैं। दूसरे शब्दों में, हेडलाइन खुद साझेदारी है, कोई उत्पाद नहीं जिसे आज आप उपयोग कर सकते हैं।

बिल्डर्स के लिए, यह कुछ इंटीग्रेट करने की बजाय ट्रैक करने लायक सिग्नल है। Google Gemini को Pixel के माध्यम से लाइव-इवेंट सतह के रूप में पोजीशनिंग कर रहा है, जो भविष्य में Pixel हार्डवेयर के माध्यम से लोकेशन-अवेयर या गेम-टाइम AI फीचर्स के आसपास अवसरों का संकेत देता है। Google AI ब्लॉग जगह है जहां कंक्रीट टूल्स देखने के लिए है क्योंकि अभी घोषणा इस बारे में अधिक है कि टेबल पर कौन बैठा है, मेन्यू पर क्या है, इसके बजाय।

[16:54] NVIDIA 'AI फैक्ट्रीज़' को नए क्रिटिकल इन्फ्रास्ट्रक्चर के रूप में फ्रेम करता है

NVIDIA ने 17 अगस्त को "Securing the Infrastructure of Intelligence" शीर्षक से एक ब्लॉग पोस्ट प्रकाशित किया, और यह ध्यान देने योग्य है क्योंकि यह बताता है कि कंपनी अब अपने स्वयं के व्यवसाय के बारे में कैसे बात कर रही है।

मुख्य तर्क: AI फैक्ट्रीज़ AI युग का परिभाषित इन्फ्रास्ट्रक्चर हैं। NVIDIA AI फैक्ट्री को ऐसी सुविधा के रूप में परिभाषित करता है जहां कंप्यूट ऊर्जा और डेटा को इंटेलिजेंस में बदलता है — और "AI अर्थव्यवस्था में, कंप्यूट रेवेन्यू है।" यह लाइन अंडरलाइन करने योग्य है, क्योंकि यह कंप्यूट क्षमता को स्वयं उत्पाद के रूप में पोजीशन करती है, किसी और के उत्पाद के पीछे समर्थन संसाधन के रूप में नहीं।

इस पोस्ट में यह भी बताया गया है कि AI फैक्ट्री को वास्तव में क्या चाहिए। यह सिर्फ GPU नहीं हैं। NVIDIA जिस पूर्ण स्टैक का नाम लेता है वह उन्नत चिप्स, पैकेजिंग, मेमोरी और नेटवर्किंग है — साथ ही कम आकर्षक लेकिन तेजी से बाध्यकारी बाधाएं: जमीन और बिजली।

यह अभी क्यों प्रसारित हो रहा है: NVIDIA यह फ्रेमिंग एंटरप्राइज़ खरीदारों, सरकारों और इन्फ्रास्ट्रक्चर निवेशकों को एक साथ बेच रहा है। यह दावा करना कि AI फैक्ट्री बिजली संयंत्र या फाइबर बैकबोन जैसी ही है, बातचीत को इस ओर स्थानांतरित करता है कि AI सप्लाई चेन को कौन नियंत्रित करता है और उस सप्लाई चेन को कैसे रेगुलेट किया जाता है।

बिल्डर्स के लिए, निष्कर्ष मार्केटिंग से अधिक व्यावहारिक है। AI प्रोडक्ट्स शिप करने के लिए बॉटलनेक तेजी से कम्प्यूट सप्लाई और उसे डिलीवर करने वाले फिजिकल प्लांट हैं, सिर्फ मॉडल की उपलब्धता नहीं। अगर आप साल के दूसरे हिस्से के लिए क्षमता की योजना बना रहे हैं, तो यही वह बाधा है जिस पर नज़र रखनी चाहिए।

[18:25] Cartesia का Sonic-3.6 दोनों Artificial Analysis Speech Leaderboards में सबसे ऊपर

Cartesia ने 18 अगस्त को Sonic-3.6 जारी किया, एक स्ट्रीमिंग टेक्स्ट-टू-स्पीच मॉडल जो अब दोनों Artificial Analysis स्पीच लीडरबोर्ड्स में सबसे ऊपर है। इसने Provider Voice बोर्ड पर 1,283 Elo और Controlled Voice बोर्ड पर 1,123 Elo हासिल किया।

Controlled Voice रैंकिंग पर थोड़ा रुकना चाहिए। उस बोर्ड पर हर मॉडल को समान आठ रेफरेंस वॉइस पर क्लोन किया जाता है, इसलिए जो वास्तव में स्कोर किया जा रहा है वह सिंथेसिस इंजन है, न कि वह विशेष वॉइस जो प्रोवाइडर ने शिप किया। वहां उच्च स्कोर का मतलब है कि मॉडल किसी भी वॉइस को अच्छा बना रहा है। Provider Voice में उच्च स्कोर का मतलब बस यह हो सकता है कि प्रोवाइडर के पास एक शानदार डेमो वॉइस था। Cartesia दोनों पर पहले स्थान पर है, जो असामान्य है।

अंदर की बात करें तो, Sonic-3.6 स्टेट स्पेस मॉडल्स पर बना है, न कि उस ट्रांसफॉर्मर आर्किटेक्चर पर जो अधिकांश स्पीच सिस्टम उपयोग करते हैं। स्टेट स्पेस मॉडल्स को निरंतर स्ट्रीम को कुशलता से संभालने के लिए डिज़ाइन किया गया था, जो Cartesia के sub-90-millisecond time-to-first-audio के दावे से मेल खाता है — अनुरोध भेजने और पहली आवाज़ सुनने के बीच का अंतर। वॉइस एजेंट के लिए, यह संख्या live महसूस करने और laggy महसूस करने के बीच का अंतर है।

मॉडल Cartesia के अपने API के माध्यम से बीटा में है। बिल्डर्स के लिए, व्यावहारिक सवाल यह है कि उनका मौजूदा TTS पाइपलाइन कितनी तेज़ी से शुरू हो सकता है और कितना human-like लग सकता है। Sonic-3.6 अब दोनों के लिए लीडरबोर्ड का बेंचमार्क है।

एक बात पर नज़र रखनी चाहिए: Sonic-3.6 बीटा में कितनी देर रहता है, और क्या API प्राइसिंग कुछ ऐसी बनती है जिसके आसपास बिल्डर्स प्लान कर सकें।

🎙 Never miss an episode — subscribe now

🎙 Subscribe to AgentStack Daily