
AgentStack Daily: एजेंट स्टैक रिलीज़ रीडआउट: OpenAI Codex rust-v0.149.0
एजेंट स्टैक रिलीज़ रीडआउट: OpenAI Codex rust-v0.149.0, एक नया स्टेल्थ रीज़निंग मॉडल OpenRouter पर आया, Tencent का Hy-MT2-1.8B भी OpenRouter पर उपलब्ध है... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-106/
🎧 Listen to Episodeएपिसोड 106 — 21 अगस्त, 2026
[00:00] एपिसोड हुक
एजेंट स्टैक रिलीज रीडआउट: OpenAI Codex rust-v0.149.0 एक घनी चक्र का नेतृत्व करता है। OpenRouter पर एक नया स्टील्थ रीजनिंग मॉडल उतरा, Tencent का Hy-MT2-1.8B चीनी बोली कवरेज के साथ OpenRouter पर उतरा, Stampli ने ChatGPT Work और Codex के साथ लॉन्च घंटे 68% कट किए और एपिसोड की शुरुआत पूरी करते हैं, जिसके पीछे मॉडल, टूलिंग और इन्फ्रास्ट्रक्चर में गहरी छूत हैं। प्रत्येक कहानी को वही इलाज मिलता है — क्या शिप हुआ, उसके नीचे का तंत्र, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।
[02:00] एजेंट स्टैक रिलीज रीडआउट: OpenAI Codex rust-v0.149.0
OpenAI ने 20 अगस्त को Codex rust-v0.149.0 शिप किया, और मुख्य जोड़ एक इंटरैक्टिव codex agents डैशबोर्ड है। बिल्डर्स अब एक पैनल से टास्क खोज सकते हैं, शुरू कर सकते हैं, खोल सकते हैं, नाम बदल सकते हैं और रोक सकते हैं, जिसमें कॉन्फ़िगरेबल कीबोर्ड शॉर्टकट शामिल हैं।
इस रिलीज में codex queue भी पेश किया गया है, जो मौजूदा लोकल या रिमोट सेशन में मैसेज भेजता है — यह तब उपयोगी है जब आप बिना उसे फिर से खोले किसी लंबे चलने वाले टास्क में फॉलो-अप प्रॉम्प्ट डालना चाहते हैं। TUI यूजर्स को सेशन के अंदर वर्किंग डायरेक्टरी मैनेज करने के लिए /cd, /pwd, और /cwd कमांड मिलते हैं, साथ ही कैरेक्टर रिप्लेसमेंट के साथ विस्तारित Vim एडिटिंग और चेंज मोशन cw, c$, और cc।
इस चक्र में डायग्नोस्टिक्स को एक असली अपग्रेड मिला: codex doctor अब एंडपॉइंट प्रोटेक्शन, नेटवर्क और प्रॉक्सी फेलियर्स, डेस्कटॉप ऐप स्टेट और अपडेट कनेक्टिविटी की जांच करता है, जो उन तरह की समस्याओं को सामने लाता है जो आमतौर पर किसी सेटअप को चुपचाप खत्म कर देती हैं।
SDK यूजर्स के लिए, rust-v0.149.0 आपको कोड से सीधे exact CLI कॉन्फिग ओवरराइड पास करने और max या ultra रीजनिंग effort चुनने देता है। बग फिक्स नई सुविधाओं का समर्थन करते हैं — क्यू किए गए मैसेज अब विश्वसनीय रूप से आलसी सेशन को जगाते हैं, और फिर से शुरू या फोर्क किए गए थ्रेड अपनी सक्रिय अनुमति प्रोफाइल को पुनर्स्थापित करते हैं चुपचाप डिफ़ॉल्ट पर वापस नहीं जाते। रियलटाइम WebRTC साइडबैंड कनेक्शन भी अप्रत्याशित ट्रांसपोर्ट लॉस के बाद बिना पेंडिंग आउटपुट गंवाए फिर से कनेक्ट हो जाते हैं।
आगे देखने योग्य: क्या एजेंट्स डैशबोर्ड मल्टी-एजेंट वर्कफ़्लो मैनेज करने के लिए डिफ़ॉल्ट फ्रंट डoor बनता है।
[02:12] OpenRouter पर एक नया स्टील्थ रीजनिंग मॉडल उतरा
OpenRouter पर Ox Alpha नामक एक नया मॉडल आया है, जिसे "stealth" नामक प्रदाता के तहत सूचीबद्ध किया गया है — इसका मतलब है कि इसके पीछे की कंपनी पेज पर नहीं दी गई है। लिस्टिंग में इसे कोडिंग, निरंतर एजेंटिक कार्य और प्रोडक्शन वर्कलोड के लिए डिज़ाइन किया गया एक रीज़निंग मॉडल बताया गया है, जिसमें लंबे-हॉराइज़न सॉफ्टवेयर इंजीनियरिंग और जटिल रीज़निंग टास्क का उल्लेख है। पब्लिक डिस्क्रिप्शन "text with..." के साथ मध्य वाक्य में कट जाती है — इसलिए आधिकारिक कॉपी भी बिल्डर्स को यह बताए बिना रुक जाती है कि मॉडल और क्या संभालता है।
तकनीकी प्रोफाइल असामान्य है। Ox Alpha एक दस लाख टोकन का कॉन्टेक्स्ट विंडो स्वीकार करता है — जो किसी बड़े कोडबेस या लंबे एजेंट ट्रांसक्रिप्ट को निगलने के लिए काफी बड़ा है — लेकिन प्रति कॉल इसकी अधिकतम आउटपुट केवल 4,096 टोकन है। यह अनुपात यह तय करता है कि मॉडल कहां फिट बैठता है: यह उन एजेंट्स के लिए पोजीशन किया गया है जिन्हें किसी प्रोजेक्ट में व्यापक रूप से पढ़ना होता है, फिर टाइट, फोकस्ड बर्स्ट में जवाब देना होता है, न कि एक ही बार में लंबे जनरेशन लिखना होता है। उन वर्कफ्लो के लिए जो पहले से प्लान करते हैं और अपने आउटपुट को चंक करते हैं, यह बाधा कार्यशील है; फ्रीफॉर्म लॉन्ग-फॉर्म जनरेशन के लिए, यह एक हार्ड सीलिंग है।
अभी तक कुछ और प्रकाशित नहीं हुआ है। कोई बेंचमार्क नहीं, कोई प्राइसिंग नहीं, छोटी डिस्क्रिप्शन से परे कोई मॉडल कार्ड नहीं, और लिस्टिंग के साथ कोई स्वतंत्र इवैल नहीं आया है। अधिकांश बिल्डर्स के लिए, व्यावहारिक निष्कर्ष यह है कि इसे स्थापित कोडिंग मॉडल के स्वैप-इन रिप्लेसमेंट के बजाय एक प्रोबिंग एक्सपेरिमेंट के रूप में देखा जाए। OpenRouter मॉडल पेज अभी तक का एकमात्र आर्टिफैक्ट है, और यहीं पर कोई भी प्राइसिंग, वेट्स, या थर्ड-पार्टी नंबर पहले दिखाई देंगे।
[03:45] Tencent का Hy-MT2-1.8B चीनी बोली कवरेज के साथ OpenRouter पर आता है
Tencent ने Hy-MT2-1.8B जारी किया है, एक कॉम्पैक्ट ट्रांसलेशन मॉडल जो अब OpenRouter पर सूचीबद्ध है। मॉडल 1.8 अरब पैरामीटर के साथ बनाया गया है जिसमें 8192 टोकन का कॉन्टेक्स्ट विंडो और 4096 टोकन का आउटपुट सीलिंग है, जो ओपन-एंडेड चैट की तुलना में ट्रांसलेशन जॉब्स के लिए ज्यादा उपयुक्त है।
इसे देखने योग्य बनाने वाली बात भाषा कवरेज है। यह 33 भाषा जोड़ी का समर्थन करता है और इसके ऊपर पांच चीनी बोली और अल्पसंख्यक-भाषा जोड़ी जोड़ता है, जो इस आकार के मॉडल के लिए असामान्य है। यह स्ट्रक्चर्ड टेक्स्ट, डेलिमिटर-आधारित इनपुट, कॉन्टेक्स्चुअल ट्रांसलेशन, ग्लॉसरी-आधारित आउटपुट और स्टाइल गाइडेंस के लिए ट्रांसलेशन वर्कफ्लो भी एक्सपोज करता है, इसलिए डेवलपर्स इसे फॉर्मेट, टर्मिनोलॉजी और टोन के बारे में विशिष्ट निर्देश दे सकते हैं, बजाय इसके कि बेस्ट की उम्मीद करें।
बिल्डर्स के लिए, व्यावहारिक पिच यह है कि ट्रांसलेशन टूलिंग अब जनरल-पर्पस LLM की तुलना में बहुत हल्के मॉडल पर चल सकती है। regional Chinese language communities, डॉक्यूमेंट ट्रांसलेशन पाइपलाइन, या टर्मिनोलॉजी-भारी वर्कफ्लो बनाने वाली टीमें commodity hardware पर इसके साथ प्रोटोटाइप कर सकती हैं, इससे पहले कि वे तय करें कि स्केल अप करना है या नहीं। जो चीज देखने योग्य है वह उन बोली जोड़ी पर रियल-वर्ल्ड क्वालिटी और कंट्रोल्ड डेमो के बाहर स्ट्रक्चर्ड वर्कफ्लो कितनी अच्छी तरह व्यवहार करती हैं।
[04:52] Stampli ने ChatGPT Work और Codex के साथ लॉन्च के घंटे 68% कम किए
Stampli को एक समस्या थी जो किसी भी छोटी प्रोडक्ट टीम से परिचित है: लॉन्च की डेडलाइन तय थी, और डिज़ाइन रिसोर्सेज जो सामान्यतः लॉन्च प्रोडक्शन संभालते थे, वे कहीं और कमिटेड थे। कंपनी को किसी तरह शिप करना था।
तो उसने Codex और ChatGPT Work का सहारा लिया। 20 अगस्त को OpenAI की न्यूज साइट पर प्रकाशित केस स्टडी के अनुसार, Stampli ने दोनों टूल्स का उपयोग लॉन्च प्रोडक्शन वर्क के लिए किया जो सामान्यतः टीम के हफ्तों का समय खाते। परिणाम: लॉन्च मूल घंटे अनुमान से 68% कम पर शिप हुआ, हफ्तों का काम दिनों में सिमट गया।
यह mechanism सीधा है — जब मानव design capacity कहीं और बंद हो जाती है, तो आप production-shaped tasks को एक AI agent को सौंप सकते हैं और इसे roadmap के बाकी हिस्से के साथ parallel में काम करने दे सकते हैं। Stampli को hire करने की जरूरत नहीं थी, delay की जरूरत नहीं थी, और deadline को renegotiate करने की जरूरत नहीं थी। उसने बस agent को launch checklist की ओर point किया और इसे चलने दिया।
जो builders के लिए इसका मतलब है वह यह है कि fixed deadlines अब capacity tight होने पर टूटने वाली चीज नहीं होनी चाहिए। अगर आपके पास कोई launch, migration, या कोई अन्य time-boxed काम runway पर पड़ा है क्योंकि वे लोग जो normally इसे करते हैं, वे committed हैं, तो एक AI workhorse अब एक viable substitute है न कि last resort।
एक बात worth watching है: OpenAI case study यह नहीं बताती कि saved time का कितना हिस्सा Codex बनाम ChatGPT Work से आया, या agent ने कौन से specific launch tasks handle किए। उस तरह की breakdown matter करती अगर आप इस approach को अपने own project पर copy करना चाहते हैं।
[06:37] Ramp Router लॉन्च करता है, एक AI Model Routing Service
Ramp, जो corporate cards और expense management software के पीछे fintech company है, ने 20 अगस्त को अपनी own AI model routing service लॉन्च की। TechCrunch report के अनुसार, Router नामक यह product users और companies को various large language models तक पहुंचने और उनके बीच switch करने के लिए एक single API देता है।
A model router एक application और कई model providers के बीच बैठता है, ताकि एक customer एक integration लिखता है और router को यह तय करने देता है कि कौन सा model जवाब दे। उस तरह का abstraction more common हो गया है क्योंकि businesses cost, latency, या capability reasons के लिए work को multiple models में फैलाती हैं।
Report यह specify नहीं करती कि Router कौन से models को support करता है, इसके routing decisions कैसे बनाए जाते हैं, pricing कैसे काम करती है, या service किसी के लिए open है या existing Ramp customers तक limited है। वे details matter करेंगी जब product ज्यादा hands में जाएगी।
जो clear है वह यह है कि Ramp अपने original finance software footprint से आगे बढ़कर AI infrastructure में stepping है। Company अपने expense और bill pay products में AI features build कर रही है, और Router उस work को एक more general-purpose offering में extend करती प्रतीत होती है जो एक market को target करती है जहां पहले से कई routing services operate करती हैं।
Builders के लिए, open question access है। अगर Router एक standalone API के रूप में ship होती है जिसे कोई भी use कर सके, तो यह established routing services के साथ directly compete करती है। अगर यह Ramp के platform के अंदर bundled रहती है, तो यह एक product की तुलना में एक feature के रूप में ज्यादा function करती है। August 20 की announcement launch की पुष्टि करती है लेकिन उस distribution question को open छोड़ देती है।
[08:08] Memory, Not Compute, Is the New AI Bottleneck
मेमोरी शांत रूप से AI इन्फ्रास्ट्रक्चर में बाधा बनती जा रही है, और Counterpoint Research के विश्लेषकों का कहना है कि आपूर्ति 2027 तक और उससे आगे तक कड़ी होती रहेगी। यह बदलाव इन्फरेंस से प्रेरित है, जो अब दुनिया भर में AI वर्कलोड का एक बड़ा हिस्सा बन गया है। जैसे-जैसे तैनात मॉडलों के खिलाफ अधिक क्वेरी चलाई जाती हैं, High Bandwidth Memory पर दबाव - एक्सेलेरेटर पर सीधे रखी जाने वाली तेज, महंगी RAM - आपूर्ति से मेल खाने से तेजी से बढ़ा है।
HBM अभी भी महंगा है और क्षमता-सीमित है, और यह हाइपरस्केलर्स को Compute Express Link, या CXL को सर्वरों में मेमोरी को स्केल करने के एक तरीके के रूप में देखने के लिए प्रेरित कर रहा है। हर नोड को अपना निश्चित HBM पूल ले जाने के बजाय, CXL सिस्टम को मेमोरी संसाधनों को साझा करने की अनुमति देता है ताकि वर्कलोड जरूरत पड़ने पर बड़े पूल से ड्रा कर सके। क्लाउड ऑपरेटरों को लक्षित करने वाला एक HPCwire लेख इसे फ्रंटियर AI को बड़े पैमाने पर चलाने वाले किसी भी व्यक्ति के लिए अगला इन्फ्रास्ट्रक्चर सवाल के रूप में प्रस्तुत करता है।
बिल्डर्स के लिए, व्यावहारिक निष्कर्ष यह है कि इन्फरेंस लेयर पर हार्डवेयर प्लानिंग मेमोरी प्लानिंग जैसी दिखने लगेगी। बड़े-संदर्भ वाले जॉब्स, लंबे दस्तावेज़ों का सारांश, या कम-विलंबता सर्विंग के लिए कई मॉडल रेजिडेंट रखने वाले कोई भी व्यक्ति पहले HBM की कीमत और उपलब्धता महसूस करेगा। ध्यान देने योग्य बात यह है कि CXL मेमोरी पूलिंग कितनी जल्दी निचले-स्तरीय तैनाती से मुख्यधारा के क्लाउड क्षेत्रों में वास्तविक विकल्प बनकर आती है, क्योंकि इससे यह तय होगा कि मेमोरी एक कठिन बॉटलनेक बनी रहेगी या फिर से एक लचीला संसाधन बन जाएगी।
[09:36] Cerebras' CS-4 Wafer-Scale Engine 3 के साथ 750 PFLOPS पर पहुंचा
Cerebras ने इस सप्ताह अपने CS-4 सिस्टम का आधिकारिक तौर पर खुलासा किया, और प्रमुख आंकड़ा नजरअंदाज करना मुश्किल है: 750 PFLOPS AI कंप्यूट (प्रति सेकंड क्वाड्रिलियन ऑपरेशन), जो 129.6 पेटाबाइट क्षमता के साथ जोड़ा गया है। सिस्टम Cerebras के Wafer Scale Engine 3 के इर्दगिर्द बना है - एक प्रोसेसर जो पूरे सिलिकॉन वेफर को सैकड़ों छोटे डाइस में काटने के बजाय एक सिंगल चिप में बदल देता है।
यह वेफर-स्केल दृष्टिकोण Cerebras की पिच का दिल है। जहां GPU-आधारित सिस्टम कई अलग-अलग चिप्स को स्टैक करते हैं और उनके बीच डेटा शटल करते हैं, वेफर-स्केल इंजन कंप्यूट को सिलिकॉन के एक टुकड़े पर रखता है, जिसके बारे में कंपनी का तर्क है कि यह पारंपरिक मल्टी-चिप डिज़ाइन में आने वाले बैंडविड्थ बॉटलनेक को हटा देता है। CS-4 वह प्रोडक्शन सिस्टम है जो Wafer Scale Engine 3 को कुछ ऐसी चीज़ में लपेटता है जिसे ग्राहक वास्तव में तैनात कर सकते हैं।
Cerebras ने CS-4 को GPU-घने AI क्लस्टर के प्रति एक जानबूझकर प्रति-तर्क के रूप में पोजिशन किया है, और लॉन्च कवरेज इस फ्रेमिंग पर जोर देती है - इसे कंपनी का GPU निर्माताओं पर बड़ा प्रभाव डालने के रूप में वर्णित करती है, Wafer Scale Engine 3 को उस तर्क की नींव के रूप में।
बिल्डर्स और ऑपरेटर्स के लिए, व्यावहारिक सवाल पहुंच का है। वेफर-स्केल सिस्टम अभी तक ज्यादातर शोध और पायलट तैनाती में रहे हैं, और CS-4 का बड़े-मॉडल लैब्स, हाइपरस्केलर्स और सरकारी AI कार्यक्रमों में स्वागत तय करेगा कि यह एक विशेष विकल्प बना रहेगा या मुख्यधारा के ट्रेनिंग पाइपलाइन में दिखने लगेगा। अगली तिमाही में क्लाउड उपलब्धता और नामित ग्राहकों की घोषणाएं बताएंगी कि वेफर-स्केल कंप्यूट डेमो से डिप्लॉय करने योग्य में बदल गया है या नहीं।
[11:08] OpenAI बताता है कि वह साइबर जोखिम बढ़ने के साथ फ्रंटियर मॉडल की गति कैसे नियंत्रित करता है
OpenAI ने 18 अगस्त को "साइबर-क्रिटिकल क्षमताओं के युग में मॉडल विकास की गति" शीर्षक से एक पोस्ट प्रकाशित की। इस लेख में बताया गया है कि कंपनी साइबर क्षमताओं के बढ़ते चिंताजनक होने के रूप में फ्रंटियर मॉडल भेजने की समय-सीमा को कैसे प्रबंधित करती है।
यह पोस्ट अधिक सक्षम प्रणालियों को जारी करने के लिए तीन स्तंभों को गेटिंग तंत्र के रूप में प्रस्तुत करती है: निगरानी, संरेखण, और सुरक्षा। ये सुरक्षा उपाय उस लीवर के रूप में स्थित हैं जो निर्धारित करती है कि OpenAI किस गति से नई फ्रंटियर क्षमताओं को बाहर की ओर बढ़ाता है। यह ढांचा साइबर क्षमता को विशेष रूप से एक सीमा के रूप में मानता है, जिसमें सुरक्षा कार्य को क्षमता वृद्धि से आगे रहने के लिए डिज़ाइन किया गया है, न कि उनके प्रति प्रतिक्रिया करने के लिए।
यह एक उत्पाद घोषणा नहीं बल्कि एक मुद्रा/दृष्टिकोण पेशकश है। पोस्ट में कोई विशिष्ट नया मॉडल, लॉन्च तिथि, या डेवलपर-उन्मुख फीचर का नाम नहीं है। इसके बजाय यह बताता है कि OpenAI साइबर-प्रासंगिक क्षमताओं को गेट करने के बारे में कैसे सोचता है, और अधिक सक्षम प्रणाली जारी होने से पहले क्या आंतरिक कार्य पूरा होना चाहिए।
बिल्डर्स के लिए, व्यावहारिक संकेत यह है कि अत्यधिक सक्षम फ्रंटियर मॉडलों की रिलीज़ cadence OpenAI के सुरक्षा मील के पत्थरों को ट्रैक करती रहेगी, विशेष रूप से साइबर उपयोग के मामलों के संबंध में। भविष्य के मॉडल उपलब्धता की योजना बनाने वाली टीमों को एक निश्चित रोडमैप मानने के बजाय उन सुरक्षा मील के पत्थरों को गेटिंग मोमेंट के रूप में पढ़ना चाहिए। एक बात ध्यान देने योग्य है कि क्या यह फ्रेमवर्क ठोस डिप्लॉयमेंट विकल्पों में दिखाई देता है — विशेष रूप से कैसे OpenAI उन रिलीज़ को संभालता है जो साइबर-प्रासंगिक क्षमताओं को बढ़ाती हैं।
[12:33] OpenAI ने 'AI Futures' ब्लॉग लॉन्च किया — शक्ति, शासन, और स्वतंत्रता पर
OpenAI ने 20 अगस्त को "AI Futures" नामक एक नया ब्लॉग लॉन्च किया, जो कंपनी की न्यूज़ साइट पर प्रकाशित है। इस श्रृंखला को उस जगह के रूप में प्रस्तुत किया गया है जहां OpenAI अन्वेषण करता है कि कैसे परिवर्तनकारी AI चार बड़े क्षेत्रों को पुनर्आकार दे सकता है: शक्ति, शासन, अर्थव्यवस्था, और व्यक्तिगत स्वतंत्रता।
यहां कोई नया मॉडल या उत्पाद नहीं आ रहा है। बदलाव संपादकीय है: OpenAI अपनी बनाई जा रही तकनीक के दीर्घकालिक सामाजिक प्रभावों पर अपना खुद का फ्रेमिंग प्रस्तुत कर रहा है। पहला लेख, जिसका शीर्षक "AI Futures का परिचय" है, इस श्रृंखला के लिए फ्रेमिंग पोस्ट के रूप में कार्य करता है।
बिल्डर्स के लिए, व्यावहारिक निष्कर्ष संदर्भ है। ब्लॉग पढ़ने से OpenAI स्वयं तकनीक के जोखिम के बारे में कैसे बात कर रहा है, इसकी समझ मिलती है — यह पृष्ठभूमि जानकारी उपयोगी है जब सोच रहे हों कि अगले कुछ वर्षों में सार्वजनिक बातचीत, नीति बहस, और AI के बारे में ग्राहकों के सवाल कहां जा रहे हैं।
एक बात ध्यान देने योग्य: अगली पोस्ट में OpenAI कठिन नीति सवालों पर क्या स्थिति लेता है, क्योंकि इस तरह का ब्लॉग often signals where the company wants to be in those debates.
[13:37] LiquidAI Claims Up to 3.2x Faster Inference with LFM2.5-DSpark
LiquidAI ने 20 अगस्त 2026 को Hugging Face ब्लॉग पर LFM2.5-DSpark पेश करते हुए एक ब्लॉग पोस्ट प्रकाशित किया और 3.2x तक तेज़ अनुमान का दावा किया। यह गति सुधार आंकड़ा मुख्य बात है। शीर्षक से परे, एकमात्र सत्यापित विवरण यह है कि घोषणा LiquidAI के Hugging Face ब्लॉग पर है और इस ब्रीफिंग के स्रोत सामग्री में कोई अलग चेंजलॉग या रिलीज़ नोट्स प्रदान नहीं किए गए थे।
कोई भी जो वास्तविक तंत्र चाहता है — मॉडल में क्या बदला, बेंचमार्क किस हार्डवेयर पर चला, बेसलाइन क्या थी, या वास्तविक वर्कलोड पर स्पीडअप कैसे बनी रहती है — उसे सीधे उस ब्लॉग पोस्ट को पढ़ना होगा। क्योंकि यहां स्रोत सामग्री केवल शीर्षक दावे तक सीमित है, कहानी संकीर्ण रहती है: LiquidAI कहता है कि LFM2.5-DSpark सार्थक रूप से तेज़ है, और तस्वीर का बाकी हिस्सा पोस्ट में ही है।
[14:26] IBM Research पूछता है कि AI एजेंट को वास्तव में कितनी मेमोरी चाहिए
IBM Research की एक नई Hugging Face ब्लॉग पोस्ट है जिसका शीर्षक है "आपके एजेंट को वास्तव में कितनी मेमोरी चाहिए?" यह उनकी altk परियोजना के अंदर है, जिसे URL आंतरिक वर्कस्ट्रीम के रूप में प्रस्तुत करता है, और स्लग दृष्टिकोण के बारे में एक मजबूत संकेत देता है: "evolve-hmm," जो Hidden Markov Models पर एक प्राचलिक खोज (evolutionary search) के रूप में पढ़ता है।
Hidden Markov Models एक पुराना सांख्यिकीय उपकरण है जो अवलोकन योग्य घटनाओं के प्रवाह से छिपी हुई स्थितियों का अनुमान लगाता है। ये सबसे अधिक वाक् पहचान (speech recognition) और बायोइनफॉर्मेटिक्स में दिखाई देते हैं। टैग का "evolve" आधा हिस्सा सुझाव देता है कि टीम उन मॉडलों के उम्मीदवार विन्यासों (candidate configurations) में खोज कर रही है, न कि हाथ से एक चुन रही। कि यह वास्तव में एजेंट की वर्किंग मेमोरी पर कैसे मैप होता है — यह वह हिस्सा है जो शीर्षक खुला छोड़ देता है।
ईमानदार चेतावनी: यहां स्रोत सामग्री शीर्षक और URL है। निष्कर्षों के बारे में कुछ और विशिष्ट, जिसमें परीक्षण की गई मेमोरी साइज़, बेंचमार्क किए गए एजेंट, या रिपोर्ट किए गए अंतर शामिल हैं, वह उपलब्ध जानकारी पर आधारित नहीं है। जो श्रोता संख्याएं चाहते हैं उन्हें सीधे पेज को बुकमार्क करना चाहिए बजाय रिकैप पर भरोसा करने के।
व्यवहार में इसका क्या महत्व है: अगर आप एक लंबे-चले एजेंट चला रहे हैं और संदर्भ विंडोज़ के बढ़ने को देख रहे हैं, या यह अनुमान लगा रहे हैं कि प्लानर को कितनी स्क्रैचपैड मेमोरी चाहिए, तो एक वेंडर-प्रकाशित प्रयास जो अनुमान के बजाय मापता है, कम से कम एक उपयोगी तर्क-संगति जांच (sanity check) है। क्यों यह मायने रखता है: एजेंट मेमोरी आकार के बारे में बातचीत अभी ज्यादातर अंतर्ज्ञान और अनुभवजन्य नियमों पर आधारित है, और कुछ भी जो समस्या पर पटरी रखता है, उसका मूल्य है।
एक बात नजर रखने की: क्या altk टीम विकसित विन्यास, वे बेंचमार्क जो उन्होंने चलाए, या कोड प्रकाशित करती है जो एक बिल्डर को अपना एजेंट प्लग करने और आकार की पुनरुत्पादन करने देता है। यहीं पर इस तरह की रिसर्च सभी के लिए भुगतान करती है, या नहीं करती।
[16:12] एक नया जेलब्रेक दुर्गम टेक्स्ट के अंदर दुर्भावनापूर्ण निर्देश छिपाता है
Grok को यूजर डेटा सौंपने के लिए धोखा दिया जा सकता है जब एक हमलावर दुर्गम टेक्स्ट के अंदर दुर्भावनापूर्ण निर्देश छुपाता है। इस तकनीक का नाम Cryptographic Context Injection है, जिसकी रिपोर्ट Ars Technica ने 20 अगस्त को दी थी, जो AI की सुरक्षा गार्डरेल को चकमा देने का नवीनतम तरीका है।
यह तरकीब एक मूलभूत अंतर पर निर्भर करती है। सुरक्षा फिल्टर प्रॉम्प्ट को जैसे वह आता है पढ़ते हैं, इसलिए जब हानिकारक निर्देश दुर्गम या एन्कोडेड टेक्स्ट के रूप में आते हैं, तो फिल्टर केवल गड़बड़ी देखता है और प्रॉम्प्ट को पास होने देता है। एक बार असिस्टेंट से छिपी हुई सामग्री को डिकोड करने और उस पर कार्रवाई करने के लिए कहा जाता है, तो यह उन निर्देशों का पालन करता है जिन्हें गार्डरेल ने कभी खतरनाक के रूप में पहचाना नहीं था।
पैटर्न उस किसी के लिए मायने रखता है जो एक सहायक शिप कर रहा है जो बाहरी स्रोतों से टेक्स्ट प्रोसेस करता है, जिसमें पेस्ट किए गए snippets, रिट्रीव्ड डॉक्यूमेंट्स और फेच्ड वेब पेज शामिल हैं। अगर मॉडल इनपुट को डिकोड कर सकता है, तो एक हमलावर उसके अंदर छिप सकता है।
Ars Technica ने इसे guardrail-bypass tricks की एक लंबी श्रृंखला में नवीनतम प्रविष्टि के रूप में प्रस्तुत किया है। देखने की अगली बात यह है कि एक बार शोधकर्ता उन्हें probe करना शुरू कर दें, तो वही wrapped-prompt पैटर्न अन्य प्रमुख assistants पर कितनी व्यापक रूप से काम करता है।
[17:18] Show HN: मैंने 125M मॉडल को on-device piano autocomplete करने के लिए ट्रेन किया
Hacker News score 554; discussion: https://news.ycombinator.com/item?id=49373456; headline-only source — insufficient for a full story The primary source at simedw.com supports only these stated facts; unsupported specifications are deliberately omitted. The primary source supports the specific product or workflow change above; it does not support broader claims about performance, compatibility, or deployment. Test the sourced change against one real workflow before depending on it.
[17:42] S1-mini से मिलें: Superwhisper's 462 MB Open-Weights Text Normalizer जो Raw ASR Transcripts को Clean Written Text में बदलता है
S1-mini एक 462 MB open-weights normalizer है जो ASR के बाद बैठता है, locally fillers हटाता है और self-corrections resolve करता है। The post Meet S1-mini: Superwhisper's 462 MB Open-Weights Text Normalizer That Turns Raw ASR Transcripts Into Clean Written Text appeared first on MarkTechPost. This is the company's published policy position, not enacted law or a newly shipped model capability. The mechanism is control of model weights: open weights support independent inspection and local deployment, while restricted frontier weights remain under provider control because of security concerns. Builders choosing open models should separate this stated position from current law and wait for concrete license or access changes before altering a stack.