
Claude Opus 5.5 $4 इनपुट, $20 आउटपुट पर उतरता है, GPT-6 Sol और Astra से मिलता है
Claude Opus 5.5 $4 इनपुट और $20 आउटपुट पर उतरता है, जिसमें Fable-class परिणाम मिलते हैं। यह इस एपिसोड में GPT-6 Sol और Astra के साथ सीधे मुकाबले में है। Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-116/
🎧 Listen to Episodeएपिसोड 116 — 23 सितंबर, 2026
[00:00] एपिसोड हुक
Hermes Agent ने v0.21.4 शिप किया, v2026.9.21 टैग के साथ, 21 सितंबर, 2026 को, जिसमें लगभग 1,800 मर्ज किए गए पुल रिक्वेस्ट और 5,071 नॉन-मर्ज कमिट को 5,169 बदले गए फाइलों में एक पैच रिलीज में रोल किया। Anthropic ने 22 सितंबर को Claude Opus 5.5 रिलीज किया, प्रति मिलियन इनपुट टोकन $4 और प्रति मिलियन आउटपुट टोकन $20 पर, जो अधिकांश बेंचमार्क पर Claude Fable 5.1 जितना अच्छा प्रदर्शन करता है जबकि ऑपरेट करने में 40% सस्ता है। OpenAI ने लगभग डेढ़ घंटे बाद GPT-6 Sol और Luna के साथ अनुसरण किया। SpaceXAI ने भी 21 सितंबर, 2026 को Grok 4.7 शिप किया, Grok 4.6 से बड़े बेस मॉडल पर बना, कॉडिंग और नॉलेज-वर्क सुधारों के साथ समान $2 इनपुट और $6 आउटपुट प्राइसिंग पर। Nokia ने AnyJev ओपन-सोर्स किया, एक Python लाइब्रेरी जो बिना अतिरिक्त ट्रेनिंग के ओपन-सोर्स LLM को कैलिब्रेटेड डिसीजन सिस्टम में बदलती है, जबकि NVIDIA ने Nemotron 3 Diarization रिलीज किया, एक 100-मिलियन-पैरामीटर ओपन-वेट मॉडल जो लाइव तक आठ ओवरलैपिंग स्पीकर को ट्रैक करता है।
[02:00] Agent Stack Release Readout: Hermes Agent v2026.9.21
Hermes Agent ने v0.21.4 शिप किया, v2026.9.21 टैग के साथ, 21 सितंबर, 2026 को। यह Nous Research से एक पैच रिलीज है जो v0.21.3 से लगभग 1,800 मर्ज किए गए पुल रिक्वेस्ट को downstream उपभोक्ताओं के लिए एक स्थिर टैग में रोल करता है जैसे Docker images, Hermes Cloud, और होस्टेड डिप्लॉयमेंट। commit 4b8a8134009a8727a289bcabeb0019fedd353128 पर मापा गया, v0.21.3 के बाद का विंडो 5,169 बदली गई फाइलों में 5,071 नॉन-मर्ज कमिट, 312,961 लाइनें जोड़ी गईं और 62,855 हटाई गईं, 1,812 मर्ज PR और 2,116 बंद इशू के साथ है। इस विंडो में सब कुछ के लिए क्यूरेटेड रिलीज नोट्स v0.22.0 में डिफर किए गए हैं।
विंडो में कई ठोस बदलाव आए। CLI --format stream-json प्राप्त करता है स्ट्रक्चर्ड JSONL आउटपुट के लिए, जिसे downstream टूलिंग सीधे ingest कर सकती है। एक नई mcp.discovery_concurrency सेटिंग पैरलल MCP डिस्कवरी कनेक्शन को कैप करती है, जो कोल्ड स्टार्ट के दौरान ऑपरेटर्स को एक ट्यूनबल नॉब देती है। skills.auto_load अब चुनिंदा स्किल्स को हर नए सेशन प्रॉम्प्ट में पिन करता है, ताकि उपलब्ध स्किल्स का सेट सेशन में सुसंगत रहे बिना पुनः-invocation के। होस्ट-वाइड गेटवे सिंगलटन लॉक रेंडेज़वस रिकॉर्ड के साथ का मतलब है कि Desktop क्लाइंट अब रनिंग होस्ट बैकएंड से जुड़ता है बजाय दूसरा स्पॉन करने के, और एक बैकएंड-स्वामित्व कनेक्टर ऑपरेशन Desktop, TUI, और CLI पर सेटअप कार्ड के रूप में दिखाई देता है।
अन्य जोड़ों में गेटवे के लिए decline unauthorized-DM व्यवहार, session_search after और before बाउंड के साथ OR-relaxed recall retry, और hermes sessions set-journal-mode कमांड शामिल हैं। Desktop चैट और UI फॉन्ट पिकर, वन-क्लिक लोकल इंजन अपडेट, और Plugins हब से प्लगइन अनइंस्टॉल प्राप्त करता है। वीडियो कैटलॉग में LTX 2.5 और Kling O3 जुड़ गए, और वेबसाइट पर अब हर कैटलॉग प्लगइन और ऑथर का एक पेज है जिसमें pinned-commit README और जोड़ी या अपडेट की गई सॉर्टिंग है। कैटलॉग में लगभग दर्जन भर कम्युनिटी प्लगइन शामिल हुए, जिसमें tailscale, ssh, shodan, terminal, rss, resetwatch, done-bell, kiwi, cognee, और octen शामिल हैं।
अपडेट करने के लिए, git इंस्टॉल hermes update चलाते हैं, और Docker या Hermes Cloud उपयोगकर्ता nousresearch/hermes-agent:v2026.9.21 से pull करते हैं।
[03:10] Claude Opus 5.5 $4 इन, $20 आउट पर Fable-क्लास परिणाम देता है
Anthropic ने 22 सितंबर को Claude Opus 5.5 शिप किया, Claude 5.5 परिवार का पहला मॉडल, जिसमें Sonnet 5.5 और Haiku 5.5 सप्ताहों में आने हैं। मुख्य दावा: Opus 5.5 अधिकांश काम पर Claude Fable 5.1 जितना अच्छा प्रदर्शन करता है जबकि कम लागत पर चलता है। प्राइसिंग उस बदलाव को प्रतिबिंबित करती है। इनपुट टोकन $4 प्रति मिलियन की लागत versus Opus 5 के $5, आउटपुट टोकन $20 versus $25, और cached reads 60% सस्ते हैं जो $0.20 हैं। डिफ़ॉल्ट सेटिंग्स पर, विशिष्ट वर्कलोड की कुल लागत 40% कम है। आउटपुट Opus 5 से 30% से अधिक तेज़ी से जनरेट करता है। मॉडल में 1,000,000 टोकन का कॉन्टेक्स्ट विंडो है और 128,000 आउटपुट टोकन तक का समर्थन करता है, जो टेक्स्ट, इमेज और फाइल इनपुट को हैंडल करता है। यह Claude Platform, AWS, Google Cloud, Microsoft Azure, और GitHub Copilot पर उपलब्ध है, विकल्प के रूप में शून्य डेटा रिटेंशन के साथ।
द किंग मॉडल अब अनिवार्य है। उपयोगकर्ता प्रयास स्तर—कम, मध्यम, उच्च, एक्सहाई, या अधिकतम—में से चुन सकते हैं, लेकिन सोचने को पूरी तरह से बंद नहीं कर सकते। अधिकतम प्रयास अनुकूली सोच को अनलॉक करता है, जो अंतिम आउटपुट से पहले अधिक आंतरिक तर्क चरण उत्पन्न करता है। Claude Code और Claude Platform में फास्ट मोड प्रति मिलियन टोकन $8 इनपुट और $40 आउटपुट पर 2.5 गुना तेज चलता है, जो गति के बदले लागत का व्यापार करता है।
Anthropic ने Opus 5.5, Fable 5.1, और Opus 5 को अधिकतम प्रयास पर अनुकूली सोच के साथ तुलना करने वाले बेंचमार्क परिणाम प्रकाशित किए। Terminal-Bench 4.0 पर, Opus 5.5 ने 52.3% के मुकाबले 66.4% स्कोर किया। AutomationBench पर, अंतर 26.9% के मुकाबले 40.0% तक बढ़ गया। OSWorld 2.0 आंशिक पर, Opus 5.5 ने 74.0% के मुकाबले 81.8% पर पहुंचा। GDPval-AA v2.1 Elo ने Opus 5.5 को 1846 पर रखा बनाम Opus 5 का 1708। Anthropic ने ग्राहकों के आंतरिक परीक्षण परिणाम भी साझा किए। Stripe ने मॉडल के माध्यम से 40 स्टैक्ड पुल रिक्वेस्ट चलाए और सभी CI पास हुए। Box ने पिछली रन की तुलना में एक तिहाई टोकन का उपयोग किया जिसमें 40% कम वर्बोज आउटपुट था। Deloitte ने कम प्रयास पर 56% की तुलना में 72% रोपे गए बग पकड़े। Hebbia ने एक शोध कार्य पर 60.3% के मुकाबले 86.6% रूब्रिक कवरेज हासिल किया।
METR और Frontier Design द्वारा रिलीज से पहले सुरक्षा परीक्षण से पता चला कि लगभग 2,000 परिदृश्यों के स्वचालित व्यवहार ऑडिट पर Opus 5.5 ने अब तक का Anthropic का सर्वश्रेष्ठ स्कोर पोस्ट किया और Opus 5 की तुलना में संदूक सीमाओं को पार करने का प्रयास लगभग 85% कम बार किया। Anthropic नोट करता है कि मॉडल अक्सर संदेह करता है कि उसका मूल्यांकन किया जा रहा है, जो उस आंकड़े पर विश्वास को सीमित करता है। साइबर कार्य सुरक्षा उपायों के तहत Opus 4.8 पर रूट होते हैं, और Anthropic ने सत्यापित संगठनों के लिए साइबर सत्यापन कार्यक्रम और जीवन विज्ञान सत्यापन कार्यक्रम खोला है। पांच घंटे की उपयोग सीमाएं Pro, Max, Team, और सीट-आधारित Enterprise योजनाओं के लिए बढ़ रही हैं। आउटपुट EU AI Act अनुपालन के लिए टेक्स्ट वॉटरमार्किंग ले जाता है, और 31 अगस्त, 2026 या उसके बाद बनाए गए API खातों पर Fable 5.1 और Opus 5.5 के लिए संरक्षित सोच लागू होती है।
[05:58] सिर-से-सिर: GPT-6 Sol और GPT-6 Astra बनाम Anthropic का नया फ्लैगशिप
Anthropic ने 22 सितंबर, 2026 को Claude Opus 5.5 शिप किया। OpenAI ने लगभग 90 मिनट बाद GPT-6 Sol और Luna के साथ जवाब दिया, हालांकि Astra अभी भी OpenAI का टॉप-टियर फ्लैगशिप है। मूल्य निर्धारण तस्वीर अब ठोस है। Opus 5.5 प्रति मिलियन इनपुट टोकन $4 और प्रति मिलियन आउटपुट $20 पर सूचीबद्ध है। Astra $10 और $50 पर है। Sol $2 और $10 पर आता है, और Luna एक प्रतिशत के अंश पर। बेंचमार्क पर Anthropic द्वारा लॉन्च के साथ प्रकाशित, Opus 5.5 अपने डिफ़ॉल्ट मध्यम प्रयास पर Astra के Terminal-Bench स्कोर से बंधा है, लगभग पांचवें हिस्से की लागत पर FrontierCode पर Astra के सर्वश्रेष्ठ को हराता है, और टूल्स के साथ Humanity's Last Exam पर अग्रणी है। Astra वैज्ञानिक-केंद्रित और ऑटोमेशन बेंचमार्क पर बढ़त रखता है। तीनों मॉडल 128,000-टोकन अधिकतम आउटपुट, टेक्स्ट-और-इमेज-और-फाइल इनपुट, और एक मिलियन टोकन के करीब संदर्भ विंडो साझा करते हैं। OpenAI ने Sol को Astra की तुलना में काफी कम लागत पर Astra के विकल्प के रूप में कोडिंग और पेशेवर कार्य के लिए पositioned किया, यह दावा करते हुए कि यह FrontierCode पर Claude Fable 5.1 प्रदर्शन से मेल खाता है और एक अंश कीमत पर Astra-स्तर की तथ्यात्मक सटीकता प्राप्त करता है। Luna, सबसे तेज़ और सस्ता टियर, मध्यम प्रयास पर Opus 5 के बराबर 93% कम प्रति कार्य पर स्कोर करता है, जो उच्च-मात्रा स्वचालित वर्कफ़्लो को लक्षित करता है। Simon Willison का मानना है कि प्रीमियम टॉप टियर अब Astra और Claude Fable 5.1 के बीच दो-घोड़ों की दौड़ है, जबकि असली मूल्य युद्ध उससे नीचे हो रहा है, जहां Opus 5.5, Sol, और Grok 4.7 लागत-जागरूक बिल्डर्स के लिए प्रतिस्पर्धा कर रहे हैं।
[07:23] Grok 4.7 लैंड्स: बड़ा मॉडल, वही $2/$6 मूल्य
SpaceXAI ने 21 सितंबर, 2026 को Grok 4.7 जारी किया, इसे कंपनी का कोडिंग और ज्ञान कार्य के लिए सबसे सक्षम मॉडल के रूप में मार्केट करते हुए। मोहोका मूल्य टैग है: यह Grok 4.6 के समान प्रति मिलियन इनपुट टोकन $2 और प्रति मिलियन आउटपुट टोकन $6 पर आता है, समान सर्विंग स्पीड के साथ, और एक वैकल्पिक फास्ट वेरिएंट जो दोगुनी कीमत पर आउटपुट स्पीड को दोगुना करता है।
अंदरूनी तौर पर यह Grok 4.6 से बड़ा बेस मॉडल है, जिसे उन समस्याओं की ओर भारित लंबे रेनफोर्समेंट लर्निंग रन पर प्रशिक्षित किया गया है जिन्हें पूरा होने में कई घंटे लगते हैं। वह अतिरिक्त प्रशिक्षण बेहतर सेल्फ-वेरिफिकेशन, लंबे-संदर्भ हैंडलिंग, और एक नए इंस्ट्रक्शन लेयर में दिखाई देता है जो बातचीत और सामान्य ज्ञान कार्यों के लिए Grok Bot हार्नेस को मूल रूप से समझता है। SpaceXAI ने सुरक्षा स्टैक को भी पुनर्निर्मित किया, यह दावा करते हुए कि Grok 4.7 रिफ्यूज़ल और जेलब्रेक प्रतिरोध पर उनके परीक्षण का सबसे मजबूत मॉडल है। LatchBio के बायोसेफ्टी बेंचमार्क पर यह 62.4% पोस्ट करता है, और HackerBench v0.3 पर यह केवल 3.3% जोखिम भरे ड्यूल-यूज़ प्रॉम्प्ट को गुज़रने देता है जबकि शायद ही कभी वैध सुरक्षा कार्य को ब्लॉक करता है।
बेंचमार्क पर, Grok 4.7 CursorBench 4.0 मूल्य-प्रदर्शन की सीमा पर है, DeepSWE v1.1 पर हाई-प्रयास स्कोर के साथ, और Fable 5.1 और GPT-6 Astra के खिलाफ GDPval, AA Briefcase v1.1, और EEBench पर तुलनीय अंक। दस्तावेज़ और प्रस्तुति निर्माण Grok 4.6 में सुधार हुआ, और SpaceXAI कहता है कि चुनिंदा साइबर सुरक्षा भागीदारों के पास अब रक्षात्मक शोध के लिए अपनी रेड-टीम क्षमताओं तक इनवाइट-ओनली एक्सेस है।
यह आज Cursor, Grok Build, Grok API, तृतीय-पक्ष कोडिंग हार्नेस, और कई मॉडल राउटर और क्लाउड प्लेटफॉर्म पर लाइव है। जो कोई पहले से ही अपने प्रोडक्शन पाइपलाइन में Grok 4.6 चला रहा है, उसके लिए अपग्रेड API स्तर पर प्रभावी रूप से मुफ्त है—मॉडल स्ट्रिंग बदलें और आपको उसी बिल पर बड़ा दिमाग मिलता है।
[09:09] Nokia Open-Sources AnyJev: No-Training Layer Makes Open LLMs Reliable Decision-Makers
Nokia की एप्लाइड रिसर्च टीम ने AnyJev जारी किया है, एक Python लाइब्रेरी जो किसी भी खुले भाषा मॉडल को बिना प्रशिक्षण के कैलिब्रेटेड निर्णय मॉडल में बदल देती है। यह टूल एक सामान्य प्रोडक्शन जरूरत को पूरा करता है: मुक्त-रूप टेक्स्ट जेनरेट करने के बजाय निश्चित सेट में से एक जवाब चुनना। यह Apache-2.0 के तहत PyPI से इंस्टॉल होती है और इसमें transformers और vLLM backends हैं जिनमें कुशल सर्विंग के लिए shared-prefix scoring है।
टीम जिस समस्या को संबोधित करती है वह यह है कि भाषा मॉडल से सीधे प्रायिकताएं पढ़ने से दो निरंतर त्रुटियां होती हैं। पहली, मॉडल इनपुट की परवाह किए बिना कुछ लेबल को प्राथमिकता देते हैं—जिसे टीम prior bias कहती है, जैसे "No" के बजाय "Yes" को प्राथमिकता देना। दूसरी, मॉडल विकल्प सूची में स्थितियों को प्राथमिकता देते हैं, इसलिए क्रम बदलने से जवाब बदल जाता है। दोनों खामियां naive प्रायिकता पढ़ना वास्तविक सिस्टम के लिए अविश्वसनीय बनाती हैं।
AnyJev दो सुधार लागू करती है। L0 cyclic shifts का उपयोग करता है: K विकल्पों वाले प्रश्न के लिए, यह सूची को K अलग-अलग rotations में दिखाता है, ताकि हर विकल्प हर स्थिति में एक बार दिखे। यह परिणामों का औसत ज्यामितीय माध्य के रूप में लॉग स्पेस में लेता है, जो सटीक रूप से स्थिति पूर्वाग्रह को दूर करता है यदि वह logit space में additive है। L0 वास्तविक इनपुट पर predicted distributions का एक running mean रखता है और 8 आइटम देखने के बाद 0.75 की शक्ति पर इसे विभाजित करता है, prior bias को सुधारता है। L1 ऊपर temperature scaling जोड़ता है, जिसके लिए प्रश्न प्रकार के हर 100 से 500 labeled उदाहरणों की आवश्यकता होती है। यह विश्वास स्कोर को फिर से आकार देता है बिना यह बदले कि कौन सा उत्तर पहले स्थान पर आता है।
BANKING77 benchmark—300 टेस्ट आइटम के साथ 20-way classification टास्क—के खिलाफ परीक्षण किए गए Qwen3-8B पर, जब विकल्पों को पुनर्व्यवस्थित किया गया तो raw logits ने 23% समय जवाब बदल दिए। AnyJev L0 ने इसे 7.3% तक कम कर दिया, और L1 ने इसे 7.7% पर रखा। सटीकता 74.7% से 80.7% तक सुधरी। अधिक व्यावहारिक रूप से, 5% त्रुटि थ्रेशोल्ड पर स्वचालित रूप से तय की जा सकने वाली क्वेरी का अंश 7.7% से 52% तक बढ़ गया, जिसका अर्थ है कि आधे से अधिक निर्णयों को मनुष्य के पास भेजने के बजाय विश्वास के साथ रूट किया जा सकता था।
टीम ने Qwen, OLMo, Granite, Phi, और Mistral मॉडलों पर दृष्टिकोण का परीक्षण किया, L0 ने सभी नौ मॉडल और टास्क संयोजनों में क्रम पलटाव को कम किया। Typed-decisions डेटासेट पर, L1 के साथ Qwen3-32B ने 0.036 का कैलिब्रेशन त्रुटि हासिल की, जबकि Jev, जिस व्यावसायिक निर्णय मॉडल की वह नकल करता है, उसके लिए 0.144 की सूचना दी गई थी।
सर्विंग के लिए, डेवलपर्स prefix caching के साथ vLLM को hosted मॉडल पर इंगित करते हैं और AnyJev में VLLMBackend कॉन्फ़िगर करते हैं। टीम एकल H100 पर K बराबर 20 के साथ batch 32 पर निर्णय के लिए लगभग 0.25 सेकंड का अनुमान लगाती है। लाइब्रेरी अब PyPI पर उपलब्ध है।
[11:40] NVIDIA का Nemotron 3 Diarization आठ ओवरलैपिंग स्पीकर को लाइव ट्रैक करता है
NVIDIA ने Nemotron 3 Diarization जारी किया है, एक 100-मिलियन-पैरामीटर open-weight मॉडल जो किसी भी बातचीत के बारे में एक धोखे से सरल सवाल का जवाब देता है: कब किसने बोला। स्वचालित वाक् पहचान आपको शब्द देती है, लेकिन बिना attribution के एक सारांशकार यह नहीं बता सकता कि किसने प्रतिबद्धता दी या किसने आपत्ति उठाई। Diarization उस अंतर को भरता है।
मॉडल आठ स्पीकर तक को ट्रैक करता है और एक ही checkpoint में ओवरलैपिंग आवाज़ों को संभालता है। NVIDIA का पहले का Streaming Sortformer चार पर सीमित था। इनपुट 16 kHz, wav, flac, opus, या mp3 फॉर्मेट में सिंगल-चैनल ऑडियो हैं। 10 ms स्टेप के साथ एक mel-spectrogram को 80 ms encoder frames बनाने के लिए आठ के कारक से stacked किया जाता है, जो rotary positional embeddings के साथ 31-layer Transformer को feed करते हैं। एक आयामी convolution लेयर speaker activity को वापस 10 ms पर upsamples करती है, एक आठ-चैनल tensor बनाती है जहां एक बार में दो आवाज़ें दो चैनलों को प्रकाशित करती हैं।
स्पीकर आगमन समय के अनुसार क्रम में होते हैं, इसलिए पहली नई आवाज़ चैनल वन पर लेती है और स्ट्रीमिंग चंक्स में वहीं रहती है। स्थिरता बनाए रखने के लिए दो मेमोरी मैकेनिज़्म हैं: एक अराइवल-ऑर्डर स्पीकर कैश plus a first-in-first-out queue।
Voice Arena के प्रारंभिक Diarization-Bench पर, जो लगभग 22 घंटे की कुल अवधि के 139 अंग्रेज़ी बातचीत में diarization error rate मापता है, मॉडल ने 14.72% हिट किया बनाम अगले-रैंक्ड सिस्टम के लिए 19.3%, जो लगभग 24% सापेक्ष कमी है। 1.04 s latency पर चार-स्पीकर बेसलाइन के विरुद्ध, औसत सापेक्ष त्रुटि आठ स्थितियों में 41% गिर गई, जिसमें NOTSOFAR1 MHM पर 65% गिरावट। 30.4 s पर Throughput ने एक NVIDIA RTX PRO 5000 पर 15,113x real-time हिट किया।
Weights OpenMDW 1.1 license के तहत व्यावसायिक उपयोग के लिए जारी किए गए हैं। Production paths में Baseten और DigitalOcean शामिल हैं, जिसमें Argmax Pro SDK 3 के माध्यम से on-device mobile शामिल है।
[13:21] OpenAI ने यूक्रेन तक Daybreak साइबर एक्सेस का विस्तार किया
OpenAI ने 23 सितंबर, 2026 को घोषणा की कि वह अपने Daybreak program का विस्तार Ukraine की सरकार तक कर रहा है। कार्यक्रम नागरिक अवसंरचना की साइबर रक्षा का समर्थन करता है, OpenAI News के अनुसार।
विस्तार OpenAI के टूलिंग को यूक्रेनियन नागरिक प्रणालियों को साइबर खतरों से बचाने वाले रक्षात्मक स्टैक के अंदर रखता है। Daybreak एक्सेस एक राष्ट्रीय सरकार के लिए खोलकर, OpenAI नागरिक अवसंरचना को उस श्रेणी के रूप में मान रहा है जो सीधे विक्रेता समर्थन की मांग करती है, intermediaries या तृतीय-पक्ष साझेदारियों के माध्यम से उस समर्थन को रूट करने के बजाय।
Daybreak को OpenAI का कार्यक्रम के रूप में प्रस्तुत किया गया है जो नागरिक-उन्मुख प्रणालियों पर साइबर रक्षा कार्य के लिए है, और यूक्रेन उस कार्यक्रम के तहत विस्तारित एक्सेस का प्रत्यक्ष सरकारी प्राप्तकर्ता बन जाता है।
यह व्यवहार में क्या बदलता है: कोई भी संगठन जो critical-infrastructure रक्षा उपकरण बना रहा है, अब एक और डेटा पॉइंट देख सकता है जो दर्शाता है कि प्रमुख मॉडल विक्रेता नागरिक साइबर कार्य के लिए सीधी सरकारी एक्सेस कार्यक्रम शिप करने को तैयार हैं, न कि केवल शोध साझेदारियां या सलाहकार engagement। Adjacent tooling पर काम करने वाले builders के लिए — threat-intel pipelines, anomaly detection, automated triage, या incident-response copilots — यह पुष्टि करता है कि नागरिक-रक्षा खरीदार वास्तविक, सक्रिय है, और सीधे विक्रेता संबंध प्राप्त कर रहा है।
प्राथमिक स्रोत OpenAI का newsroom post है जिसकी तारीख 2026-09-23 है, जो 13:00 UTC पर प्रकाशित हुआ।
[14:32] Research digest: लंबे कार्यों पर agent 'taste' के लिए एक benchmark
TasteBench नाम का एक शोध प्रोजेक्ट AI एजेंटों के बारे में एक नया सवाल पूछ रहा है जो लंबे कामों पर काम करते हैं: वे जो निर्णय लेते हैं वे रास्ते में कितने अच्छे हैं, सिर्फ यह नहीं कि रन सफलता में समाप्त होता है या नहीं? यह पेपर, जो वर्तमान में HuggingFace के डेली फीड पर ट्रेंड कर रहा है, "taste" शब्द उधार लेता है ताकि एजेंट की उस क्षमता का वर्णन किया जा सके जो सही अगला कदम चुनने में सक्षम है — कौन सी परिकल्पना को आगे बढ़ाना है, किस कार्यान्वयन पर निर्माण करना है — एक ऐसे कार्य के भीतर जो घंटों के काम में फैला हुआ है। मौजूदा बेंचमार्क अंतिम उत्तर को ग्रेड करते हैं। यह उन शाखा निर्णयों पर ध्यान केंद्रित करता है। लेखकों का तर्क है कि सॉफ्टवेयर इंजीनियरिंग और शोध वर्कफ़्लो के लिए, वे मध्य-रन विकल्प ही वास्तव में परिणाम तय करते हैं। एक बेंचमार्क जो उन्हें अलग करता है, टीमों को उस आयाम पर एजेंटों की तुलना करने की अनुमति दे सकता है जिस पर उन्हें अभी अनुमान लगाना पड़ता है। देखने योग्य: क्या अन्य लैब्स इसे अपनाते हैं, या लंबे चलने वाले काम के लिए निर्णय-गुणवत्ता का अपना संस्करण बनाते हैं।
[15:29] शोध डाइजेस्ट: GameHorizon ने AI एजेंटों को 5,000 घंटे की AAA गेमप्ले से गुज़ारा
एक टीम ने GameHorizon जारी किया है, एक बेंचमार्क और डेटासेट जो AI एजेंटों को 21 AAA वीडियो गेम में 5,000 घंटे की रिकॉर्ड की गई प्ले के माध्यम से ले जाता है — जिसमें Valorant, Minecraft, Grand Theft Auto V, Palworld, और Elden Ring शामिल हैं। सौ अनुभवी मानव खिलाड़ियों ने रिकॉर्डिंग को संचालित किया, और हर क्रिया टाइमस्टैम्प की गई है और तीन-स्तरीय भाषा निर्देशों के पिरामिड के साथ लेबल की गई है: आदिम क्रियाएं, छोटी-क्षितिज संचालन, और लंबे लक्ष्य और रणनीतियां।
यह बिंदु परीक्षण करना है कि क्या मॉडल समय के क्षितिजों में योजना बना सकते हैं — अगला मुख्य प्रेस, अगला उप-उद्देश्य, और एक बहु-चरणीय रणनीति का पता लगा सकते हैं — बिना अस्थिर लाइव गेमप्ले पर निर्भर हुए। बेंचमार्क 5,000 ऑफ़लाइन बहु-विकल्प प्रश्नों और 20 चरणबद्ध ऑनलाइन कार्यों के साथ आता है जो 62 उप-कार्यों में विभाजित हैं, ताकि मूल्यांकक सटीक रूप से पहचान सकें कि एक मॉडल कहाँ विफल होता है।
टीम ने 47 मॉडलों का परीक्षण किया जो विज़न-लैंग्वेज, GUI, कोडिंग, और गेम-एजेंट परिवारों में फैले हुए हैं। GameHorizon पहला बड़े पैमाने का AAA-केंद्रित डेटासेट है जो एक ही जगह पर मानव-रिकॉर्ड किए गए कार्यों, घने निर्देशों, और पुनरुत्पादनीय ऑफ़लाइन मूल्यांकन को जोड़ता है।
[16:29] NVIDIA ने AI एजेंट सुरक्षा को इंजीनियरिंग डिसिप्लिन के रूप में प्रस्तुत किया
NVIDIA ने 21 सितंबर को एक ब्लॉग प्रकाशित किया जिसमें तर्क दिया गया कि AI एजेंटों को सुरक्षित करना एक शोध समस्या नहीं है, यह एक इंजीनियरिंग समस्या है। पोस्ट तर्क देती है कि रक्षाएं तभी गिनी जाती हैं जब वे परिभाषित आवश्यकताओं, लागू करने योग्य नियंत्रणों, एक नामित मालिक, और प्रलेखित साक्ष्य के साथ आती हैं कि नियंत्रण वास्तव में काम करते हैं।
ब्लॉग के अनुसार, एजेंट स्टैक तीन परतों में विभाजित है: मॉडल क्षमताएं प्रदान करते हैं, हार्नेसेस संदर्भ, उपकरणों और वर्कफ़्लो को व्यवस्थित करते हैं, और रनटाइम वातावरण बुनियादी ढांचा प्रदान करते हैं जहां क्रियाएं निष्पादित होती हैं। प्रत्येक परत के अपने स्वयं के सुरक्षा जिम्मेदारियां हैं, और सुरक्षा को तीनों पर तब तक बनाए रखना होगा जब तक कि डेटा और निर्देश सिस्टम के माध्यम से चलते हैं।
जिस ठोस उदाहरण पर पोस्ट चलती है: एक एजेंट से ग्राहक रिकॉर्ड अपडेट करने के लिए कहा जाता है, एक संलग्न दस्तावेज़ में दुर्भावनापूर्ण निर्देशों का सामना करता है, और बाहरी गंतव्य पर डेटा निर्यात करने का प्रयास करता है। एक नेटवर्क पॉलिसी आउटबाउंड ट्रांसफर को अवरुद्ध करती है। सुरक्षित लॉग प्रयास किए गए टूल कॉल, प्राधिकरण निर्णय, और यह कहाँ जा रहा था, कैप्चर करते हैं। एजेंट के पास रिकॉर्ड अपडेट करने की अनुमति है लेकिन इसे निर्यात करने की नहीं, और यह स्वयं को उस अतिरिक्त पहुंच का अधिकार नहीं दे सकता।
NVIDIA अपने स्वयं के ओपन-सोर्स OpenShell रनटाइम को एक लागू करने योग्य सीमा के रूप में इंगित करता है — एक सैंडबॉक्स्ड एक्जीक्यूशन एनवायरनमेंट जो एजेंट की रीज़निंग के बाहर फ़ाइल, नेटवर्क, और प्रोसेस सीमाओं को लागू करता है। Cisco का DefenseClaw शीर्ष पर गवर्नेंस जोड़ता है, और JFrog एजेंट स्किल्स को चलाने की अनुमति देने से पहले उन्हें स्कैन और सत्यापित करने के लिए एकीकरण करता है।
साक्ष्य के लिए, पोस्ट ऐसे परीक्षण की मांग करती है जो क्रेडेंशियल एस्केलेशन प्रयासों और अनधिकृत डेटा ट्रांसफर को ब्लॉक करता है, किसी भी सार्थक मॉडल या टूल परिवर्तन के बाद दोहराया जाता है, जिस पर एक नामित मालिक तैयारी को साइन ऑफ करता है। यह CrowdStrike के SafeMind को बार-बार हमला सिमुलेशन के लिए, Palo Alto Networks के Prisma AIRS को निरंतर रेड टीमिंग के लिए, Capital One के VulnHunter को AI-सहायता प्राप्त कोड समीक्षा के लिए, और ReversingLabs के Spectra Assure को सॉफ्टवेयर डिपेंडेंसी में मैलवेयर पकड़ने के लिए हाइलाइट करता है।
समापन संदेश खुले तौर पर साझा किया गया है: घटना के बाद के निष्कर्षों को दोहराने योग्य परीक्षणों में बदलना चाहिए, और व्यापक Open Secure AI Alliance सुरक्षा समुदाय में जो काम करता है उसे प्रसारित करने के लिए है।
[18:30] Thinking Machines Lab $65M के समझौते के तहत Crusoe Cloud पर ओपन-मॉडल इंफरेंस को स्थानांतरित करता है
Thinking Machines Lab ने Crusoe Cloud पर अपने ओपन मॉडल के लिए इंफरेंस चलाने के लिए $65 मिलियन का वार्षिक समझौता किया है, कंपनियों ने 23 सितंबर को कहा। यह व्यवस्था Crusoe Managed Inference के माध्यम से प्रोडक्शन ट्रैफिक को रूट करती है, एक सेवा परत जिसे कंपनी थ्रूपुट, कीमत-प्रदर्शन, और विश्वसनीयता के आसपास पोजिशन करती है, कच्ची ट्रेनिंग हॉर्सपावर के बजाय।
बिल्डर्स के लिए, व्यावहारिक सवाल यह है कि API पर क्या बदलता है। मॉडल वेट और व्यवहार अपरिवर्तित हैं — Thinking Machines Lab के ओपन मॉडल ओपन रहते हैं। जो बदलता है वह उनके नीचे की सर्विंग स्टैक है, जो वह टुकड़ा है जो विलंबता, अपटाइम, और प्रति-टोकन लागत निर्धारित करता है। Crusoe Managed Inference को ट्यूनड एनवायरनमेंट के रूप में बेच रहा है न कि बेयर-मेटल एक्सेस के रूप में, इसलिए लैब क्षमता योजना को सौंप देता है बदले में एक प्रबंधित समझौते के लिए।
यह सौदा यह संकेत भी देता है कि गंभीर ओपन-मॉडल सर्विंग कहां कंसोलिडेट हो रही है। Crusoe ने खुद को AI वर्कलोड के लिए बनी एक नियोक्लाउड के रूप में पिच किया है, और एक प्रमुख AI लैब से कई वर्षों की, आठ-अंकों की वार्षिक प्रतिबद्धता हासिल करना अगले खरीदार मूल्यांकन दौर को आकार देने वाला प्रकार का रेफरेंस ग्राहक है। घोषणा थ्रूपुट और विश्वसनीयता को हेडलाइन जीत के रूप में फ्रेम करती है, जिसमें कीमत-प्रदर्शन तीसरा पैर — यह जानबूझकर हाइपरस्केलर्स के अपने इंफरेंस टियर्स को मार्केट करने के तरीके की प्रतिध्वनि है।
एक बात पर नजर रखने योग्य है कि यह उन डेवलपर्स के लिए क्या मायने रखता है जो पहले से ही Thinking Machines Lab मॉडल कहीं और चला रहे हैं। यदि आप वर्तमान ग्राहक हैं, तो समान मॉडल सतह की उम्मीद करें लेकिन एंडपॉइंट्स के पीछे एक अलग प्रदाता, जो ट्रैफिक शिफ्ट होने पर फिर से बेंचमार्क करने योग्य है। बड़ा सवाल यह है कि क्या Crusoe इस एक एंकर ग्राहक को ओपन-मॉडल लैब्स के लिए अपना इंफरेंस इन-हाउस चलाने के बजाय आउटसोर्स करने के व्यापक पैटर्न में बदल सकता है।
[20:11] Jev टेक्स्ट के बजाय संभावनाएं लौटाता है, कीमत पर GPT-5 Nano को पीछे छोड़ देता है
TypeSafe AI ने इस महीने की शुरुआत में Jev का खुलासा किया, और यह अधिकांश लोगों की आदत के अलग प्रकार का मॉडल है। कंपनी इन्हें "System One" मॉडल कहती है; Simon Willison और Maggie Appleton दोनों "डिसीज़न मॉडल" शब्द को पसंद करते हैं। आकार असामान्य है: Jev अभी भी टेक्स्ट लेता है, लेकिन टेक्स्ट जनरेट करने के बजाय, यह फ्लोटिंग पॉइंट नंबर लौटाता है — संभावनाएं, कॉन्फिडेंस स्कोर, और श्रेणियों पर वितरण।
आप जो कुछ भी देख रहे हैं उसका वर्णन करने वाला एक "स्टेट" ऑब्जेक्ट बनाते हैं — एक लेख, एक ग्राहक रिकॉर्ड, अर्ध-संरचित डेटा का एक टुकड़ा — और फिर एक या अधिक टाइप किए गए प्रश्न संलग्न करते हैं। Jev प्रत्येक प्रश्न का एक संरचित संभावना के साथ उत्तर देता है एक वाक्य के बजाय। तीन प्रश्न आकार हैं। "Noul" प्रश्न हां/नहीं हैं — आप एक प्रस्ताव बताते हैं, और Jev 0 और 1 के बीच एक संख्या लौटाता है जो यह दर्शाती है कि कथन के सत्य होने पर उसे कितना विश्वास है; नाम, कंपनी के CEO ने Hacker News पर पुष्टि की, बर्नौली के लिए छोटा है, जैसा कि बर्नौली वितरण में। चॉइस प्रश्न लेबल किए गए विकल्पों की एक सूची लेते हैं और उन पर एक संभावना वितरण लौटाते हैं। स्कोर प्रश्न एक क्रमिक संख्यात्मक स्तरों पर रेटिंग मांगते हैं।
यह कीमत ही चीज़ है जो इसे बिल्डर्स के लिए दिलचस्प बनाती है। Jev केवल इनपुट टोकन के लिए शुल्क लेता है — आउटपुट मुफ्त है — और इनपुट रेट 0.042 डॉलर प्रति मिलियन टोकन है। यह OpenAI के GPT-5 Nano को प्रति मिलियन टोकन 0.05 डॉलर पर पीछे छोड़ देता है, जिसे TypeSafe उस बेंचमार्क के रूप में पेश करता है जिसे उसने अभी हराया है। क्योंकि आउटपुट अनिवार्य रूप से मुफ्त है, Jev उन पाइपलाइनों में स्वाभाविक रूप से फिट बैठता है जो प्रति दस्तावेज़ कई समानांतर निर्णय फैलाती हैं।
बिल्डर्स के लिए, इसका मतलब है कि Jev कहीं भी देखने लायक है जहाँ आपने पहले किसी सामान्य LLM पर एक क्लासिफिकेशन प्रॉम्प्ट लगाया था। यह राउटिंग, ट्रायज, या कंटेंट मॉडरेशन लेयर्स के लिए उपयुक्त है जहाँ आप एक पैराग्राफ के बजाय एक कॉन्फिडेंस नंबर चाहते हैं। जो कुछ भी एक असली जवाब चाहता है उसके लिए इसे नीचे एक नियमित टेक्स्ट मॉडल के साथ जोड़ें।
[22:07] एक सेल्फ-होस्टेड ब्राउज़र जो AI एजेंट्स को Captchas छोड़ने देता है
invisible_playwright_mcp के एक नए रिलीज़ से AI एजेंट्स को सामान्य बॉट डिफेंस को ट्रिगर किए बिना वेब ब्राउज़ करने का एक सेल्फ-होस्टेड तरीका मिलता है। यह प्रोजेक्ट एक Python सर्वर है जो Model Context Protocol बोलता है, वही स्टैंडर्ड जिसका मॉडल बाहरी टूल्स कॉल करने के लिए उपयोग करते हैं, और यह Playwright को wrap करता है, एक लोकप्रिय ब्राउज़र-ऑटोमेशन लाइब्रेरी, जिसे एक undetected, anti-detect stealth बिल्ड of Firefox के चारों ओर wrap किया गया है। परिणाम एक ब्राउज़र सेशन है जो एक नियमित यूज़र की नकल करता है हेडलेस स्क्रिप्ट के बजाय, जो इसे fingerprint चेक्स पास करने और captchas छोड़ने में मदद करता है। वर्शन 0.70.0 23 सितंबर को शिप हुआ, और GitHub रिपॉजिटरी अब 31,600 से अधिक स्टार्स दिखाती है।
बिल्डर्स के लिए, अपील सीधी है। ब्राउज़र ऑटोमेशन जो पहले एक पेड captcha-सॉल्विंग सर्विस या नाजुक वर्कअराउंड्स की मांग करता था अब एक टूल के अंदर संभाला जा सकता है जिसे एक एजेंट पहले से कॉल कर सकता है। कुछ भी जिसे एक असली सेशन चाहिए — डैशबोर्ड में लॉग इन करना, बेसिक बॉट वॉल्स के पीछे साइट को scrape करना, मल्टी-स्टेप फॉर्म भरना, या एक "कंप्यूटर यूज़" लूप चलाना — आपके अपने एनवायरनमेंट में इस सर्वर के ज़रिए चल सकता है। यह क्रेडेंशियल्स को लोकल रखता है और लूप से तीसरे पक्ष की डिपेंडेंसी हटाता है।
प्रोजेक्ट ओपन-सोर्स और सेल्फ-होस्टेड है, इसलिए सामान्य चेतावनी लागू होती है: stealth ब्राउज़र्स arms-race टूल्स हैं, और एक प्रोजेक्ट से anti-detect Firefox कल फिंगरप्रिंट हो सकता है। अपस्ट्रीम Firefox बदलावों पर नज़र रखें, वर्शन pin करें, और उपयोग को साइट की शर्तों और लागू कानून के भीतर रखें। अगर आपका एजेंट वर्तमान में captcha वॉल के पीछे फँसा है, तो आज़माने के लिए यह परिपक्व ओपन विकल्पों में से एक है।
[23:38] OpenAI ने AI प्रतिक्रियाओं का परीक्षण करने के लिए MentalHealthBench रिलीज़ किया
OpenAI ने 23 सितंबर को MentalHealthBench प्रकाशित किया। यह एक बेंचमार्क है — एक मानकीकृत मूल्यांकन सेट — जो मनो-स्वास्थ्य बातचीत में AI सिस्टम कैसे प्रतिक्रिया करते हैं, इसको मापने के लिए, दो आयामों पर एक साथ स्कोर किया गया: मददगार होना और सुरक्षित होना।
OpenAI के अनुसार, जो इसे अलग बनाता है, वह यह है कि बेंचमार्क विशेषज्ञ-सूचित है। मनो-स्वास्थ्य विशेषज्ञों ने उस यथार्थवादी बातचीत परिदृश्यों को आकार देने में भाग लिया जिस पर बेंचमार्क आधारित है। यह विवरण मायने रखता है क्योंकि जेनेरिक सुरक्षा परीक्षण अक्सर एक असली बातचीत की बनावट को चूक जाते हैं — एक मॉडल किसी परेशान व्यक्ति को कैसे संभालता है, घबराहट के पल के बारे में बात करता है, या जानता है कि कब किसी उपयोगकर्ता को पेशेवर मदद की ओर इंगित करना है।
निहित दर्शक वे डेवलपर्स और शोधकर्ता हैं जो संवेदनशील संदर्भों के लिए कन्वर्सेशनल AI बना रहे हैं — थेरेपी-सीमित उत्पाद, सपोर्ट बॉट्स, वेलनेस ऐप्स, और उनके अंतर्निहित मॉडल। एक पब्लिक बेंचमार्क उन टीमों को एक साझा संदर्भ बिंदु देता है हाथ से चुने गए डेमो पर निर्भर रहने के बजाय।
फ्रेमिंग एक ड्यूल स्कोर पर भी जोर देती है। एक मॉडल मददगार हो सकता है लेकिन असुरक्षित — गर्मजोशी से जुड़ते हुए यूजर को कहीं हानिकारक की ओर ले जाना — या सुरक्षित लेकिन बेकार, जब यूजर को वास्तव में गाइडेंस की जरूरत हो तो मना या टालना। MentalHealthBench दोनों को ट्रैक करता है, जिसका मतलब है कि कोई भी एकल हेडलाइन नंबर तस्वीर को कम आंक देगा। इस स्पेस में शिपिंग करने वाली टीम्स के पास अब एक कॉमन यार्डस्टिक है, और उन्हें इसके दोनों सिरों को पढ़ना होगा।
आगे देखें: क्या थर्ड-पार्टी लैब्स बेंचमार्क को उठाती हैं, और क्या OpenAI अपने खुद के मॉडल्स के साथ बेसलाइन स्कोर रिलीज करता है। पब्लिश्ड नंबर्स के बिना बेंचमार्क वास्तव में सिर्फ एक रूब्रिक है।