
Gemini 3.7 Flash और Codex Bedrock
Gemini 3.7 Flash का हाइब्रिड रीज़निंग डीप डाइव, OpenAI Codex rust-v0.148.0 Bedrock रूटिंग, Z.ai GLM 5.3 1M-टोकन रीज़निंग, और Qwen 3.8 27B का स्थानीय... Show notes: https://tobyonfitnesstech.com/hi/podcasts/episode-104/
🎧 Listen to EpisodeEpisode 104 — 19 अगस्त, 2026
[00:00] एपिसोड हुक
OpenAI Codex rust-v0.148.0 Bedrock एकीकरण और सत्र विभाजन लाता है, जबकि Google's Gemini 3.7 Flash Flash विलंबता और लागत पर हाइब्रिड तर्क प्रस्तुत करता है। Z.ai 1M-टोकन संदर्भ के साथ GLM 5.3 शिप करता है, Qwen 3.8 27B स्थानीय परिनियोजन के लिए आता है, और एक त्रिभाषी एजेंट रोडमैप एपिसोड की शुरुआत को पूरा करता है, इसके बाद एंटरप्राइज़ वर्कफ़्लो, बाधा उत्पादकताओं को डिकोड करने और विश्व मॉडल के बारे में गहराई से जानकारी दी जाती है। प्रत्येक कहानी को वही व्यवहार मिलता है — क्या शिप हुआ, इसके तहत कौन सा तंत्र है, और यह काम करने वाले बिल्डर्स के लिए क्या बदलता है।
[02:00] एजेंट स्टैक रिलीज़ रीडआउट: OpenAI Codex rust-v0.148.0
OpenAI ने 18 अगस्त को Codex rust-v0.148.0 शिप किया, और मुख्य सुविधा के रूप में Amazon Bedrock को एक अंतर्निहित प्रदाता के रूप में जोड़ा है। अब आप अपने AWS प्रोफ़ाइल और क्षेत्र के माध्यम से AWS-होस्टेड मॉडल के लिए Codex को इंगित कर सकते हैं, जिसमें GPT-5.6 रूटिंग तुरंत उपलब्ध है। जो टीमें पहले से AWS पर मानकीकृत हैं, उनके लिए यह एक पुरानी वजह को हटा देता है जो Codex को उनके बाकी स्टैक से अलग रखती थी।
रिलीज़ का वर्कफ़्लो पक्ष उतना ही व्यावहारिक है। एक नया codex exec fork कमांड मौजूदा सत्र को एक स्वतंत्र रूप से चलाने योग्य सत्र में विभाजित करता है, और TUI रिज्यूम पिकर अब पिछले सत्रों को संग्रहीत या पुनर्स्थापित करने की अनुमति देता है। /export के साथ मिलकर, जो पूर्ण TUI बातचीत को आपके क्लिपबोर्ड या किसी नई फ़ाइल में Markdown में डंप करता है, आप अंततः एक Codex सत्र को वास्तविक आर्टिफैक्ट की तरह व्यवहार कर सकते हैं: इसे विभाजित करें, सहेजें, साझा करें, और बाद में इसे वापस उठाएं।
लागत दृश्यता भी नई है। /status, स्थिति पंक्तियाँ, और टर्मिनल शीर्षक बार अब योग्य कार्यस्थानों के लिए अनुमानित थ्रेड क्रेडिट या लागत दिखा सकते हैं। जो कोई भी Codex को मीटर्ड बैकएंड के खिलाफ चला रहा है, उसके लिए यह एक सार्थक बदलाव है — आप बिना टर्मिनल छोड़े बिल को बढ़ते हुए देख सकते हैं।
हुक भी अधिक शक्तिशाली हो गए हैं। बाहरी स्क्रिप्ट अब अतुल्यकालिक रूप से चल सकती हैं और सीधे MCP टूल को लागू कर सकती हैं, इसलिए एक हुक को अपना काम करते समय मुख्य टर्न को अवरुद्ध नहीं करना पड़ता। यह लंबे-चलने वाले स्वचालन पैटर्न को अनलॉक करता है, जैसे एक हुक जो बिना एजेंट को फ्रीज किए बिल्ड या डेटाबेस क्वेरी शुरू करता है।
इसके तहत, रिलीज़ कई खुरदरे किनारों को चुपचाप टाइट करती है। मॉडल स्विच अब पीछे दिए गए निर्देश नहीं छोड़ते हैं या सक्रिय टर्न को बीच में नहीं बदलते हैं। पुनर्स्थापित सत्र अपने निरंतर कार्य निर्देशिका और अनुमोदन नीति को पुनर्स्थापित करते हैं। टर्न अस्थायी प्रदाता आउटेज के माध्यम से पुनः कनेक्ट होते हैं, और MCP सर्वर OAuth पुनः प्रमाणीकरण के बाद स्वचालित रूप से पुनः प्राप्त होते हैं, जिसमें Codex को पुनः प्रारंभ करने की आवश्यकता नहीं है। TUI अब बफ़र्ड टर्मिनल इनपुट से प्रॉम्प्ट को सक्रिय नहीं करता है, कंपोज़र और ट्रांसक्रिप्ट रेंडरिंग CRLF पेस्ट, लपेटी हुई व्हाट्सएप, और लंबे URL को सही ढंग से संभालती है, और सैंडबॉक्स प्रतिबंध अब Linux और Windows दोनों पर अस्वीकृत या अपठनीय पथ के लिए बंद हो जाते हैं।
[02:58] गहन अंतर्दृष्टि: Gemini 3.7 Flash और हाइब्रिड तर्क का आगमन
Google का Gemini 3.7 Flash production AI infrastructure में hybrid reasoning को पेश करके एक महत्वपूर्ण architectural shift का प्रतिनिधित्व करता है। डेवलपर्स को तेज़ standard language model या महंगे, high-latency reasoning model में से चुनने के बजाय, Gemini 3.7 Flash दोनों regimes को एक single model architecture में unify करता है। डेवलपर्स इस behavior को सीधे एक configurable thinking budget parameter के through control करते हैं, जो zero से 64,000 thinking tokens तक हो सकता है - zero standard sub-second inference के लिए और 64,000 deep, multi-step problem solving के लिए।
जो चीज़ agent builders के लिए इसे विशेष रूप से impactful बनाती है वह है reasoning depth, native multimodality, और high throughput का combination। Gemini 3.7 Flash अपने 1M-token context window के भीतर text, code, high-resolution imagery, video, और audio पर full multimodal capabilities preserve करता है। SWE-bench Verified जैसे benchmark evaluations पर, Gemini 3.7 Flash frontier-level coding और repository-level refactoring capabilities deliver करता है जो much larger models से rival करती हैं, जबकि API cost और latency Flash tier पर रखता है।
जब competition के साथ तुलना की जाती है, तो trade-offs स्पष्ट हो जाते हैं। Claude 3.7 Sonnet की तुलना में, जो also hybrid reasoning adopt करता है, Gemini 3.7 Flash ultra-fast agent execution loops को एक fraction of cost पर target करता है, जो इसे continuous iterative workflows और multi-agent coordination के लिए ideal बनाता है। OpenAI के o3-mini या o1 की तुलना में, जो fixed reasoning tiers use करते हैं और native audio/video reasoning lack करते हैं, Gemini 3.7 Flash thinking tokens पर continuous granular control alongside a 1M-token multimodal context provide करता है। और GLM 5.3 या quantized local models like Qwen 3.8 27B जैसे text-only long-context models के against, Gemini 3.7 Flash production reliability और immediate sub-second time-to-first-token provide करता है।
Agent loops build करने वाले developers के लिए recommended pattern है dynamic thinking allocation: routine classification, tool dispatch, और lint checks को thinking tokens zero पर set करके run करें, और complex codebase exploration, architectural planning, या deep bug localization execute करते समय thinking tokens को 2,048 और 16,384 tokens के बीच dynamically scale करें।
[04:25] Z.ai ने 1M-token context के साथ GLM 5.3 reasoning model ship किया
Z.ai ने OpenRouter पर GLM 5.3 put किया है, और headline number है context window: input side पर एक million tokens, outputs पर 4,096-token ceiling के साथ। Model को एक large-scale reasoning model के रूप में describe किया गया है जो complex software engineering और long-horizon agent tasks के लिए built है — सादे English में, यह उन work के लिए tuned है जो single-turn answers की जगह codebase में कई steps तक फैला हो।
यह fill करने के लिए एक meaningful slot है। Router पर आज अधिकांश reasoning models smaller context windows offer करते हैं, इसलिए कोई भी workflow जिसे एक large repository, tool calls की long thread, या extended plan ingest करने की जरूरत है अब route करने के लिए another candidate है। Text in, text out listed唯一的 modality है, इसलिए multimodal work route करने वाले builders को इस entry से help नहीं मिलेगी।
Practical move यह है कि GLM 5.3 को default के रूप में treat करने से पहले एक small set of real coding-agent evaluations के through से गुज़ारें। Long context अकेला एक moat नहीं है — जो मायने रखता है वह यह है कि model उस entire window में coherent रहता है और actually agent work के many turns में अच्छी तरह plan करता है। Teams से early benchmark shots के लिए watch करें जो agent evaluations run कर रहे हैं, और pricing या rate limits के किसी भी sign के लिए जो scale पर routing decision बदल देगी।
[05:45] Qwen 3.8 27B excellent है, लेकिन यह default से over-think करता है
Alibaba की Qwen research lab ने Friday को Qwen 3.8 27B release किया — एक Apache 2-licensed, vision-capable 27-billion-parameter language model जो एक reasonably specced laptop पर run करने के लिए достаточно छोटा है। Qwen के self-reported benchmarks claim करते हैं कि यह previous Qwen 3.6 27B और closed-weight Qwen 3.7-Plus दोनों पर improvement करता है, जो May तक किसी भी size में Qwen के सबसे strong models में से एक था।
Simon Willison ने इसे 128GB M5 Max MacBook Pro और NVIDIA DGX Spark पर आज़माया, LM Studio के 17GB Q4_K_M quantized build को चलाया, और साथ ही Spark पर सीधे llama-server को भी आज़माया। एक प्रमुख विशेषता: Qwen reasoning_effort को xhigh पर डिफ़ॉल्ट के साथ भेजता है — दस्तावेज़ xhigh को "जटिल कार्यों के लिए जो गहन विश्लेषण की माँग करते हैं" के रूप में वर्णित करता है — और LM Studio GGUF उस डिफ़ॉल्ट को बनाए रखता है। कंज्यूमर हार्डवेयर पर, परिणाम यह है कि मॉडल साधारण प्रॉम्प्ट के बारे में सोचते हुए हर उपलब्ध टोकन को जला देता है। LM Studio का डिफ़ॉल्ट 8,192-टोकन संदर्भ विंडो समस्या को स्पष्ट करता है; 262,144-टोकन संदर्भ के साथ मॉडल लोड करने से मदद मिली, लेकिन सही समाधान reasoning_effort को medium या low पर करना है।
27B साइज़, Apache 2 लाइसेंस, और 262K संदर्भ इसे स्थानीय-प्रथम बिल्डर्स के लिए एक आकर्षक लक्ष्य बनाते हैं जो विज़न इनपुट और अनुमतिकारी लाइसेंस चाहते हैं। एक नज़र में: स्वतंत्र बेंचमार्क — Willison ने संकेत दिया है कि Qwen के स्व-रिपोर्ट किए गए आंकड़े आँखें खोलने वाले हैं लेकिन अभी तक तृतीय पक्षों द्वारा परीक्षित नहीं किए गए हैं।
[07:07] एजेंटिक AI सीखने के लिए एक त्रिभाषी रोडमैप, जिसमें 240+ चुनिंदा संसाधन शामिल हैं
एजेंटिक AI सीखने के लिए एक त्रिभाषी रोडमैप इस सप्ताह GitHub पर एक ताज़ा अपडेट के साथ आया। WenyuChiou द्वारा awesome-agentic-ai-zh नामक यह रेपो LLM बेसिक्स से लेकर मल्टी-एजेंट सिस्टम तक एक संरचित पथ प्रदान करता है, जिसे तीन भाषाओं में लिखा गया है: पारंपरिक चीनी, अंग्रेज़ी, और सरलीकृत चीनी। प्रोजेक्ट का चीनी शीर्षक है 中文 AI agent 學習地圖।
रोडमैप 240+ चुनिंदा संसाधनों और व्यावहारिक उदाहरणों के साथ आता है — ब्लॉग पोस्ट की एक अव्यवस्थित सूची की तुलना में एक आत्म-निर्देशित पाठ्यक्रम के रूप में कार्य करने के लिए पर्याप्त। GitHub पर रेपो के 5754 स्टार्स हैं, और मेंटेनर ने 14 अगस्त 2026 को रिलीज़ के बाद 18 अगस्त 2026 को अपडेट पुश किया।
प्रोजेक्ट को अलग बनाने वाली बात इसका त्रिभाषी लेआउट है। अधिकांश एजेंटिक AI सीखने की सामग्री केवल अंग्रेज़ी में उपलब्ध है, जो उन चीनी-बोलने वाले डेवलपर्स के लिए एक वास्तविक प्रवेश द्वार की कमी छोड़ता है जो इस क्षेत्र का अनुसरण करना चाहते हैं। समान सामग्री को 繁中, अंग्रेज़ी, और 简中 में साथ-साथ रखकर, रेपो एक शिक्षार्थी को शुरू करने की भाषा चुनने और जब शब्दावली भ्रमित करने वाली हो तब स्विच करने देता है — एक छोटी चीज़ जो तब मायने रखती है जब आप tool calling या एजेंट loop जैसी शब्दावली में भागते हैं।
बिल्डर्स के लिए व्यावहारिक पठन सीधा है। यदि आप एजेंटिक AI के लिए नए हैं और यादृच्छिक ट्यूटोरियल के बजाय एक क्रमबद्ध पथ चाहते हैं, तो रोडमैप एक मुफ़्त, व्यवस्थित शुरुआती बिंदु प्रदान करता है। अगला ध्यान देने योग्य यह है कि मेंटेनर संसाधन सूची को अद्यतन रखता है जैसे-जैसे एजेंटिक स्टैक आगे बढ़ता है — अगस्त का अपडेट हाँ का संकेत देता है।
[08:34] OpenAI ने राष्ट्रीय सुरक्षा में AI पर लोकतांत्रिक निरीक्षण लाने की पहल शुरू की
OpenAI ने 18 अगस्त को एक नई पहल की घोषणा की जिसका उद्देश्य राष्ट्रीय सुरक्षा में AI पर लोकतांत्रिक निरीक्षण को मज़बूत करना है। कार्यक्रम तीन स्तंभों पर आधारित है: सरकारी संस्थानों को रक्षा और खुफिया संदर्भों में AI तैनाती की जांच के लिए उपकरण, प्रशिक्षण और विशेषज्ञता प्रदान करना। OpenAI ने अपनी समाचार साइट पर घोषणा प्रकाशित की, इसे राज्य सुरक्षा कार्य में AI के एकीकरण और उन तैनातियों को चुनी गई और स्वतंत्र निकायों से कितना निरीक्षण प्राप्त होता है, इस बारे में बढ़ते प्रश्नों के जवाब के रूप में प्रस्तुत किया।
घोषणा विशिष्टताओं में हल्की है। OpenAI ने पेज पर नामित भागीदार एजेंसियों, ठोस प्रशिक्षण समूहों, या मापनीय प्रतिबद्धताओं की सूची नहीं दी, इसलिए बिल्डर्स पर अल्पकालिक प्रभाव ज्यादातर अप्रत्यक्ष है। सरकारी, रक्षा, या खुफिया खरीदारों से संपर्क रखने वाले उत्पाद बनाने वाले किसी के लिए, संकेत यह है कि OpenAI सक्रिय रूप से भाषा और अपेक्षाओं को आकार दे रहा है कि AI विक्रेता निरीक्षण संस्थानों के साथ कैसे संलग्न होने चाहिए, जो समय के साथ प्रक्रिया बातचीत और बेसलाइन ट्रस्ट आवश्यकताओं को बदल सकता है। एक चीज़ जिस पर नज़र रखनी चाहिए: क्या अनुवर्ती घोषणाएं विशिष्ट संस्थानों, प्रशिक्षण समूहों, या निरीक्षण पायलट का नाम बताती हैं जो पहल को तेज़ किनारे देती हैं।
[09:40] NVIDIA, ChatGPT Work को वैश्विक वर्कफ्लो लेयर में बदल देती है
OpenAI ने 18 अगस्त को "How NVIDIA scales expertise with ChatGPT Work" शीर्षक से एक कस्टमर स्टोरी प्रकाशित की, जिसे एक प्रमुख चिप निर्माता के दैनिक उत्पाद उपयोग के रूप में प्रस्तुत किया गया।
OpenAI News पेज पर दिया गया सारांश तीन परिणामों का वर्णन करता है: NVIDIA टीमें मैनुअल कार्यों को कम करने, तेज गति से चलने वाले संकेतों को जोड़ने और सफल वर्कफ्लो को वैश्विक स्तर पर स्केल करने के लिए ChatGPT Work का उपयोग करती हैं।
यह रूपरेखा ChatGPT Work को साझा अवसंरचना के रूप में प्रस्तुत करती है — एक ऐसी जगह जहां एक टीम का कार्य पैटर्न पैकेज किया जा सकता है और पूरे संगठन में पुनः तैनात किया जा सकता है, न कि किसी एक सत्र में फंसा हुआ।
केस स्टडी यह नहीं बताती कि किन NVIDIA डिवीजनों ने सबसे पहले इसे अपनाया या बचाए गए घंटों का आंकड़ा नहीं देती, इसलिए सबसे उपयोगी समझ संरचनात्मक है: एक कंपनी जिसका व्यवसाय AI एक्सेलेरेटर बनाना है, वह आंतरिक समन्वय परत के रूप में OpenAI के चैट उत्पाद का उपयोग कर रही है।
एंटरप्राइज मार्केट पर नजर रखने वाले बिल्डर्स के लिए, व्यावहारिक संकेत यह है कि बड़े ग्राहक बातचीत-आधारित AI टूल्स को वर्कफ्लो अवसंरचना के रूप में देखना शुरू कर रहे हैं, न कि सिर्फ जवाब देने वाली मशीनों के रूप में।
एक बात पर नजर रखनी होगी: क्या भविष्य की OpenAI केस स्टडीज ठोस आंकड़े या विशिष्ट वर्कफ्लो टेम्पलेट सामने लाती हैं जिनकी अन्य टीमें नकल कर सकें, या "टीमें इसका उपयोग विशेषज्ञता को स्केल करने के लिए करती हैं" के सामान्य स्तर पर रहती हैं।
[10:53] रिसर्च डाइजेस्ट: AI की रीज़निंग बॉटलनेक डिकोडिंग है, मॉडल साइज़ नहीं
Linguistics Olympiad समस्याएं प्रतियोगियों से मांगती हैं कि वे बिना किसी नियम पुस्तिका के, सिर्फ नमूना वाक्यों से एक अपरिचित भाषा को समझें। IOL-AI Challenge ने AI टीमों को कठोर सीमाओं के तहत (एक T4 GPU और प्रति समस्या तीस मिनट) वही पहेलियां दीं। आयोजकों द्वारा प्रस्तुत संसाधन-सीमित सिस्टम मानव प्रतियोगियों के निचले पांच प्रतिशत में रहे, जबकि एक फ्रंटियर मॉडल, Claude Opus 4.8, ने स्वर्ण पदक प्रदर्शन के बराबर प्रदर्शन किया। मुख्य खोज यह थी कि आकार ने विजेता तय नहीं किया: छोटे ट्यून किए गए सबमिशन ने अपने आकार से कई गुना बड़े मॉडलों को हराया, और लाभ स्मार्ट डिकोडिंग से आए — मॉडल अपने आउटपुट को कैसे संभालता है — जबकि कच्ची क्षमता से नहीं। ऑटोमैटिक स्कोरिंग ने जूरी की रैंकिंग को ट्रैक किया लेकिन कमजोर सिस्टम को बढ़ा-चढ़ाकर दिखाया। रीज़निंग सिस्टम बनाने वाले किसी भी व्यक्ति के लिए निष्कर्ष: भाषाई पहेलियां एक स्वच्छ परीक्षण हैं कि कोई मॉडल चीजों को वास्तव में समझ सकता है या नहीं, और वर्तमान में अवरोध आउटपुट हैंडलिंग में है, मॉडल साइज़ में नहीं।
[11:50] OpenAI ने साइबर क्षमताओं में वृद्धि के साथ मॉडल पेसिंग के दृष्टिकोण की रूपरेखा दी है
OpenAI ने 18 अगस्त को "पेसिंग मॉडल डेवलपमेंट इन एन एरा ऑफ साइबर-क्रिटिकल कैपेबिलिटीज़" शीर्षक से एक ब्लॉग पोस्ट किया। इस लेख में कंपनी की उस दृष्टिकोण को दर्शाया गया है जिसके तहत वह फ्रंटियर मॉडल रिलीज़ करती है, उस समय जब AI सिस्टम अधिक सार्थक साइबर क्षमताएं प्राप्त कर रहे हैं। प्रकाशित सारांश के अनुसार, OpenAI फ्रंटियर मॉडल डेवलपमेंट के चारों ओर मॉनिटरिंग, अलाइनमेंट और सुरक्षा प्रथाओं को मजबूत कर रही है, और उन सुरक्षा उपायों को उस तंत्र के रूप में स्थापित कर रही है जो नए मॉडल की शिपिंग की गति को निर्धारित करता है।
इस पोस्ट में कोई विशिष्ट उत्पाद, मॉडल या टूल की घोषणा नहीं है। यह एक पॉलिसी और पोस्चर पीस की तरह पढ़ता है: यह बताता है कि OpenAI मॉडल क्षमता को आगे बढ़ाने और विशेष रूप से साइबर सुरक्षा-प्रासंगिक डोमेन में नियंत्रणों के बीच संबंध के बारे में कैसे सोच रही है, जिसे कंपनी रिलीज़ से पहले और दौरान लागू करती है। उपलब्ध सारांश में सुरक्षा उपायों को सामान्य शब्दों में वर्णित किया गया है, न कि नए मूल्यांकन सुइट्स, रेड-टीम प्रोग्राम या डिप्लॉयमेंट गेट्स के नाम के साथ।
बिल्डर्स और ऑपरेटर्स के लिए, व्यावहारिक निष्कर्ष सीमित है लेकिन ध्यान देने योग्य है। फ्रंटियर मॉडल रिलीज़ का समय अब शुद्ध क्षमता बेंचमार्क के बजाय साइबर जोखिम विचारों द्वारा अधिक आकार ले रहा है। भविष्य के OpenAI मॉडल ड्रॉप्स के आसपास प्लानिंग करने वाले कोई भी व्यक्ति, चाहे वह सुरक्षा टूलिंग के लिए हो, संवेदनशील सिस्टम को छूने वाले एजेंट वर्कफ्लो के लिए हो, या सुरक्षा-महत्वपूर्ण अनुप्रयोगों के लिए हो, उसे उम्मीद करनी चाहिए कि साइबर मूल्यांकन दस्तावेज़ीकरण भविष्य के लॉन्च पोस्ट्स का एक अधिक दिखने वाला हिस्सा बनेगा। देखें कि आगामी मॉडल घोषणाएं सामान्य क्षमता परिणामों के साथ-साथ स्पष्ट साइबर असेसमेंट सारांश के साथ आती हैं या नहीं।
[13:13] रिसर्च डाइजेस्ट: AI वर्ल्ड मॉडल्स बिना रिट्रेनिंग के गोल्स बदल सकते हैं
अधिकांश रीइन्फोर्समेंट लर्निंग एजेंट जो "वर्ल्ड मॉडल" सीखते हैं — अपने वातावरण के व्यवहार का एक आंतरिक सिमुलेशन — एक उद्देश्य से बंध जाते हैं। एक एजेंट को लैबिरिंथ में नेविगेट करना और नीली कुंजी खोजना सिखाएं, और आमतौर पर यह बिना अतिरिक्त वातावरण इंटरैक्शन के लाल कुंजी खोजने के लिए दोबारा निर्देशित नहीं किया जा सकता, क्योंकि रिवॉर्ड लॉजिक एक ही न्यूरल नेटवर्क के भीतर परसेप्शन के साथ उलझा हुआ है। शोधकर्ताओं की एक टीम एक छोटा बदलाव प्रस्तावित करती है जिसका बड़ा व्यावहारिक प्रभाव है: वर्ल्ड मॉडल को इस प्रकार विभाजित करें कि ऑब्जर्वेशन रिकंस्ट्रक्शन और रिवॉर्ड प्रेडिक्शन अब एक ही प्रतिनिधित्व साझा न करें। रिवॉर्ड कुछ मानव-पठनीय प्रतीकात्मक स्टेट वेरिएबल्स पर एक फंक्शन बन जाता है, जबकि नेटवर्क का बाकी हिस्सा यह भविष्यवाणी करना जारी रखता है कि दुनिया आगे क्या करेगी। यह अलगाव ही जीरो-शॉट टास्क ट्रांसफर को संभव बनाता है — एक ही सीखा सिमुलेशन को केवल रिवॉर्ड नियम को फिर से लिखकर नए लक्ष्य पर दोबारा निर्देशित किया जा सकता है। व्यवहार में इसका मतलब है कि सिमुलेशन में प्रशिक्षित एक रोबोट को किसी अलग वस्तु उठाने के लिए पुनर्निर्देशित किया जा सकता है, या किसी गेम एजेंट को नए स्कोरिंग उद्देश्य पर स्विच किया जा सकता है, बिना ताजा डेटा-कलेक्शन रन के।
[14:21] Asana ने पांच साल के माइग्रेशन को Codex के साथ दो हफ्ते में बदल दिया
वर्क मैनेजमेंट कंपनी Asana ने OpenAI के Codex कोडिंग एजेंट का उपयोग करके लगभग दो हफ्तों में एक पुराना टेस्टिंग सिस्टम बदल दिया — काम जिसे उनकी इंजीनियरिंग टीम ने अनुमान लगाया था कि इसमें पांच साल से अधिक समय लगेगा। कुल लागत लगभग बारह हजार डॉलर आया।
यह अंतर ही हेडलाइन है। दो हफ्ते पांच साल के बजाय, बारह हजार डॉलर एक बहु-वर्षीय हेडकाउंट प्रोजेक्ट के बजाय। OpenAI ने 18 अगस्त को यह केस प्रकाशित किया ताकि दिखाया जा सके कि फ्रंटियर कोडिंग एजेंट लेगसी माइग्रेशन को कंप्रेस करना शुरू कर सकते हैं जो चुपचाप इंजीनियरिंग बैकलॉग पर बूढ़े हो रहे थे क्योंकि कोई उन्हें फंड करने को तैयार नहीं था।
कहानी में तकनीकी विशिष्टताओं की कमी है। OpenAI ने प्रकाशित नहीं किया कि Asana ने कौन सा Codex कॉन्फ़िगरेशन उपयोग किया, टेस्ट सुइट का आकार कितना था, या दो-हफ्ते के रन में कितना मानव समीक्षा शामिल थी। दो हफ्ते और पांच साल के आंकड़े Asana के अपने अनुमान से आए हैं।
यह केस जो स्थापित करता है वह यह है कि एक माइग्रेशन जिसे कभी एक छोटी टीम के लिए वर्षों की आवश्यकता थी, वह वर्तमान-जेनरेशन कोडिंग एजेंट के साथ दो इंजीनियर्स, दो हफ्ते और एक छोटे बजट में हो सकता है, कम से कम एक कंपनी के एक वर्कलोड के लिए। यदि आपके पास रोडमैप पर एक डेप्रिकेटेड सबसिस्टम है, तो यह अब एक यथार्थवादी लाइन आइटम है, कल्पना नहीं।
अगला डेटा पॉइंट जो तस्वीर को स्पष्ट करेगा वह Asana का अपना इंजीनियरिंग राइट-अप है जिसमें टेस्ट-सूट स्कोप और ह्यूमन रिव्यू रेशियो शामिल है, क्योंकि OpenAI के सारांश में विस्तृत चेंजलॉग शामिल नहीं है।
[15:50] OpenAI AI साइबर खतरों पर 'द डिफेंडर विंडो' को फ्रेम करता है
17 अगस्त को, OpenAI ने 'The Defender's Window' नामक एक परिप्रेक्ष्य लेख प्रकाशित किया जो AI को साइबरसुरक्षा के दोनों पक्षों को नया आकार देने के रूप में प्रस्तुत करता है। पोस्ट में कहा गया है कि OpenAI अपनी अपनी रक्षा को मजबूत कर रहा है और सुरक्षा टीमों को आगे क्या करना है, इस पर मार्गदर्शन प्रदान करता है। उस व्यापक फ्रेमिंग से परे, स्रोत सामग्री यह निर्दिष्ट नहीं करती कि किन उत्पादों, मॉडलों, या डिटेक्शन सिस्टम में बदलाव हुआ, कौन से नियंत्रण जोड़े गए, या कंपनी कौन से ठोस शमन उपायों की सिफारिश कर रही है। यह एक चेंजलॉग की तुलना में एक राय और रोडमैप टुकड़ा पढ़ता है, इसलिए अभी व्यावहारिक निष्कर्ष ज्यादातर दिशात्मक है: OpenAI चाहता है कि डिफेंडर्स पढ़ते रहें और खतरे के मॉडल को बदलते हुए मानें, क्योंकि AI टूल्स दोनों पक्षों पर कुछ हमलों की लागत कम कर सकते हैं। विशिष्ट OpenAI उत्पाद परिवर्तनों, नामित डिटेक्शन नियमों, या नए शमन उपायों की तलाश में सुरक्षा टीमों को पूरी सूची के लिए पोस्ट को सीधे पढ़ना होगा, क्योंकि सारांश सामग्री में उन्हें गिनाया नहीं गया है। अगले हफ्तों में देखने योग्य दिलचस्प बात यह है कि क्या यह फ्रेमिंग शिप किए गए फीचर्स या मापनीय डिटेक्शन में बदलती है, या एक पोस्चर स्टेटमेंट बनी रहती है।
[16:56] ChatGPT Ads 31 यूरोपीय बाजारों तक पहुंचा
OpenAI ने ChatGPT Ads को 31 यूरोपीय बाजारों तक विस्तारित किया है, जिससे यह प्रोग्राम सीमित पायलट से व्यापक क्षेत्रीय लॉन्च में बदल गया है। कंपनी ने 18 अगस्त को यह समाचार प्रकाशित किया, जिसमें लॉन्च को विज्ञापनदाताओं के लिए लोगों तक पहुंचने के एक तरीके के रूप में प्रस्तुत किया गया है जब वे सक्रिय रूप से खोज रहे होते हैं, विकल्पों की तुलना कर रहे होते हैं, और चैटबॉट के अंदर निर्णय ले रहे होते हैं।
यह बदलाव मायने रखता है क्योंकि कन्वर्सेशनल AI पिछले कुछ सालों में ज्यादातर अपने पीछे की लैब्स के लिए एक लागत केंद्र रही है। विज्ञापन उस गणित को बदल देते हैं, और 31 देशों का यूरोपीय लॉन्च स्केल प्रश्न को बदल देता है। ChatGPT उस क्षेत्र में सबसे अधिक उपयोग किए जाने वाले उपभोक्ता AI उत्पादों में से एक है, इसलिए इसके अंदर प्रायोजित प्लेसमेंट अब उस दर्शक वर्ग तक पहुंचते हैं जिसके लिए विज्ञापनदाता पहले Google या Meta को भुगतान करते थे। "डिसीजन मोमेंट्स" के लिए OpenAI की फ्रेमिंग भी यह संकेत देती है कि प्लेसमेंट कहां हैं: न केवल किसी उत्तर के अंत में, बल्कि उन जगहों पर जहां कोई उत्पादों की तुलना कर रहा है, विकल्पों पर विचार कर रहा है, या कार्य करने वाला है।
यूरोप में बिल्डर्स और मार्केटर्स के लिए, व्यावहारिक प्रभाव यह है कि ChatGPT अब स्लाइड डेक में उल्लेख करने की कौतूहल नहीं रहा। यह वास्तव में अभियान चलाने की जगह है, जिसका अपना दर्शक वर्ग और इंटेंट सिग्नल हैं। किसी भी उपभोक्ता उत्पाद को शिप करने वाले के लिए, दीर्घकालिक प्रश्न यह है कि क्या असिस्टेंट्स के अंदर रिकमेंडेशन स्लॉट पारंपरिक सर्च विज्ञापनों को हटाना शुरू कर देते हैं, और क्या आपकी श्रेणी वह है जिसे ChatGPT उन पलों में दिखाएगा।
[18:21] OpenAI AI अर्थव्यवस्था के लिए 14 स्वतंत्र नीति परियोजनाओं का समर्थन करता है
OpenAI ने 17 अगस्त को घोषणा की कि वह 14 स्वतंत्र परियोजनाओं को वित्तपोषित कर रहा है ताकि जिसे वह इंटेलिजेंस एज कहता है, उसके लिए नई नीति विचार विकसित किए जा सकें। अनुदान दो व्यापक लक्ष्यों को लक्षित करते हैं: काम में AI फैलने के रूप में आर्थिक अवसर का विस्तार, और इसके साथ आने वाले व्यवधान के प्रति सामाजिक लचीलापन को मजबूत करना। OpenAI एक थिंक टैंक के बजाय एक प्रायोजक के रूप में कार्य कर रहा है, बाहरी टीमों का चयन करके विचार उत्पन्न कर रहा है ताकि नीतिगत बातचीत एक ही कंपनी के रोडमैप से अधिक दृष्टिकोणों पर आधारित हो।
यह अभी मायने रखता है क्योंकि सरकारें अभी भी AI законодательство का मसौदा तैयार कर रही हैं और श्रम बाजार पहले से ही नए उपकरणों के दबाव में बदल रहे हैं। वित्तपोषित परियोजनाएं अस्पष्ट सिद्धांतों के उत्पादन के बजाय सक्रिय बहस में ठोस सिफारिशें दे सकती हैं। OpenAI स्वयं AI निर्माण का एक प्रमुख लाभार्थी है, स्वतंत्र शोधकर्ताओं के माध्यम से पैसा रूट करना यह सुनिश्चित करने का भी प्रयास है कि सड़क के नियमों को परिभाषित करने का अधिकार अधिक लोगों को मिले।
आगे क्या देखना है: 14 टीमें कौन से विषयों पर काम करती हैं। उनके पोर्टफोलियो का स्वरूप प्रकट करेगा कि स्वतंत्र शोधकर्ता सबसे तीव्र अंतराल कहां देखते हैं — चाहे वह नौकरी विस्थापन, शिक्षा, सुरक्षा नियमन, या पूरी तरह से कुछ और पर हो — और वह संकेत किसी भी तैयार नीति दस्तावेज़ से पहले आ जाएगा।