An orange robotic arm handling a microchip on a
AI

AI लैब्स ने टॉप मॉडल रिलीज का अंतर 44 दिन किया

Anthropic और OpenAI के आंतरिक मेट्रिक्स स्वचालन की ओर इशारा करते हैं जो सुरक्षा विंडो को संकुचित करता है और नीति और सुरक्षा के पूंछ जोखिम को बढ़ाता है।

Elliot Marsh द्वारा5 मिनट का पठन

अमेरिका और चीन के प्रमुख एआई प्रयोगशालाओं ने उच्च-प्रदर्शन मॉडल रिलीज के बीच औसत अंतराल को अप्रैल 2026 से 44 दिनों तक कम कर दिया है, जो जनवरी 2023 से मार्च 2026 तक 125 दिनों से कम है। यह बदलाव एआई एजेंटों द्वारा अगली पीढ़ी के मॉडल बनाने के काम को अधिक करने के कारण हो रहा है, जो एक प्रतिस्पर्धात्मक दौड़ में सुरक्षा-प्रमाणन समयसीमाओं को कड़ा कर रहा है जो जोखिम बाजारों में फैल सकता है।

125 दिनों से 44: अमेरिका और चीन की प्रयोगशालाओं में नए मॉडल-रिलीज का ताल

पांच अमेरिकी एआई कंपनियों और चार चीनी फर्मों के बीच उच्च-प्रदर्शन मॉडल रिलीज का एक सर्वेक्षण पाया गया कि औसत रिलीज अंतराल अप्रैल 2026 से सितंबर 2026 के बीच 44 दिनों तक गिर गया, जबकि जनवरी 2023 से मार्च 2026 के बीच यह 125 दिन था। इस सेट में एंथ्रोपिक और ओपनएआई जैसी अमेरिकी प्रयोगशालाएँ और अलीबाबा ग्रुप और मूनशॉट एआई जैसी चीन स्थित फर्में शामिल थीं।

ताल अब एक अमूर्त औसत नहीं है। प्रारंभिक सितंबर ने एक समूहित उदाहरण प्रदान किया: एंथ्रोपिक ने 1 सितंबर को “क्लॉड फेबल 5.1” का अनावरण किया, गूगल ने 2 सितंबर को “जेमिनी 3.8 फ्लैश” लॉन्च किया, और ओपनएआई ने 3 सितंबर को “जीपीटी-6 एस्ट्रा” जारी किया। गूगल का 2 सितंबर का रिलीज़ छह हफ्तों में तीसरा फ्लैश मॉडल बताया गया।

एक ही पैटर्न अब एक आधारभूत कार्यक्रम के रूप में दिख रहा है न कि एक बार की दौड़ के रूप में। मेटा ने जुलाई से अपने “म्यूज़ स्पार्क” मॉडल को मासिक रूप से अपडेट किया है, और चीन स्थित डीपसीक ने जुलाई से हर महीने नए संस्करण जारी किए हैं, जिसमें अलीबाबा और झिपु एआई को तेज़-रिलीज़ दौड़ में शामिल होने के रूप में वर्णित किया गया है।

बाजारों के लिए, जो तंत्र महत्वपूर्ण है वह केवल “अधिक मॉडल” नहीं है। 44-दिन का चक्र बाहरी परीक्षण के लिए कम समय, डाउनस्ट्रीम एकीकरणकर्ताओं के लिए तैनाती को मजबूत करने के लिए कम समय, और अधिक बार ऐसे क्षणों का मतलब है जहां नीति, सुरक्षा, या सुरक्षा विवाद निकट-अवधि के उत्प्रेरक बन सकते हैं।

एआई द्वारा एआई का निर्माण: एंथ्रोपिक और ओपनएआई में आंतरिक आर एंड डी स्वचालन मैट्रिक्स

संक्षिप्त चक्र के लिए वर्णित चालक एआई को कोडिंग सहायक से आर एंड डी कार्यान्वयनकर्ता में बदलने का है।एआई एजेंट प्रयोगों को चलाने, मूल्यांकन लूप को प्रबंधित करने, और परिणामों का विश्लेषण करने के लिए उपयोग किए जा रहे हैं, जिससे प्रयोगशालाएँ उस काम को समानांतर में कर सकती हैं जो मानव ध्यान पर बाधित होता था।

Anthropic की 17 सितंबर की रिपोर्ट में कहा गया कि क्लॉड ने पिछले महीने तक कंपनी के AI R&D कार्यों का 26% नेतृत्व किया, जो फरवरी 2026 में 0% से बढ़कर हुआ। एंथ्रोपिक ने यह भी कहा, शब्दशः, "क्लॉड अभी पूरी तरह से स्वायत्त रूप से कार्य नहीं करता।" रिपोर्ट ने इस माप को पुनरावृत्त आत्म-सुधार के निकटता को मापने के एक तरीके के रूप में प्रस्तुत किया, जिसका अर्थ है एक प्रणाली जो अपनी डिज़ाइन या प्रशिक्षण प्रक्रिया पर अपने आप पुनरावृत्त हो रही है, जिससे क्षमता लाभ तेजी से हो सकता है बिना अनुपातिक मानव निगरानी के।

OpenAI के आंतरिक मेट्रिक्स पैकेट में उसी दिशा की ओर इशारा करते हैं, लेकिन एक अलग प्रॉक्सी के साथ: श्रम और खर्च। पिछले महीने तक, OpenAI के शोध संगठन में AI एजेंटों ने मानव शोधकर्ताओं के दैनिक श्रम के बराबर कुल कार्य घंटे 3.1 गुना दर्ज किए। OpenAI के प्रति-शोधकर्ता AI टोकन खर्च, जो उस उपयोग-व्यय माप से जुड़ा है कि शोधकर्ता कितनी मॉडल आउटपुट का उपभोग करते हैं, फरवरी 2026 में एक सामान्य शोधकर्ता के लिए लगभग $1 प्रति दिन से बढ़कर पिछले महीने में $600 प्रति दिन से अधिक हो गया, जिसमें शीर्ष 10% $7,000 प्रति दिन से अधिक हो गए।

आउटपुट-पक्ष के संकेतक इसके साथ चले गए। पैकेट में कहा गया है कि पिछले महीने OpenAI में लिखे गए प्रोग्रामिंग कोड की मात्रा पिछले वर्ष के औसत से सात गुना बढ़ गई, जबकि एंथ्रोपिक का कोड जो वास्तविक उत्पादों में Q2 में अपनाया गया, 2021-2025 के औसत से आठ गुना पहुंच गया। यही "AI द्वारा AI का निर्माण" संचालनात्मक रूप से दिखता है: अधिक समानांतर प्रयास, तेज़ पुनरावृत्ति, और क्षमता के कूद के बीच कम ढील।

प्रतिस्पर्धा 'कैदियों के दुविधा' में बदलने पर सुरक्षा विंडोज़ सिकुड़ती हैं।

सुरक्षा चिंता सीधी है: यदि पुनरावृत्ति की गति बढ़ती है, तो मानवों के लिए मॉडल व्यवहार को समझने और सुरक्षा की पुष्टि करने के लिए उपलब्ध समय सिकुड़ता है। पैकेट इसे पुनरावृत्त आत्म-सुधार के "बुद्धिमत्ता विस्फोट" को ट्रिगर करने के डर से जोड़ता है, जो क्षमता में एक अनुमानित runaway वृद्धि है जो मानव नियंत्रण और शासन को पीछे छोड़ देती है।

सुरक्षा जोखिम अपने स्वयं के वक्र पर कसता जा रहा है। यूके AI सुरक्षा संस्थान ने नवंबर 2025 में अनुमान लगाया कि AI द्वारा किए जा सकने वाले साइबर हमलों के कार्यों की लंबाई के लिए डबलिंग समय लगभग आठ महीने था। फरवरी 2026 तक, संस्थान ने अनुमान लगाया कि डबलिंग समय 4.7 महीने तक घट गया है, जो आक्रामक क्षमता में तेजी से सुधार और रक्षात्मक अनुकूलन के लिए संकीर्ण विंडो का संकेत देता है।

पकड़ यह है कि प्रोत्साहन हैं। प्रतिस्पर्धात्मक वातावरण को "कैदियों के दुविधा" के रूप में वर्णित किया गया है, जहां प्रत्येक प्रयोगशाला के पास दौड़ जारी रखने का कारण है, भले ही सभी धीमा होने में अधिक सुरक्षित होते, क्योंकि एकतरफा धीमा होने से जमीन खोने का जोखिम होता है। पैकेट में एक अप्रमाणित प्रतिस्पर्धात्मक दबाव डेटा बिंदु भी शामिल है: यह रॉयटर्स का हवाला देते हुए कहता है कि एंथ्रोपिक अपने अगले मॉडल लॉन्च को OpenAI के एस्ट्रा के खिलाफ IPO से पहले तेज करने पर विचार कर रहा है।

44-दिन के शासन की पुष्टि करने वाले निकट-अवधि के संकेत ठोस हैं। एंथ्रोपिक के अगले रिलीज के लिए पुष्टि किए गए कार्यक्रम परिवर्तन यह दिखाएंगे कि "त्वरण पर विचार करना" वास्तव में एक कैलेंडर कदम बनता है या नहीं। आंतरिक स्वचालन तीव्रता मेट्रिक्स में अपडेट, जिसमें यह शामिल है कि क्या OpenAI का 3.1x एजेंट-घंटे गुणांक बना रहता है या बढ़ता है और क्या सामान्य प्रति-शोधकर्ता टोकन खर्च $600 प्रति दिन से ऊपर रहता है, यह संकेत देगा कि क्या त्वरण स्थिर हो रहा है या अभी भी बढ़ रहा है। यूके AI सुरक्षा संस्थान या समकक्षों से ताजा साइबर क्षमता आकलन जो आठ महीने से 4.7 महीने के अनुमान को बढ़ाते हैं, भी महत्वपूर्ण होंगे, क्योंकि यही वह प्रकार का बाहरी जोखिम वक्र है जिस पर नियामक और उद्यम खरीदार आधारित हो सकते हैं।

मेरी पढ़ाई: तेज चक्र अचानक जोखिम घटनाओं की संभावना बढ़ाते हैं जिन्हें व्यापारी नजरअंदाज नहीं कर सकते।

यह तय करने वाला भाग यह है कि 44-दिन की ताल एक अस्थायी लॉन्च क्लस्टर है या स्वचालन द्वारा संचालित एक नया संचालन ताल। एंथ्रोपिक का 26% AI-नेतृत्व वाला R&D हिस्सा और OpenAI का 3.1x एजेंट-घंटे गुणांक इस बात का संकेत देते हैं कि मशीनों द्वारा कितना कार्य किया जा रहा है, न कि केवल सहायता की जा रही है, और इस प्रकार की थ्रूपुट आमतौर पर सत्यापन समय को संकुचित करने की प्रवृत्ति रखती है भले ही सुरक्षा बजट बढ़ें।

महत्वपूर्ण सीमा यह है कि क्या प्रयोगशालाएँ ऐसे मेट्रिक्स प्रकाशित करना जारी रखती हैं जो दिखाते हैं कि स्वचालन की तीव्रता उच्च बनी हुई है जबकि रिलीज़ दिनों या हफ्तों के भीतर एकत्रित होती हैं। यदि ऐसा होता है, तो सेटअप कथात्मक-आधारित के बजाय संरचनात्मक लगने लगता है, और व्यावहारिक परिणाम यह है कि नीति और सुरक्षा के झटकों की उच्च आवृत्ति होती है जो व्यापक जोखिम मूल्य निर्धारण में रिसाव कर सकती है।

स्रोत