Rows of server racks with illuminated components
AI

Thinking Machines ने Inkling, 975B MoE मॉडल लॉन्च किया

कंपनी का कहना है कि प्रति टोकन केवल ~41B पैरामीटर सक्रिय हैं और तैनाती के लिए 2TB से 600GB मेमोरी फ़ुटप्रिंट प्रकाशित करती है।

Elliot Marsh द्वारा6 मिनट का पठन

थिंकिंग मशीनों ने इंकलिंग जारी किया है, जो एक पूरी तरह से नए Mixture-of-Experts मॉडल है, जिसका कहना है कि इसमें कुल 975 बिलियन पैरामीटर हैं जबकि प्रति टोकन लगभग 41 बिलियन सक्रिय होते हैं। वजन को हगिंग फेस पर Apache 2.0 लाइसेंस के तहत उपलब्ध बताया गया है, साथ ही असामान्य रूप से स्पष्ट GPU मेमोरी आवश्यकताएँ जो मॉडल की "खुलापन" को वास्तविक तैनाती बाधाओं से जोड़ती हैं।

मुख्य निष्कर्ष

  • थिंकिंग मशीनों ने 15 जुलाई, 2026 को इंकलिंग जारी किया, इसे कंपनी का पहला मॉडल बताया गया जो पूरी तरह से नए सिरे से प्रशिक्षित किया गया है।
  • इंकलिंग को 975B-पैरामीटर Mixture-of-Experts मॉडल के रूप में वर्णित किया गया है, जिसमें प्रति टोकन लगभग 41B पैरामीटर सक्रिय होते हैं, जो घनी गणना के बजायSparse routing का उपयोग करता है।
  • संरचना को 66 परतों के रूप में निर्दिष्ट किया गया है, जिसमें प्रति परत 256 विशेषज्ञ हैं, जो प्रति टोकन छह विशेषज्ञों को मार्गदर्शित करते हैं और हर टोकन पर चलने वाले दो साझा विशेषज्ञ होते हैं।
  • तैनाती के फुटप्रिंट सीधे बताए गए हैं: पूर्ण सटीकता के लिए लगभग 2TB का संयुक्त GPU मेमोरी और एक क्वांटाइज्ड चेकपॉइंट के लिए लगभग 600GB।

इंकलिंग एक Apache 2.0, पूरी तरह से नए MoE रिलीज के रूप में आता है।

थिंकिंग मशीनों ने 15 जुलाई, 2026 को इंकलिंग नामक एक मॉडल जारी किया। कंपनी को हगिंग फेस पर Apache 2.0 लाइसेंस के तहत वजन उपलब्ध कराने के रूप में वर्णित किया गया है, जो आमतौर पर लाइसेंस शर्तों के अधीन व्यापक पुन: उपयोग और संशोधन की अनुमति देता है।

इंकलिंग को एक Mixture-of-Experts (MoE) प्रणाली के रूप में प्रस्तुत किया गया है, जिसका अर्थ है कि मॉडल कई पैरामीटर "विशेषज्ञों" को संग्रहीत करता है लेकिन प्रत्येक उत्पन्न टोकन के लिए केवल एक उपसमुच्चय चलाता है। तकनीकी विभाजन में प्रमुख आकार 975 बिलियन कुल पैरामीटर गिनती और किसी भी एकल टोकन को संसाधित करने में शामिल लगभग 41 बिलियन पैरामीटर के बीच का अंतर है, या एक समय में लगभग 4% सक्रिय।

पैकेट का विवरण एक द्वितीयक तकनीकी विभाजन से आता है जो स्पष्ट रूप से चेतावनी देता है कि यह "विभिन्न स्रोतों से सार्वजनिक रूप से साझा किए गए विवरणों" से संकलित है और पाठकों से गलतियों को चिह्नित करने के लिए कहता है। अंतर्निहित संदर्भ और प्राथमिक रिलीज आर्टिफैक्ट यहाँ शामिल नहीं हैं, इसलिए तंत्र स्पष्ट है लेकिन प्रत्यक्ष सत्यापन केवल अंश में जो है, तक सीमित है।

संख्याएँ जिन पर व्यापारी ध्यान केंद्रित करेंगे: 2TB पूर्ण सटीकता, ~600GB क्वांटाइज्ड

इंक्लिंग का विमोचन एक बुनियादी ढांचे की कहानी की तरह है क्योंकि यह मॉडल चेकपॉइंट्स से ठोस मेमोरी फ़ुटप्रिंट को जोड़ता है, केवल पैरामीटर की संख्या नहीं। विवरण में कहा गया है कि पूर्ण-सटीकता चेकपॉइंट के लिए कम से कम 2 TB संयुक्त GPU मेमोरी की आवश्यकता होती है, जो आठ NVIDIA B300 कार्ड या सोलह H200 कार्ड के रूप में दी गई है। यह लगभग 600 GB का एक क्वांटाइज्ड चेकपॉइंट भी वर्णित करता है जो चार B300 कार्ड पर फिट होता है।

ये आंकड़े महत्वपूर्ण हैं क्योंकि वे "खुले वजन" को क्षमता योजना की समस्या में बदल देते हैं। यदि एक मॉडल को डाउनलोड और चलाया जा सकता है, तो व्यापारी उस दावे को एक मोटे हार्डवेयर सामग्री बिल से मैप कर सकते हैं, फिर होस्टेड इनफेरेंस अर्थशास्त्र से, फिर GPU क्षमता की मांग और उन स्टैक्स से जो इसे सेवा देते हैं। एक 975B शीर्षक संख्या अपने आप में कथा ईंधन हो सकती है, लेकिन 2TB की आवश्यकता एक बाधा है जो खरीद, कोलो योजना और मूल्य निर्धारण में प्रकट होती है।

MoE उन दो वास्तविकताओं के बीच का पुल है। इंक्लिंग के डिज़ाइन को प्रति-टोकन इनफेरेंस लागत से स्टोरेज लागत को अलग करने के रूप में वर्णित किया गया है: आपको इसे चलाने के लिए पूर्ण चेकपॉइंट को मेमोरी में लोड करना होगा, लेकिन प्रत्येक टोकन केवल पैरामीटर के एक छोटे अंश को सक्रिय करता है। यही कारण है कि एक मॉडल "कागज पर बहुत बड़ा" हो सकता है जबकि प्रति टोकन चलाने की लागत इसके कुल पैरामीटर की संख्या से कम होती है।

इंक्लिंग 1M टोकन तक कैसे पहुँचता है: 55 स्लाइडिंग-विंडो लेयर और 11 पूर्ण-ध्यान लेयर

इंक्लिंग को एक मिलियन टोकन संदर्भ विंडो का समर्थन करने के रूप में वर्णित किया गया है, जो एक बार में विचार करने की अधिकतम मात्रा है। इसे संभव बनाने के लिए जो तंत्र प्रदान किया गया है वह ध्यान विरलता है: अधिकांश लेयर स्लाइडिंग-विंडो ध्यान का उपयोग करती हैं, जहाँ प्रत्येक टोकन केवल सीमित हाल की रेंज पर ध्यान केंद्रित करता है, और एक छोटी संख्या में लेयर पूर्ण ध्यान का उपयोग करती हैं, जहाँ टोकन पूरे पिछले अनुक्रम पर ध्यान केंद्रित कर सकते हैं।

विवरण में स्लाइडिंग-विंडो लेयर और पूर्ण-ध्यान लेयर के बीच 5:1 का परिवर्तन वर्णित किया गया है। यह vLLM एकीकरण नोट्स का भी उल्लेख करता है जो विभाजन पर संख्याएँ डालते हैं: 66 कुल लेयर में से 55 स्लाइडिंग-विंडो लेयर और 11 पूर्ण-ध्यान लेयर।

यह एक विशिष्ट आर्किटेक्चरल ट्रेडऑफ है, न कि अलग-थलग विपणन दावा। स्लाइडिंग-विंडो लेयर अनुक्रम की लंबाई के साथ कंप्यूट को विस्फोटित होने से रोकती हैं, लेकिन वे लंबे समय की याददाश्त खोने का जोखिम भी उठाती हैं क्योंकि अधिकांश लेयर में दूर की जानकारी सीधे दिखाई नहीं देती। आवधिक पूर्ण-ध्यान लेयर बचने का रास्ता हैं, जो वैश्विक "रीफ्रेश पॉइंट" प्रदान करती हैं जहाँ अनुक्रम में बहुत पहले की जानकारी को आगे खींचा जा सकता है और फिर स्थानीय रूप से फिर से ले जाया जा सकता है।

बाजार इसे मूल्य में डालने से पहले क्या सत्यापित करें: स्रोत, ट्रंकशन, और गायब बेंचमार्क

इंक्लिंग को एक उत्प्रेरक के रूप में मानने के लिए गेटिंग मुद्दा प्राथमिक कलाकृतियों का सत्यापन है। पैकेट में एक थिंकिंग मशीन मॉडल कार्ड शामिल नहीं है, एक सीधा हगिंग फेसलिंक, या उद्धरण के ब्रैकेट में संदर्भित दस्तावेज़, इसलिए पहला पुष्टि बिंदु वास्तविक मॉडल पृष्ठ और वजन से जुड़े सटीक Apache 2.0 लाइसेंस और उपयोग की शर्तें हैं।

दूसरा गायब टुकड़ा प्रदर्शन प्रमाण है। पैकेट में कोई बेंचमार्क, विलंबता संख्या, थ्रूपुट दावे, या लंबे संदर्भ मूल्यांकन प्रदान नहीं किए गए हैं, और उद्धरण स्थिति एन्कोडिंग की चर्चा के मध्य में काट दिया गया है। तीसरे पक्ष के मूल्यांकन, विशेष रूप से परीक्षण जो एक मिलियन टोकन विंडो के पास लंबे संदर्भ व्यवहार की जांच करते हैं, "1M टोकन का समर्थन करता है" और "1M टोकन स्वीकार करता है लेकिन महत्वपूर्ण चीज़ें भूल जाता है" को अलग करने का सबसे तेज़ तरीका होगा।

तीसरी पुष्टि यह है कि घोषित पदचिह्नों पर तैनाती योग्य है। विभाजन पूर्ण सटीकता और क्वांटाइज्ड चेकपॉइंट्स के लिए विशिष्ट मेमोरी लक्ष्यों को देता है, और यह 55/11 ध्यान विभाजन के लिए vLLM एकीकरण नोट्स का संदर्भ देता है। उन कॉन्फ़िगरेशन पर सफल रन की रिपोर्ट, साथ ही यह प्रमाण कि सामान्य अनुमान स्टैक वर्णित ध्यान पैटर्न को संभालते हैं, इस पर विश्वास को मजबूत करेगा कि यह एक ऐसा मॉडल है जिसे लोग वास्तव में होस्ट कर सकते हैं न कि केवल डाउनलोड कर सकते हैं।

मेरा पढ़ना: ओपन वेट्स + स्पष्ट पदचिह्न मॉडल लॉन्च और कंप्यूट ट्रेड के बीच फीडबैक लूप को कसते हैं।

वह भाग जो तय करता है कि क्या Inkling बाजारों के लिए महत्वपूर्ण है, वह 975B शीर्षक नहीं है, यहSparse सक्रियण और स्पष्ट तैनाती पदचिह्न का संयोजन है। एक MoE मॉडल जो प्रति टोकन केवल ~41B पैरामीटर सक्रिय करता है, बिना "लगभग एक ट्रिलियन पैरामीटर" के मार्केटिंग आभा को छोड़े बिना प्रति-टोकन लागत वक्र को यथार्थता से बदल सकता है, और यही वह प्रकार की अस्पष्टता है जिसका अनुमान व्यापारी आमतौर पर लगाते हैं।

जो सीमा महत्वपूर्ण है वह यह है कि क्या Apache 2.0 Hugging Face लिस्टिंग और 2TB-से-600GB मेमोरी दावे वास्तविक तैनाती में बने रहते हैं, फिर इन्हें फाइन-ट्यून, क्वांटाइजेशन वेरिएंट, और होस्टेड इनफेरेंस ऑफ़रिंग द्वारा प्रतिध्वनित किया जाता है। यदि ये पुष्टि आती हैं, तो "ओपन लंबे संदर्भ" एक कथा बनना बंद कर देता है और एक मापने योग्य GPU-क्षमता इनपुट बन जाता है जो स्टैक के माध्यम से फैल सकता है।

स्रोत