
Thinking Machines ने Inkling, 975B MoE मॉडल लॉन्च किया
कंपनी का कहना है कि प्रति टोकन केवल ~41B पैरामीटर सक्रिय हैं और तैनाती के लिए 2TB से 600GB मेमोरी फ़ुटप्रिंट प्रकाशित करती है।
थिंकिंग मशीनों ने इंकलिंग जारी किया है, जो एक पूरी तरह से नए Mixture-of-Experts मॉडल है, जिसका कहना है कि इसमें कुल 975 बिलियन पैरामीटर हैं जबकि प्रति टोकन लगभग 41 बिलियन सक्रिय होते हैं। वजन को हगिंग फेस पर Apache 2.0 लाइसेंस के तहत उपलब्ध बताया गया है, साथ ही असामान्य रूप से स्पष्ट GPU मेमोरी आवश्यकताएँ जो मॉडल की "खुलापन" को वास्तविक तैनाती बाधाओं से जोड़ती हैं।
मुख्य निष्कर्ष
- थिंकिंग मशीनों ने 15 जुलाई, 2026 को इंकलिंग जारी किया, इसे कंपनी का पहला मॉडल बताया गया जो पूरी तरह से नए सिरे से प्रशिक्षित किया गया है।
- इंकलिंग को 975B-पैरामीटर Mixture-of-Experts मॉडल के रूप में वर्णित किया गया है, जिसमें प्रति टोकन लगभग 41B पैरामीटर सक्रिय होते हैं, जो घनी गणना के बजायSparse routing का उपयोग करता है।
- संरचना को 66 परतों के रूप में निर्दिष्ट किया गया है, जिसमें प्रति परत 256 विशेषज्ञ हैं, जो प्रति टोकन छह विशेषज्ञों को मार्गदर्शित करते हैं और हर टोकन पर चलने वाले दो साझा विशेषज्ञ होते हैं।
- तैनाती के फुटप्रिंट सीधे बताए गए हैं: पूर्ण सटीकता के लिए लगभग 2TB का संयुक्त GPU मेमोरी और एक क्वांटाइज्ड चेकपॉइंट के लिए लगभग 600GB।
इंकलिंग एक Apache 2.0, पूरी तरह से नए MoE रिलीज के रूप में आता है।
थिंकिंग मशीनों ने 15 जुलाई, 2026 को इंकलिंग नामक एक मॉडल जारी किया। कंपनी को हगिंग फेस पर Apache 2.0 लाइसेंस के तहत वजन उपलब्ध कराने के रूप में वर्णित किया गया है, जो आमतौर पर लाइसेंस शर्तों के अधीन व्यापक पुन: उपयोग और संशोधन की अनुमति देता है।
इंकलिंग को एक Mixture-of-Experts (MoE) प्रणाली के रूप में प्रस्तुत किया गया है, जिसका अर्थ है कि मॉडल कई पैरामीटर "विशेषज्ञों" को संग्रहीत करता है लेकिन प्रत्येक उत्पन्न टोकन के लिए केवल एक उपसमुच्चय चलाता है। तकनीकी विभाजन में प्रमुख आकार 975 बिलियन कुल पैरामीटर गिनती और किसी भी एकल टोकन को संसाधित करने में शामिल लगभग 41 बिलियन पैरामीटर के बीच का अंतर है, या एक समय में लगभग 4% सक्रिय।
पैकेट का विवरण एक द्वितीयक तकनीकी विभाजन से आता है जो स्पष्ट रूप से चेतावनी देता है कि यह "विभिन्न स्रोतों से सार्वजनिक रूप से साझा किए गए विवरणों" से संकलित है और पाठकों से गलतियों को चिह्नित करने के लिए कहता है। अंतर्निहित संदर्भ और प्राथमिक रिलीज आर्टिफैक्ट यहाँ शामिल नहीं हैं, इसलिए तंत्र स्पष्ट है लेकिन प्रत्यक्ष सत्यापन केवल अंश में जो है, तक सीमित है।
संख्याएँ जिन पर व्यापारी ध्यान केंद्रित करेंगे: 2TB पूर्ण सटीकता, ~600GB क्वांटाइज्ड
इंक्लिंग का विमोचन एक बुनियादी ढांचे की कहानी की तरह है क्योंकि यह मॉडल चेकपॉइंट्स से ठोस मेमोरी फ़ुटप्रिंट को जोड़ता है, केवल पैरामीटर की संख्या नहीं। विवरण में कहा गया है कि पूर्ण-सटीकता चेकपॉइंट के लिए कम से कम 2 TB संयुक्त GPU मेमोरी की आवश्यकता होती है, जो आठ NVIDIA B300 कार्ड या सोलह H200 कार्ड के रूप में दी गई है। यह लगभग 600 GB का एक क्वांटाइज्ड चेकपॉइंट भी वर्णित करता है जो चार B300 कार्ड पर फिट होता है।
ये आंकड़े महत्वपूर्ण हैं क्योंकि वे "खुले वजन" को क्षमता योजना की समस्या में बदल देते हैं। यदि एक मॉडल को डाउनलोड और चलाया जा सकता है, तो व्यापारी उस दावे को एक मोटे हार्डवेयर सामग्री बिल से मैप कर सकते हैं, फिर होस्टेड इनफेरेंस अर्थशास्त्र से, फिर GPU क्षमता की मांग और उन स्टैक्स से जो इसे सेवा देते हैं। एक 975B शीर्षक संख्या अपने आप में कथा ईंधन हो सकती है, लेकिन 2TB की आवश्यकता एक बाधा है जो खरीद, कोलो योजना और मूल्य निर्धारण में प्रकट होती है।
MoE उन दो वास्तविकताओं के बीच का पुल है। इंक्लिंग के डिज़ाइन को प्रति-टोकन इनफेरेंस लागत से स्टोरेज लागत को अलग करने के रूप में वर्णित किया गया है: आपको इसे चलाने के लिए पूर्ण चेकपॉइंट को मेमोरी में लोड करना होगा, लेकिन प्रत्येक टोकन केवल पैरामीटर के एक छोटे अंश को सक्रिय करता है। यही कारण है कि एक मॉडल "कागज पर बहुत बड़ा" हो सकता है जबकि प्रति टोकन चलाने की लागत इसके कुल पैरामीटर की संख्या से कम होती है।
इंक्लिंग 1M टोकन तक कैसे पहुँचता है: 55 स्लाइडिंग-विंडो लेयर और 11 पूर्ण-ध्यान लेयर
इंक्लिंग को एक मिलियन टोकन संदर्भ विंडो का समर्थन करने के रूप में वर्णित किया गया है, जो एक बार में विचार करने की अधिकतम मात्रा है। इसे संभव बनाने के लिए जो तंत्र प्रदान किया गया है वह ध्यान विरलता है: अधिकांश लेयर स्लाइडिंग-विंडो ध्यान का उपयोग करती हैं, जहाँ प्रत्येक टोकन केवल सीमित हाल की रेंज पर ध्यान केंद्रित करता है, और एक छोटी संख्या में लेयर पूर्ण ध्यान का उपयोग करती हैं, जहाँ टोकन पूरे पिछले अनुक्रम पर ध्यान केंद्रित कर सकते हैं।
विवरण में स्लाइडिंग-विंडो लेयर और पूर्ण-ध्यान लेयर के बीच 5:1 का परिवर्तन वर्णित किया गया है। यह vLLM एकीकरण नोट्स का भी उल्लेख करता है जो विभाजन पर संख्याएँ डालते हैं: 66 कुल लेयर में से 55 स्लाइडिंग-विंडो लेयर और 11 पूर्ण-ध्यान लेयर।
यह एक विशिष्ट आर्किटेक्चरल ट्रेडऑफ है, न कि अलग-थलग विपणन दावा। स्लाइडिंग-विंडो लेयर अनुक्रम की लंबाई के साथ कंप्यूट को विस्फोटित होने से रोकती हैं, लेकिन वे लंबे समय की याददाश्त खोने का जोखिम भी उठाती हैं क्योंकि अधिकांश लेयर में दूर की जानकारी सीधे दिखाई नहीं देती। आवधिक पूर्ण-ध्यान लेयर बचने का रास्ता हैं, जो वैश्विक "रीफ्रेश पॉइंट" प्रदान करती हैं जहाँ अनुक्रम में बहुत पहले की जानकारी को आगे खींचा जा सकता है और फिर स्थानीय रूप से फिर से ले जाया जा सकता है।
बाजार इसे मूल्य में डालने से पहले क्या सत्यापित करें: स्रोत, ट्रंकशन, और गायब बेंचमार्क
इंक्लिंग को एक उत्प्रेरक के रूप में मानने के लिए गेटिंग मुद्दा प्राथमिक कलाकृतियों का सत्यापन है। पैकेट में एक थिंकिंग मशीन मॉडल कार्ड शामिल नहीं है, एक सीधा हगिंग फेसलिंक, या उद्धरण के ब्रैकेट में संदर्भित दस्तावेज़, इसलिए पहला पुष्टि बिंदु वास्तविक मॉडल पृष्ठ और वजन से जुड़े सटीक Apache 2.0 लाइसेंस और उपयोग की शर्तें हैं।
दूसरा गायब टुकड़ा प्रदर्शन प्रमाण है। पैकेट में कोई बेंचमार्क, विलंबता संख्या, थ्रूपुट दावे, या लंबे संदर्भ मूल्यांकन प्रदान नहीं किए गए हैं, और उद्धरण स्थिति एन्कोडिंग की चर्चा के मध्य में काट दिया गया है। तीसरे पक्ष के मूल्यांकन, विशेष रूप से परीक्षण जो एक मिलियन टोकन विंडो के पास लंबे संदर्भ व्यवहार की जांच करते हैं, "1M टोकन का समर्थन करता है" और "1M टोकन स्वीकार करता है लेकिन महत्वपूर्ण चीज़ें भूल जाता है" को अलग करने का सबसे तेज़ तरीका होगा।
तीसरी पुष्टि यह है कि घोषित पदचिह्नों पर तैनाती योग्य है। विभाजन पूर्ण सटीकता और क्वांटाइज्ड चेकपॉइंट्स के लिए विशिष्ट मेमोरी लक्ष्यों को देता है, और यह 55/11 ध्यान विभाजन के लिए vLLM एकीकरण नोट्स का संदर्भ देता है। उन कॉन्फ़िगरेशन पर सफल रन की रिपोर्ट, साथ ही यह प्रमाण कि सामान्य अनुमान स्टैक वर्णित ध्यान पैटर्न को संभालते हैं, इस पर विश्वास को मजबूत करेगा कि यह एक ऐसा मॉडल है जिसे लोग वास्तव में होस्ट कर सकते हैं न कि केवल डाउनलोड कर सकते हैं।
मेरा पढ़ना: ओपन वेट्स + स्पष्ट पदचिह्न मॉडल लॉन्च और कंप्यूट ट्रेड के बीच फीडबैक लूप को कसते हैं।
वह भाग जो तय करता है कि क्या Inkling बाजारों के लिए महत्वपूर्ण है, वह 975B शीर्षक नहीं है, यहSparse सक्रियण और स्पष्ट तैनाती पदचिह्न का संयोजन है। एक MoE मॉडल जो प्रति टोकन केवल ~41B पैरामीटर सक्रिय करता है, बिना "लगभग एक ट्रिलियन पैरामीटर" के मार्केटिंग आभा को छोड़े बिना प्रति-टोकन लागत वक्र को यथार्थता से बदल सकता है, और यही वह प्रकार की अस्पष्टता है जिसका अनुमान व्यापारी आमतौर पर लगाते हैं।
जो सीमा महत्वपूर्ण है वह यह है कि क्या Apache 2.0 Hugging Face लिस्टिंग और 2TB-से-600GB मेमोरी दावे वास्तविक तैनाती में बने रहते हैं, फिर इन्हें फाइन-ट्यून, क्वांटाइजेशन वेरिएंट, और होस्टेड इनफेरेंस ऑफ़रिंग द्वारा प्रतिध्वनित किया जाता है। यदि ये पुष्टि आती हैं, तो "ओपन लंबे संदर्भ" एक कथा बनना बंद कर देता है और एक मापने योग्य GPU-क्षमता इनपुट बन जाता है जो स्टैक के माध्यम से फैल सकता है।