
PrismML ने Bonsai 2 27B लॉन्च किया, Qwen3.8 को 5.9 GB किया
PrismML का कहना है कि तृतीयक-भार रिलीज Qwen के समग्र बेंचमार्क स्कोर का 98% बनाए रखता है, जिसमें 9x–10x मेमोरी कट है।
PrismML ने 17 सितंबर को Bonsai 2 27B जारी किया, जिसमें कहा गया कि यह Alibaba के ओपन-सोर्स Qwen3.8 27B को 5.9 GB के आकार में संकुचित करता है। कंपनी का दावा है कि यह मूल मॉडल के मुकाबले 98% समग्र बेंचमार्क समानता प्रदान करता है, जिसका लक्ष्य "कारण" LLM अनुमान को स्थानीय उपकरणों पर क्लाउड के बजाय व्यावहारिक बनाना है।
PrismML ने गुरुवार को Bonsai 2 27B जारी किया, जिसे Alibaba के ओपन-सोर्स Qwen3.8 27B का एक संकुचित निर्माण के रूप में प्रस्तुत किया गया है जो बहुत कम मेमोरी में चल सकता है। PrismML मॉडल के आकार को 5.9 GB बताता है, जिसे यह एक PC और "संभवतः" एक उच्च अंत स्मार्टफोन के लिए पर्याप्त छोटा मानता है।
यह तंत्र सीधा है: मॉडल के संग्रहीत पैरामीटर को इस हद तक संकुचित करें कि अनुमान क्लाउड GPUs द्वारा बाधित होना बंद कर दे और स्थानीय मेमोरी में जो फिट हो, उसके द्वारा बाधित होना शुरू कर दे। PrismML का कहना है कि Bonsai 2 "मूल की तुलना में मेमोरी में 9x से 10x की कमी" प्रदान करता है, जो उस प्रकार का कदम है जो स्थानीय तैनाती के लक्ष्य के समय सीमांत गति में सुधार से अधिक महत्वपूर्ण है।
क्रिप्टो-संबंधित अवसंरचना पर नज़र रखने वालों के लिए, तत्काल प्रासंगिकता वितरण और लागत है। यदि 27B-पैरामीटर "तर्क" मॉडल को गुणवत्ता को गिराए बिना एकल-अंक गीगाबाइट आकार में पैक किया जा सकता है, तो बाधा केंद्रीय अनुमान क्षमता से किनारे पर वितरण, उपकरण संगतता, और उस सॉफ़्टवेयर स्टैक की ओर स्थानांतरित हो जाती है जो मॉडल को लपेटता है।
95% से 98% समानता: अपनाने के संकेत और तृतीयक-भार प्रस्ताव
PrismML ने Bonsai 2 को एक गुणवत्ता-रक्षा पुनरावृत्ति के रूप में प्रस्तुत किया है, न कि केवल एक छोटे फ़ाइल के रूप में। कंपनी का कहना है कि Bonsai 2 Qwen के समग्र बेंचमार्क स्कोर के 98% के बराबर है, जो कि पहले Bonsai रिलीज के 95% से बढ़कर है जो कुछ महीने पहले आई थी।
डेवलपर्स से छोटे ओपन मॉडल की मांग का भी सबूत है। PrismML का कहना है कि पहला Bonsai मॉडल 11 मिलियन से अधिक बार डाउनलोड किया गया है, और इसके छोटे मॉडल को 2.6 मिलियन बार और डाउनलोड किया गया है।
संपीड़न का दावा इस पर निर्भर करता है कि वज़न कैसे प्रदर्शित किए जाते हैं। वज़न वे संग्रहीत संख्यात्मक पैरामीटर हैं जो एक मॉडल प्रशिक्षण के दौरान सीखता है, और PrismML का कहना है कि एक सामान्य वज़न 16 बिट्स का उपयोग करता है। इसका दृष्टिकोण "तृतीयक" वज़नों का उपयोग करता है जो केवल तीन मान लेते हैं, "+1, −1, या 0," जिससे संग्रहण आवश्यकताओं को इतना कम किया जा सकता है कि मॉडल का आकार घट सके।
पकड़ यह है कि बेंचमार्क समानता वही चीज़ नहीं है जो कार्य समानता है, और PrismML का अपना ढांचा इसके लिए जगह छोड़ता है।स्लिपेज. सीईओ बाबक हसीबी ने कहा कि संकुचन का प्रभाव हमेशा कुछ न कुछ रहेगा, भले ही शेष अंतर छोटा हो। कंपनी एक दूसरे चर की ओर भी इशारा करती है जिसे मॉडल तुलना में अक्सर नजरअंदाज किया जाता है: चारों ओर का सॉफ़्टवेयर, या “वह हार्नेस जिसमें एक मॉडल चलता है,” जो कहती है कि यह सटीकता को महत्वपूर्ण रूप से प्रभावित कर सकता है।
प्रिज्मएमएल लोगों और पूंजी के साथ-साथ स्कोर के साथ विश्वसनीयता खरीदने की कोशिश कर रहा है। कंपनी का कहना है कि उसने $22.25 मिलियन का सीड राउंड जुटाया है और इसे खोसला वेंचर्स, सर्बेरस कैपिटल और कैलटेक द्वारा समर्थन प्राप्त है। प्रिज्मएमएल का नेतृत्व हसीबी कर रहे हैं, जो कैलटेक के प्रोफेसर हैं और जिन्हें संकुचन प्रौद्योगिकियों के विशेषज्ञ के रूप में वर्णित किया गया है, और यह आयोन स्टोइका को एक सलाहकार के रूप में सूचीबद्ध करता है।
स्टोइका का तर्क है कि स्थानीय अनुमान उपयोगकर्ता स्तर की अर्थशास्त्र और गोपनीयता मॉडल को बदलता है। “आपके पास आपकी उंगलियों पर बुद्धिमत्ता होगी, और यह मुफ्त होगी क्योंकि यह उस डिवाइस पर चलेगी जिसे आपने पहले ही खरीदा है। यह भी निजी होगी, क्योंकि आप इसे क्लाउड पर नहीं भेजेंगे,” उन्होंने कहा।
सैकड़ों अरबों पैरामीटर के लिए रोडमैप—और खुली प्रश्न
प्रिज्मएमएल का अगला मील का पत्थर पैमाना है। हसीबी ने कहा कि कंपनी अगले कुछ महीनों में “कई-सौ-अरब-पैरामीटर रेंज” में संकुचित मॉडल जारी करने की उम्मीद करती है, जोड़ते हुए: “अगले मॉडल जो हम जारी करेंगे, उम्मीद है कि अगले कुछ महीनों में, कई-सौ-अरब-पैरामीटर रेंज में होंगे, और मुझे उम्मीद है कि वहां बुद्धिमत्ता बनाए रखना आसान होगा।”
उन्होंने यह भी तर्क किया कि बड़े मॉडल को गुणवत्ता खोए बिना संकुचित करना आसान हो सकता है: “उनको संकुचित करने के लिए अधिक जगह है बिना बुद्धिमत्ता खोए। इसलिए मैं बस कहूंगा, एक सामान्य प्रवृत्ति के रूप में, बड़े मॉडल के लिए, 100% तक पहुंचना आसान है।” प्रिज्मएमएल अभी भी 100% बेंचमार्क समानता को अनिश्चित रूप से फ्रेम करता है, और कंपनी की अपनी टिप्पणियाँ सुझाव देती हैं कि कुछ गिरावट संरचनात्मक हो सकती है।
निकट-अवधि के खुले प्रश्न व्यावहारिक हैं, दार्शनिक नहीं। प्रिज्मएमएल ने यहां समर्थित-हार्डवेयर सूची या डिवाइस-स्तरीय बेंचमार्क प्रकाशित नहीं किए हैं, और स्मार्टफोन कोण “संभवतः” बना हुआ है न कि प्रदर्शित। स्वतंत्र पुनरुत्पादन भी महत्वपूर्ण है क्योंकि वास्तविक फुटप्रिंट और प्रदर्शन रनटाइम विकल्पों, क्वांटाइजेशन विवरणों और कार्यों का मूल्यांकन करने के लिए उपयोग की जाने वाली हार्नेस पर निर्भर कर सकता है।
अविकसित सौदे की चर्चा भी है। प्रिज्मएमएल के बारे में अफवाह है कि यह एप्पल के साथ बातचीत कर रहा है, लेकिन हसीबी ने टिप्पणी करने से इनकार कर दिया, किसी भी साझेदारी या एकीकरण समयरेखा को अनसुलझा छोड़ दिया।
मेरी राय: संकुचन की प्रगति वास्तविक है, लेकिन बेंचमार्क और हार्डवेयर प्रमाण व्यापार को तय करेंगे
जो सीमा महत्वपूर्ण है वह यह है कि क्या 5.9 जीबी का दावा वास्तविक कार्यभार पर दोहराने योग्य, डिवाइस-स्तरीय प्रदर्शन में बदलता है, न कि केवल समग्र बेंचमार्क समानता में। 95% से 98% की ओर बढ़ना सुझाव देता है कि प्रिज्मएमएल उस हिस्से पर तेजी से काम कर रहा है जो आमतौर पर संकुचन प्रयासों को तोड़ता है, जो आक्रामक आकार कटौती के तहत गुणवत्ता बनाए रखना है।
यदि PrismML विश्वसनीय हार्डवेयर मान्यता प्रकाशित कर सकता है और अपने दावों के करीब समानता बनाए रख सकता है जब यह कई-शताब्दी-करोड़-parameter मॉडल में प्रवेश करता है, तो सेटअप संरचनात्मक लगने लगता है बजाय कि कथा-प्रेरित: एज वितरण और गोपनीयता-प्रथम अनुमान 'कारण' कार्यभार के एक हिस्से के लिए डिफ़ॉल्ट तैनाती पथ बन जाते हैं जो वर्तमान में क्लाउड GPU मानते हैं।