
PrismML نسخه Bonsai 2 27B را با حجم 5.9 گیگابایت عرضه کرد
PrismML میگوید که انتشار وزن سهگانه ۹۸٪ از نمرات کلی معیار Qwen را با کاهش حافظه ۹ برابر تا ۱۰ برابر حفظ میکند.
PrismML نسخه ۲ ۲۷B بونزای را در ۱۷ سپتامبر منتشر کرد و گفت که این نسخه، مدل متن باز Qwen3.8 ۲۷B علیبابا را به اندازه ۵.۹ گیگابایت فشرده میکند. این شرکت ادعا میکند که ۹۸٪ برابری کلی در معیارها نسبت به مدل اصلی دارد و هدفش این است که استنتاج LLM «استدلال» را در دستگاههای محلی به جای ابر عملی کند.
PrismML نسخه ۲ ۲۷B بونزای را روز پنجشنبه منتشر کرد و آن را به عنوان یک نسخه فشرده از Qwen3.8 ۲۷B علیبابا معرفی کرد که میتواند با حافظه بسیار کمتری اجرا شود. PrismML اندازه مدل را ۵.۹ گیگابایت اعلام کرده است که به اندازهای کوچک است که برای یک کامپیوتر و «احتمالاً» یک گوشی هوشمند پیشرفته مناسب باشد.
مکانیسم ساده است: پارامترهای ذخیره شده مدل را به اندازهای کوچک کنید که استنتاج دیگر به GPUهای ابری وابسته نباشد و به آنچه در حافظه محلی جا میشود وابسته باشد. PrismML میگوید بونزای ۲ «کاهش ۹ تا ۱۰ برابری در حافظه نسبت به مدل اصلی» ارائه میدهد که این نوع تغییر گام، بیشتر از افزایشهای جزئی سرعت اهمیت دارد زمانی که هدف، استقرار محلی است.
برای ناظران زیرساختهای مرتبط با ارزهای دیجیتال، ارتباط فوری توزیع و هزینه است. اگر یک مدل «استدلال» با ۲۷B پارامتر بتواند در یک اندازه گیگابایتی تکرقمی بستهبندی شود بدون اینکه کیفیت کاهش یابد، گلوگاه از ظرفیت استنتاج متمرکز به تحویل لبه، سازگاری دستگاه و نرمافزاری که مدل را احاطه میکند، تغییر میکند.
از ۹۵٪ تا ۹۸٪ برابری: سیگنالهای پذیرش و پیشنهاد وزنهای سهگانه
PrismML بونزای ۲ را به عنوان یک نسخه با حفظ کیفیت معرفی میکند، نه فقط یک فایل کوچکتر. این شرکت میگوید بونزای ۲ ۹۸٪ از نمرات معیار کلی Qwen را تطابق میدهد که از ۹۵٪ برای اولین نسخه بونزای که چند ماه پیش منتشر شد، افزایش یافته است.
همچنین شواهدی از تمایل توسعهدهندگانی که مدلهای متن باز کوچکتر میخواهند وجود دارد. PrismML میگوید اولین مدل بونزای بیش از ۱۱ میلیون بار دانلود شده است و مدلهای حتی کوچکتر آن ۲.۶ میلیون بار دیگر دانلود شدهاند.
ادعای فشردهسازی بر اساس نحوه نمایش وزنها است. وزنها پارامترهای عددی ذخیره شدهای هستند که یک مدل در طول آموزش یاد میگیرد و PrismML میگوید یک وزن معمولی از ۱۶ بیت استفاده میکند. رویکرد آن از وزنهای «سهگانه» استفاده میکند که فقط سه مقدار «+۱، −۱ یا ۰» را میپذیرد و نیاز به ذخیرهسازی را به اندازهای کاهش میدهد که اندازه مدل را کوچک کند.
نکته این است که برابری معیارها همانند برابری وظیفه نیست و چارچوبسازی خود PrismML فضایی برای لغزش باقی میگذارد.لغزش. بابک حسیبی، مدیرعامل، گفت که فشردهسازی احتمالاً همیشه تأثیری خواهد داشت، حتی اگر فاصله باقیمانده کوچک باشد. این شرکت همچنین به یک متغیر دوم اشاره میکند که اغلب در مقایسههای مدل نادیده گرفته میشود: نرمافزار اطراف، یا «حلقهای که یک مدل در آن اجرا میشود»، که به گفتهی آنها میتواند بهطور قابل توجهی بر دقت تأثیر بگذارد.
PrismML سعی دارد اعتبار را با مردم و سرمایه به اندازهی امتیازها خریداری کند. این شرکت میگوید که یک دور سرمایهگذاری اولیه به مبلغ ۲۲.۲۵ میلیون دلار جمعآوری کرده و توسط Khosla Ventures، Cerberus Capital و Caltech حمایت میشود. PrismML تحت رهبری حسیبی، یک استاد Caltech که بهعنوان یک کارشناس در فناوریهای فشردهسازی توصیف شده، قرار دارد و Ion Stoica را بهعنوان مشاور معرفی میکند.
پیشنهاد استویکا این است که استنتاج محلی اقتصاد و مدل حریم خصوصی در سطح کاربر را تغییر میدهد. او گفت: «شما هوش را در دستان خود خواهید داشت و این رایگان خواهد بود زیرا بر روی دستگاهی که قبلاً خریداری کردهاید اجرا خواهد شد. همچنین خصوصی خواهد بود، زیرا شما آن را به ابر نخواهید فرستاد.»
نقشهراه به صدها میلیارد پارامتر—و سؤالات باز
مرحلهی بعدی PrismML مقیاس است. حسیبی گفت که این شرکت انتظار دارد مدلهای فشردهشده را «در محدودهی چند صد میلیارد پارامتر» در چند ماه آینده منتشر کند و افزود: «مدلهای بعدی که ما منتشر خواهیم کرد، امیدوارم در چند ماه آینده، در محدودهی چند صد میلیارد پارامتر خواهند بود و من انتظار دارم که حفظ هوش در آنجا آسانتر باشد.»
او همچنین استدلال کرد که مدلهای بزرگتر ممکن است بدون از دست دادن کیفیت، فشردهسازی آنها آسانتر باشد: «فضای بیشتری برای فشردهسازی آنها بدون از دست دادن هوش وجود دارد. بنابراین من فقط میگویم که بهعنوان یک روند کلی، برای مدلهای بزرگتر، رسیدن به ۱۰۰٪ آسانتر است.» PrismML هنوز برابری معیار ۱۰۰٪ را بهعنوان نامشخص مطرح میکند و اظهارات خود شرکت نشان میدهد که ممکن است برخی از کاهشها ساختاری باشد.
سؤالات باز در کوتاهمدت عملی هستند، نه فلسفی. PrismML فهرست سختافزارهای پشتیبانیشده یا معیارهای سطح دستگاه را در اینجا منتشر نکرده است و زاویهی گوشیهای هوشمند همچنان «احتمالی» باقی مانده است نه اثباتشده. تکرار مستقل نیز مهم است زیرا اثر واقعی و عملکرد میتواند به انتخابهای زمان اجرا، جزئیات کمیسازی و حلقهای که برای ارزیابی وظایف استفاده میشود، بستگی داشته باشد.
همچنین شایعاتی دربارهی توافقات تأییدنشده وجود دارد. گفته میشود PrismML در حال مذاکره با اپل است، اما حسیبی از اظهار نظر خودداری کرد و هرگونه زمانبندی برای همکاری یا ادغام را نامشخص گذاشت.
نظر من: پیشرفت فشردهسازی واقعی است، اما معیارها و اثبات سختافزار تصمیمگیرندهی معامله خواهند بود.
آستانهای که مهم است این است که آیا ادعای ۵.۹ گیگابایتی به عملکرد قابل تکرار در سطح دستگاه بر روی بارهای واقعی تبدیل میشود، نه فقط برابری معیار تجمعی. حرکت از ۹۵٪ به ۹۸٪ نشان میدهد که PrismML بهسرعت در حال تکرار بر روی بخشی است که معمولاً تلاشهای فشردهسازی را خراب میکند، که حفظ کیفیت تحت برشهای اندازهای تهاجمی است.
اگر PrismML بتواند اعتبارسنجی سختافزاری معتبر منتشر کند و در حالی که به مدلهای با چند صد میلیارد پارامتر منتقل میشود، به ادعاهای خود نزدیک بماند، این تنظیم به نظر میرسد که ساختاری باشد نه داستانمحور: توزیع لبه و استنتاج با اولویت حریم خصوصی به مسیر پیشفرض استقرار برای بخشی از بارهای کاری «استدلال» تبدیل میشود که در حال حاضر فرض میکنند از GPUهای ابری استفاده میکنند.