Close-up of a computer chip with glowing elements
هوش مصنوعی

PrismML نسخه Bonsai 2 27B را با حجم 5.9 گیگابایت عرضه کرد

PrismML می‌گوید که انتشار وزن سه‌گانه ۹۸٪ از نمرات کلی معیار Qwen را با کاهش حافظه ۹ برابر تا ۱۰ برابر حفظ می‌کند.

نوشته Elliot Marsh5 دقیقه مطالعه

PrismML نسخه ۲ ۲۷B بونزای را در ۱۷ سپتامبر منتشر کرد و گفت که این نسخه، مدل متن باز Qwen3.8 ۲۷B علی‌بابا را به اندازه ۵.۹ گیگابایت فشرده می‌کند. این شرکت ادعا می‌کند که ۹۸٪ برابری کلی در معیارها نسبت به مدل اصلی دارد و هدفش این است که استنتاج LLM «استدلال» را در دستگاه‌های محلی به جای ابر عملی کند.

PrismML نسخه ۲ ۲۷B بونزای را روز پنجشنبه منتشر کرد و آن را به عنوان یک نسخه فشرده از Qwen3.8 ۲۷B علی‌بابا معرفی کرد که می‌تواند با حافظه بسیار کمتری اجرا شود. PrismML اندازه مدل را ۵.۹ گیگابایت اعلام کرده است که به اندازه‌ای کوچک است که برای یک کامپیوتر و «احتمالاً» یک گوشی هوشمند پیشرفته مناسب باشد.

مکانیسم ساده است: پارامترهای ذخیره شده مدل را به اندازه‌ای کوچک کنید که استنتاج دیگر به GPUهای ابری وابسته نباشد و به آنچه در حافظه محلی جا می‌شود وابسته باشد. PrismML می‌گوید بونزای ۲ «کاهش ۹ تا ۱۰ برابری در حافظه نسبت به مدل اصلی» ارائه می‌دهد که این نوع تغییر گام، بیشتر از افزایش‌های جزئی سرعت اهمیت دارد زمانی که هدف، استقرار محلی است.

برای ناظران زیرساخت‌های مرتبط با ارزهای دیجیتال، ارتباط فوری توزیع و هزینه است. اگر یک مدل «استدلال» با ۲۷B پارامتر بتواند در یک اندازه گیگابایتی تک‌رقمی بسته‌بندی شود بدون اینکه کیفیت کاهش یابد، گلوگاه از ظرفیت استنتاج متمرکز به تحویل لبه، سازگاری دستگاه و نرم‌افزاری که مدل را احاطه می‌کند، تغییر می‌کند.

از ۹۵٪ تا ۹۸٪ برابری: سیگنال‌های پذیرش و پیشنهاد وزن‌های سه‌گانه

PrismML بونزای ۲ را به عنوان یک نسخه با حفظ کیفیت معرفی می‌کند، نه فقط یک فایل کوچکتر. این شرکت می‌گوید بونزای ۲ ۹۸٪ از نمرات معیار کلی Qwen را تطابق می‌دهد که از ۹۵٪ برای اولین نسخه بونزای که چند ماه پیش منتشر شد، افزایش یافته است.

همچنین شواهدی از تمایل توسعه‌دهندگانی که مدل‌های متن باز کوچکتر می‌خواهند وجود دارد. PrismML می‌گوید اولین مدل بونزای بیش از ۱۱ میلیون بار دانلود شده است و مدل‌های حتی کوچکتر آن ۲.۶ میلیون بار دیگر دانلود شده‌اند.

ادعای فشرده‌سازی بر اساس نحوه نمایش وزن‌ها است. وزن‌ها پارامترهای عددی ذخیره شده‌ای هستند که یک مدل در طول آموزش یاد می‌گیرد و PrismML می‌گوید یک وزن معمولی از ۱۶ بیت استفاده می‌کند. رویکرد آن از وزن‌های «سه‌گانه» استفاده می‌کند که فقط سه مقدار «+۱، −۱ یا ۰» را می‌پذیرد و نیاز به ذخیره‌سازی را به اندازه‌ای کاهش می‌دهد که اندازه مدل را کوچک کند.

نکته این است که برابری معیارها همانند برابری وظیفه نیست و چارچوب‌سازی خود PrismML فضایی برای لغزش باقی می‌گذارد.لغزش. بابک حسیبی، مدیرعامل، گفت که فشرده‌سازی احتمالاً همیشه تأثیری خواهد داشت، حتی اگر فاصله باقی‌مانده کوچک باشد. این شرکت همچنین به یک متغیر دوم اشاره می‌کند که اغلب در مقایسه‌های مدل نادیده گرفته می‌شود: نرم‌افزار اطراف، یا «حلقه‌ای که یک مدل در آن اجرا می‌شود»، که به گفته‌ی آن‌ها می‌تواند به‌طور قابل توجهی بر دقت تأثیر بگذارد.

PrismML سعی دارد اعتبار را با مردم و سرمایه به اندازه‌ی امتیازها خریداری کند. این شرکت می‌گوید که یک دور سرمایه‌گذاری اولیه به مبلغ ۲۲.۲۵ میلیون دلار جمع‌آوری کرده و توسط Khosla Ventures، Cerberus Capital و Caltech حمایت می‌شود. PrismML تحت رهبری حسیبی، یک استاد Caltech که به‌عنوان یک کارشناس در فناوری‌های فشرده‌سازی توصیف شده، قرار دارد و Ion Stoica را به‌عنوان مشاور معرفی می‌کند.

پیشنهاد استویکا این است که استنتاج محلی اقتصاد و مدل حریم خصوصی در سطح کاربر را تغییر می‌دهد. او گفت: «شما هوش را در دستان خود خواهید داشت و این رایگان خواهد بود زیرا بر روی دستگاهی که قبلاً خریداری کرده‌اید اجرا خواهد شد. همچنین خصوصی خواهد بود، زیرا شما آن را به ابر نخواهید فرستاد.»

نقشه‌راه به صدها میلیارد پارامتر—و سؤالات باز

مرحله‌ی بعدی PrismML مقیاس است. حسیبی گفت که این شرکت انتظار دارد مدل‌های فشرده‌شده را «در محدوده‌ی چند صد میلیارد پارامتر» در چند ماه آینده منتشر کند و افزود: «مدل‌های بعدی که ما منتشر خواهیم کرد، امیدوارم در چند ماه آینده، در محدوده‌ی چند صد میلیارد پارامتر خواهند بود و من انتظار دارم که حفظ هوش در آنجا آسان‌تر باشد.»

او همچنین استدلال کرد که مدل‌های بزرگ‌تر ممکن است بدون از دست دادن کیفیت، فشرده‌سازی آن‌ها آسان‌تر باشد: «فضای بیشتری برای فشرده‌سازی آن‌ها بدون از دست دادن هوش وجود دارد. بنابراین من فقط می‌گویم که به‌عنوان یک روند کلی، برای مدل‌های بزرگ‌تر، رسیدن به ۱۰۰٪ آسان‌تر است.» PrismML هنوز برابری معیار ۱۰۰٪ را به‌عنوان نامشخص مطرح می‌کند و اظهارات خود شرکت نشان می‌دهد که ممکن است برخی از کاهش‌ها ساختاری باشد.

سؤالات باز در کوتاه‌مدت عملی هستند، نه فلسفی. PrismML فهرست سخت‌افزارهای پشتیبانی‌شده یا معیارهای سطح دستگاه را در اینجا منتشر نکرده است و زاویه‌ی گوشی‌های هوشمند همچنان «احتمالی» باقی مانده است نه اثبات‌شده. تکرار مستقل نیز مهم است زیرا اثر واقعی و عملکرد می‌تواند به انتخاب‌های زمان اجرا، جزئیات کمی‌سازی و حلقه‌ای که برای ارزیابی وظایف استفاده می‌شود، بستگی داشته باشد.

همچنین شایعاتی درباره‌ی توافقات تأییدنشده وجود دارد. گفته می‌شود PrismML در حال مذاکره با اپل است، اما حسیبی از اظهار نظر خودداری کرد و هرگونه زمان‌بندی برای همکاری یا ادغام را نامشخص گذاشت.

نظر من: پیشرفت فشرده‌سازی واقعی است، اما معیارها و اثبات سخت‌افزار تصمیم‌گیرنده‌ی معامله خواهند بود.

آستانه‌ای که مهم است این است که آیا ادعای ۵.۹ گیگابایتی به عملکرد قابل تکرار در سطح دستگاه بر روی بارهای واقعی تبدیل می‌شود، نه فقط برابری معیار تجمعی. حرکت از ۹۵٪ به ۹۸٪ نشان می‌دهد که PrismML به‌سرعت در حال تکرار بر روی بخشی است که معمولاً تلاش‌های فشرده‌سازی را خراب می‌کند، که حفظ کیفیت تحت برش‌های اندازه‌ای تهاجمی است.

اگر PrismML بتواند اعتبارسنجی سخت‌افزاری معتبر منتشر کند و در حالی که به مدل‌های با چند صد میلیارد پارامتر منتقل می‌شود، به ادعاهای خود نزدیک بماند، این تنظیم به نظر می‌رسد که ساختاری باشد نه داستان‌محور: توزیع لبه و استنتاج با اولویت حریم خصوصی به مسیر پیش‌فرض استقرار برای بخشی از بارهای کاری «استدلال» تبدیل می‌شود که در حال حاضر فرض می‌کنند از GPUهای ابری استفاده می‌کنند.

منابع