
PrismML发布Bonsai 2 27B,压缩Qwen3.8至5.9GB模型
PrismML表示,三元权重释放保留了Qwen的98%综合基准分数,同时内存减少了9倍至10倍。
PrismML于9月17日发布了Bonsai 2 27B,称其将阿里巴巴的开源Qwen3.8 27B压缩至5.9 GB的体积。该公司声称与原始模型相比,整体基准测试的相似度达到了98%,旨在使“推理”LLM推理在本地设备上而不是云端变得可行。
PrismML在周四发布了Bonsai 2 27B,将其定位为阿里巴巴开源Qwen3.8 27B的压缩版本,可以使用更少的内存运行。PrismML将模型大小定为5.9 GB,称其足够小,可以在PC上运行,并“可能”适用于高端智能手机。
该机制非常简单:缩小模型存储的参数,使推理不再受限于云GPU,而是受限于本地内存的容量。PrismML表示,Bonsai 2在内存使用上相比原始模型实现了“9倍到10倍的减少”,这是在本地部署时比边际加速更重要的突破。
对于关注加密相关基础设施的人士来说,直接相关的是分发和成本。如果一个27B参数的“推理”模型能够打包成单数字的千兆字节体积而不降低质量,那么瓶颈就从集中式推理能力转向边缘交付、设备兼容性以及包装模型的软件栈。
从95%到98%的相似度:采用信号和三元权重的推介
PrismML将Bonsai 2框架视为一种保留质量的迭代,而不仅仅是一个更小的文件。该公司表示,Bonsai 2的整体基准得分达到了Qwen的98%,而几个月前首次发布的Bonsai则为95%。
还有证据表明开发者对更小的开放模型有需求。PrismML表示,首个Bonsai模型已被下载超过1100万次,而其更小的模型又被下载了260万次。
压缩的说法取决于权重的表示方式。权重是模型在训练过程中学习的存储数值参数,PrismML表示,典型的权重使用16位。其方法使用“三级”权重,仅取三个值,“+1、−1或0”,足以减少存储需求,从而缩小模型的体积。
问题在于基准相似度与任务相似度并不是同一回事,而PrismML自己的框架留有余地以便于滑移首席执行官巴巴克·哈西比表示,压缩可能始终会有一些影响,即使剩余的差距很小。该公司还指出了一个在模型比较中常常被忽视的第二个变量:周围的软件,或者说“模型运行的环境”,它表示这可能会实质性影响准确性。
PrismML正在尽可能通过人脉和资金来赢得信誉。该公司表示已筹集了2225万美元的种子轮融资,并得到了Khosla Ventures、Cerberus Capital和加州理工学院的支持。PrismML由哈西比领导,他是一位被描述为压缩技术专家的加州理工学院教授,并且列出了伊昂·斯托伊卡作为顾问。
斯托伊卡的观点是,本地推理改变了用户级经济学和隐私模型。他说:“你将拥有触手可及的智能,而且它将是免费的,因为它将在你已经购买的设备上运行。它也将是私密的,因为你不会将其发送到云端。”
通往数千亿参数的路线图——以及未解的问题
PrismML的下一个里程碑是规模。哈西比表示,该公司预计将在接下来的几个月内发布“数百亿参数范围内”的压缩模型,并补充道:“我们希望在接下来的几个月内发布的下一个模型将处于数百亿参数范围内,我预计在那里保留智能会更容易。”
他还认为,较大的模型可能更容易压缩而不损失质量:“有更多的空间可以压缩它们而不失去智能。因此,我想说,作为一个普遍趋势,对于较大的模型,更容易达到100%。”PrismML仍然将100%的基准平价视为不确定,该公司的评论表明某些降级可能是结构性的。
近期的未解问题是实际的,而不是哲学性的。PrismML在这里没有发布支持的硬件列表或设备级基准,智能手机的角度仍然是“可能的”,而不是已证明的。独立复制也很重要,因为真实的足迹和性能可能取决于运行时选择、量化细节以及用于评估任务的环境。
还有未确认的交易传闻。PrismML据说正在与苹果进行谈判,但哈西比拒绝评论,留下任何合作或集成时间表未决。
我的看法:压缩进展是真实的,但基准和硬件证明将决定交易
重要的门槛是5.9 GB的声明是否转化为真实工作负载上的可重复设备级性能,而不仅仅是聚合基准平价。从95%到98%的变化表明,PrismML正在快速迭代通常会破坏压缩工作的部分,即在激进的尺寸削减下保持质量。
如果PrismML能够发布可信的硬件验证,并在其进入数千亿参数模型时保持与其声明的接近,那么这个设置就开始看起来是结构性的,而不是叙事驱动的:边缘分布和隐私优先的推理成为当前假设云GPU的一部分“推理”工作负载的默认部署路径。