Close-up of a computer chip with glowing elements
IA

PrismML lance Bonsai 2 27B, réduit Qwen3.8 à 5,9 Go

PrismML affirme que la libération de poids ternaire conserve 98 % des scores de référence agrégés de Qwen avec une réduction de mémoire de 9x à 10x.

Par Elliot Marsh5 min de lecture

PrismML a lancé Bonsai 2 27B le 17 septembre, affirmant qu'il compresse le Qwen3.8 27B open-source d'Alibaba à une empreinte de 5,9 Go. La société revendique une parité de référence agrégée de 98 % par rapport au modèle original, visant à rendre l'inférence LLM de "raisonnement" pratique sur des appareils locaux plutôt que sur le cloud.

PrismML a lancé Bonsai 2 27B jeudi, le positionnant comme une version compressée du Qwen3.8 27B open-source d'Alibaba qui peut fonctionner avec beaucoup moins de mémoire. PrismML évalue la taille du modèle à 5,9 Go, qu'elle décrit comme suffisamment petite pour un PC et "possiblement" un smartphone haut de gamme.

Le mécanisme est simple : réduire les paramètres stockés du modèle suffisamment pour que l'inférence ne soit plus limitée par les GPU cloud et commence à être limitée par ce qui tient dans la mémoire locale.

PrismML affirme que Bonsai 2 offre une "réduction de 9x à 10x de la mémoire par rapport à l'original", ce qui est le type de changement significatif qui compte plus que des gains de vitesse marginaux lorsque l'objectif est le déploiement local.

Pour les observateurs d'infrastructure adjacente à la crypto, la pertinence immédiate est la distribution et le coût. Si un modèle de "raisonnement" à 27 milliards de paramètres peut être emballé dans une empreinte de gigaoctets à un chiffre sans compromettre la qualité, le goulet d'étranglement passe de la capacité d'inférence centralisée à la livraison en périphérie, la compatibilité des appareils et la pile logicielle qui enveloppe le modèle.

De 95 % à 98 % de parité : Signaux d'adoption et l'argument des poids ternaires

PrismML présente Bonsai 2 comme une itération de rétention de qualité, pas seulement un fichier plus petit. La société affirme que Bonsai 2 correspond à 98 % des scores de référence agrégés de Qwen, contre 95 % pour la première version de Bonsai quelques mois plus tôt.

Il existe également des preuves d'un intérêt de la part des développeurs qui souhaitent des modèles open-source plus petits. PrismML indique que le premier modèle Bonsai a été téléchargé plus de 11 millions de fois, et ses modèles encore plus petits ont été téléchargés 2,6 millions de fois supplémentaires.

La revendication de compression repose sur la façon dont les poids sont représentés. Les poids sont les paramètres numériques stockés qu'un modèle apprend pendant l'entraînement, et PrismML affirme qu'un poids typique utilise 16 bits. Son approche utilise des poids "ternaires" qui prennent seulement trois valeurs, "+1, −1, ou 0", réduisant suffisamment les exigences de stockage pour diminuer l'empreinte du modèle.

Le hic est que la parité de référence n'est pas la même chose que la parité de tâche, et le propre cadre de PrismML laisse place àdes glissements. Le PDG Babak Hassibi a déclaré que la compression aura probablement toujours un impact, même si l'écart restant est petit.

La société souligne également une deuxième variable qui est souvent ignorée dans les comparaisons de modèles : le logiciel environnant, ou « le harnais dans lequel un modèle fonctionne », qui, selon elle, peut affecter matériellement la précision.

PrismML essaie d'acheter de la crédibilité auprès des gens et du capital autant qu'avec des scores. La société affirme avoir levé un tour de financement de 22,25 millions de dollars et est soutenue par Khosla Ventures, Cerberus Capital et Caltech. PrismML est dirigée par Hassibi, un professeur de Caltech décrit comme un expert en technologies de compression, et elle liste Ion Stoica comme conseiller.

L'argument de Stoica est que l'inférence locale modifie l'économie au niveau utilisateur et le modèle de confidentialité. « Vous allez avoir de l'intelligence à portée de main, et cela va être gratuit car cela va fonctionner sur l'appareil que vous avez déjà acheté. Cela va également être privé, car vous ne l'enverrez pas dans le cloud », a-t-il déclaré.

Feuille de route vers des centaines de milliards de paramètres - et les questions ouvertes

Le prochain jalon de PrismML est l'échelle. Hassibi a déclaré que la société s'attend à publier des modèles compressés « dans la plage de plusieurs centaines de milliards de paramètres » dans les prochains mois, ajoutant : « Les prochains modèles que nous publierons, espérons-le dans les prochains mois, seront dans la plage de plusieurs centaines de milliards de paramètres, et je m'attends à ce qu'il soit plus facile de conserver l'intelligence là-bas. »

Il a également soutenu que des modèles plus grands pourraient être plus faciles à compresser sans perdre en qualité : « Il y a plus de place pour pouvoir les compresser sans perdre l'intelligence. Donc je dirais simplement, en tant que tendance générale, pour des modèles plus grands, il est plus facile d'atteindre 100 %.

» PrismML considère toujours la parité de référence à 100 % comme incertaine, et les propres commentaires de la société suggèrent qu'une certaine dégradation peut être structurelle.

Les questions ouvertes à court terme sont pratiques, pas philosophiques. PrismML n'a pas publié de liste de matériel supporté ou de benchmarks au niveau des appareils dans le matériel ici, et l'angle smartphone reste « éventuellement » plutôt que démontré.

La réplication indépendante est également importante car l'empreinte réelle et la performance peuvent dépendre des choix d'exécution, des détails de quantification et du harnais utilisé pour évaluer les tâches.

Il y a aussi des rumeurs de négociations non confirmées. PrismML serait en pourparlers avec Apple, mais Hassibi a refusé de commenter, laissant tout partenariat ou calendrier d'intégration non résolu.

Mon avis : Les progrès de la compression sont réels, mais les benchmarks et la preuve matérielle décideront de l'échange.

Le seuil qui compte est de savoir si la revendication de 5,9 Go se traduit par une performance répétable au niveau des appareils sur des charges de travail réelles, et pas seulement par une parité de benchmark agrégée. Un passage de 95 % à 98 % suggère que PrismML itère rapidement sur la partie qui casse généralement les efforts de compression, à savoir la rétention de qualité sous des réductions de taille agressives.

Si PrismML peut publier une validation matérielle crédible et maintenir une parité proche de ses revendications alors qu'il passe à des modèles de plusieurs centaines de milliards de paramètres, la configuration commence à ressembler à une structure plutôt qu'à une narration : la distribution en périphérie et l'inférence axée sur la confidentialité deviennent le chemin de déploiement par défaut pour une partie des charges de travail de « raisonnement » qui supposent actuellement des GPU cloud.

Sources