
PrismML, Bonsai 2 27B'yi 5.9 GB'ye sıkıştırdı!
PrismML, üçlü ağırlık salımının Qwen’in toplam benchmark puanlarının %98’ini 9x–10x bellek kesintisi ile koruduğunu söylüyor.
PrismML, 17 Eylül'de Bonsai 2 27B'yi piyasaya sürdü ve bunun Alibaba'nın açık kaynaklı Qwen3.8 27B'sini 5.9 GB'lık bir ayak izine sıkıştırdığını söyledi. Şirket, yerel cihazlarda bulut yerine "akıl yürütme" LLM çıkarımını pratik hale getirmeyi hedefleyerek, orijinal modelle karşılaştırıldığında %98'lik bir toplam benchmark eşitliği iddia ediyor.
PrismML, Bonsai 2 27B'yi Perşembe günü piyasaya sürdü ve bunu Alibaba'nın açık kaynaklı Qwen3.8 27B'sinin çok daha az bellekle çalışabilen sıkıştırılmış bir versiyonu olarak konumlandırdı. PrismML, model boyutunu 5.9 GB olarak belirtiyor ve bunu bir PC için yeterince küçük ve "muhtemelen" yüksek kaliteli bir akıllı telefon için yeterli olarak tanımlıyor.
Mekanizma basit: modelin saklanan parametrelerini o kadar küçült ki çıkarım, bulut GPU'ları tarafından engellenmesin ve yerel belleğe sığanlarla sınırlansın. PrismML, Bonsai 2'nin orijinal modele göre "%9 ila %10 bellek azaltımı" sağladığını söylüyor; bu, yerel dağıtım hedeflendiğinde marjinal hız artışlarından daha önemli olan türden bir adım değişikliğidir.
Kripto ile ilgili altyapı izleyicileri için, hemen ilgili olan dağıtım ve maliyet. Eğer 27B parametreli bir "akıl yürütme" modeli, kaliteyi düşürmeden tek haneli gigabayt ayak izine paketlenebiliyorsa, darboğaz merkezi çıkarım kapasitesinden kenar teslimatına, cihaz uyumluluğuna ve modeli saran yazılım yığınına kayar.
%95'ten %98'e Eşitlik: Benimseme Sinyalleri ve Üçlü Ağırlıklar Teklifi
PrismML, Bonsai 2'yi sadece daha küçük bir dosya değil, aynı zamanda kalite koruma iterasyonu olarak çerçeveliyor. Şirket, Bonsai 2'nin Qwen'in toplam benchmark puanlarının %98'ini karşıladığını, bu oranın birkaç ay önceki ilk Bonsai sürümünde %95 olduğunu söylüyor.
Ayrıca, daha küçük açık modellere ihtiyaç duyan geliştiricilerden gelen bir talep kanıtı da var. PrismML, ilk Bonsai modelinin 11 milyondan fazla kez indirildiğini ve daha küçük modellerinin 2.6 milyon kez daha indirildiğini söylüyor.
Sıkıştırma iddiası, ağırlıkların nasıl temsil edildiğine dayanıyor. Ağırlıklar, bir modelin eğitim sırasında öğrendiği saklanan sayısal parametrelerdir ve PrismML, tipik bir ağırlığın 16 bit kullandığını söylüyor. Yaklaşımı, yalnızca üç değeri olan "üçlü" ağırlıklar kullanıyor: "+1, -1 veya 0", depolama gereksinimlerini yeterince azaltarak model ayak izini küçültüyor.
Sorun şu ki, benchmark eşitliği, görev eşitliği ile aynı şey değildir ve PrismML'nin kendi çerçevesi kayma için yer bırakıyor.kayma. CEO Babak Hassibi, sıkıştırmanın her zaman bir etkiye sahip olacağını, kalan boşluk küçük olsa bile, söyledi.
Şirket ayrıca model karşılaştırmalarında genellikle göz ardı edilen ikinci bir değişkene dikkat çekiyor: çevredeki yazılım veya “bir modelin çalıştığı kıskaç”, bu durumun doğruluğu önemli ölçüde etkileyebileceğini belirtiyor.
PrismML, insanlarla ve sermaye ile güvenilirlik satın almaya çalışıyor, aynı zamanda puanlarla da. Şirket, 22.25 milyon dolarlık bir tohum turu topladığını ve Khosla Ventures, Cerberus Capital ve Caltech tarafından desteklendiğini söylüyor. PrismML, sıkıştırma teknolojileri konusunda uzman olarak tanımlanan Caltech profesörü Hassibi tarafından yönetiliyor ve Ion Stoica'yı danışman olarak listeliyor.
Stoica'nın tezi, yerel çıkarımın kullanıcı düzeyindeki ekonomiyi ve gizlilik modelini değiştirdiğidir. “Artık parmaklarınızın ucunda zeka olacak ve bu, zaten satın aldığınız cihazda çalışacağı için ücretsiz olacak. Ayrıca gizli olacak, çünkü bunu buluta göndermeyeceksiniz,” dedi.
Yüzlerce Milyar Parametreye Giden Yol—ve Açık Sorular
PrismML'nin bir sonraki kilometre taşı ölçek. Hassibi, şirketin önümüzdeki birkaç ay içinde “several-hundred-billion-parameter” aralığında sıkıştırılmış modeller yayınlamasını beklediğini söyledi ve ekledi: “Umuyorum ki önümüzdeki birkaç ay içinde yayınlayacağımız bir sonraki modeller, several-hundred-billion-parameter aralığında olacak ve orada zekayı korumanın daha kolay olacağını düşünüyorum.”
Ayrıca, daha büyük modellerin kalite kaybı olmadan sıkıştırılmasının daha kolay olabileceğini savundu: “Onları sıkıştırmak için daha fazla alan var, bu nedenle genel bir eğilim olarak, daha büyük modeller için %100'e ulaşmak daha kolay.” PrismML, %100 benchmark eşitliğini belirsiz bir şekilde çerçeveliyor ve şirketin kendi yorumları, bazı bozulmaların yapısal olabileceğini öne sürüyor.
Kısa vadeli açık sorular pratik, felsefi değil. PrismML, burada desteklenen donanım listesi veya cihaz düzeyinde benchmarklar yayınlamadı ve akıllı telefon açısı “muhtemelen” olarak kalıyor, gösterilmedi. Bağımsız çoğaltma da önemlidir çünkü gerçek ayak izi ve performans, çalışma zamanı seçimlerine, kuantizasyon detaylarına ve görevleri değerlendirmek için kullanılan kıskaçlara bağlı olabilir.
Ayrıca doğrulanmamış anlaşma dedikoduları var. PrismML'in Apple ile görüşmelerde olduğu söyleniyor, ancak Hassibi yorum yapmayı reddetti ve herhangi bir ortaklık veya entegrasyon zaman çizelgesini belirsiz bıraktı.
Benim Görüşüm: Sıkıştırma İlerlemesi Gerçek, ancak Benchmarklar ve Donanım Kanıtı Ticaretin Belirleyicisi Olacak
Önemli olan eşik, 5.9 GB iddiasının gerçek iş yüklerinde tekrarlanabilir, cihaz düzeyinde performansa dönüşüp dönüşmediğidir, sadece toplam benchmark eşitliği değil. %95'ten %98'e geçiş, PrismML'in genellikle sıkıştırma çabalarını bozan, agresif boyut kesintileri altında kalite koruma kısmında hızlı bir şekilde iterasyon yaptığını öne sürüyor.
Eğer PrismML, güvenilir donanım doğrulaması yayınlayabilirse ve birkaç yüz milyar parametreli modellere geçerken iddialarına yakın bir eşitlik koruyabilirse, kurulum yapısal görünmeye başlar; kenar dağıtımı ve gizlilik öncelikli çıkarım, şu anda bulut GPU'larını varsayan bir dizi “akıl yürütme” iş yükü için varsayılan dağıtım yolu haline gelir.