
Thinking Machines, Apache 2.0 açık ağırlıklı Inkling'i…
Şirket, her token başına yalnızca ~41B parametrenin aktif olduğunu ve dağıtım için 2TB'tan 600GB'a kadar bellek ayak izleri yayınladığını belirtiyor.
Thinking Machines, toplamda 975 milyar parametreye sahip olduğunu söylediği ve her token başına yaklaşık 41 milyarını etkinleştiren sıfırdan bir Mixture-of-Experts modeli olan Inkling'i piyasaya sürdü. Ağırlıkların, modelin 'açıklığını' gerçek dağıtım kısıtlamalarına haritalayan alışılmadık derecede açık GPU bellek gereksinimleri ile birlikte Apache 2.0 lisansı altında Hugging Face'te mevcut olduğu belirtiliyor.
Ana Noktalar
- Thinking Machines, 15 Temmuz 2026'da sıfırdan eğitilen ilk modeli olarak Inkling'i piyasaya sürdü.
- Inkling, her token için yaklaşık 41B parametre etkinleştirerek, seyrek yönlendirme kullanan 975B-parametreli bir Mixture-of-Experts modeli olarak tanımlanıyor.
- Mimari, her katmanda 256 uzman ile 66 katman olarak belirtiliyor, her token için altı uzman yönlendiriliyor ve her token üzerinde çalışan iki paylaşılan uzman bulunuyor.
- Dağıtım ayak izleri doğrudan belirtiliyor: tam hassasiyet için yaklaşık 2TB birleşik GPU belleği ve nicelleştirilmiş bir kontrol noktası için yaklaşık 600GB.
Inkling, Apache 2.0 lisansı altında sıfırdan bir MoE sürümü olarak geliyor.
Thinking Machines, 15 Temmuz 2026'da Inkling adında bir model piyasaya sürdü. Şirket, ağırlıkları Apache 2.0 lisansı altında Hugging Face'te mevcut hale getirdiği belirtiliyor; bu genellikle lisans şartlarına tabi olarak geniş yeniden kullanım ve değişikliklere izin verir.
Inkling, birçok parametre 'uzmanı' depolayan ancak her üretilen token için yalnızca bir alt kümesini çalıştıran bir Mixture-of-Experts (MoE) sistemi olarak çerçeveleniyor. Teknik ayrıntılardaki başlık boyutu, toplam 975 milyar parametre sayısı ile herhangi bir tek token'ı işlemek için yaklaşık 41 milyar parametre arasındaki farktır; yani bir seferde yaklaşık %4'ü aktiftir.
Paketin detayları, 'çeşitli kaynaklardan kamuya açık olarak paylaşılan detaylardan' derlendiğini açıkça belirten ikincil bir teknik ayrıntıdan gelmektedir ve okuyuculardan yanlışlıkları bildirmeleri istenmektedir. Temel referanslar ve birincil sürüm belgeleri burada yer almamaktadır, bu nedenle mekanizma net ancak doğrudan doğrulama, alıntıda bulunanlarla sınırlıdır.
Tüccarların odaklanacağı sayılar: 2TB tam hassasiyet, ~600GB kuantize
Inkling'in sürümü, yalnızca parametre sayılarıyla değil, model kontrol noktalarına somut bellek ayak izleri eklediği için bir altyapı hikayesi gibi okunuyor. Ayrıntılar, tam hassasiyet kontrol noktasının en az 2 TB birleşik GPU belleği gerektirdiğini belirtmektedir; bu, sekiz NVIDIA B300 kartı veya on altı H200 kartı olarak verilmiştir. Ayrıca, dört B300 kartına sığan yaklaşık 600 GB'lık bir kuantize kontrol noktasını da tanımlamaktadır.
Bu rakamlar önemlidir çünkü "açık ağırlıkları" bir kapasite planlama sorununa dönüştürür. Bir model indirilebilir ve çalıştırılabilir olduğunda, tüccarlar bu iddiayı kaba bir donanım malzeme listesine, ardından barındırılan çıkarım ekonomisine ve ardından GPU kapasitesine ve onu hizmet eden yığınlara eşleyebilirler.
975B başlık numarası kendi başına bir anlatı yakıtı olabilir, ancak 2TB gereksinimi, tedarik, colo planlama ve fiyatlandırmada ortaya çıkan bir kısıtlamadır.
MoE, bu iki gerçeklik arasında bir köprüdür. Inkling'in tasarımı, depolama maliyetini token başına çıkarım maliyetinden ayıracak şekilde tanımlanmıştır: çalıştırmak için tam kontrol noktasını belleğe yüklemeniz gerekir, ancak her token yalnızca parametrelerin küçük bir kısmını etkinleştirir.
Bu, bir modelin kağıt üzerinde "çok büyük" olmasının nedeninin, toplam parametre sayısının önerdiğinden daha ucuz bir şekilde çalıştırılabileceği için bir argümandır.
Inkling'in 1M token'a ulaşma şekli: 55 kaydırmalı pencere katmanı ve 11 tam dikkat katmanı
Inkling, aynı anda dikkate alabileceği maksimum metin miktarı olan bir milyon token bağlam penceresini desteklediği şeklinde tanımlanmaktadır. Bunu mümkün kılmak için sunulan mekanizma dikkat seyrekliğidir: çoğu katman, her token'ın yalnızca sınırlı bir yakın aralığa dikkat ettiği kaydırmalı pencere dikkatini kullanır ve daha az sayıda katman tam dikkati kullanır; burada token'lar önceki dizinin tamamına dikkat edebilir.
Ayrıntılar, kaydırmalı pencere katmanları ile tam dikkat katmanları arasında 5:1 bir dönüşüm tanımlamaktadır. Ayrıca, bölünmeye sayılar koyan vLLM entegrasyon notlarını da belirtmektedir: toplam 66 katmandan 55 kaydırmalı pencere katmanı ve 11 tam dikkat katmanı.
Bu, tek başına bir pazarlama iddiası değil, belirli bir mimari ticarettir. Kaydırmalı pencere katmanları, dizinin uzunluğu ile hesaplamanın patlamasını önler, ancak aynı zamanda uzak gerçeklerin çoğu katmanda doğrudan görünmediği için uzun menzilli hatırlama kaybı riski taşır. Periyodik tam dikkat katmanları, daha önceki diziden bilgi çekilebileceği ve ardından yerel olarak tekrar taşınabileceği küresel "yenileme noktaları" sağlar.
Pazarlar bunu fiyatlandırmadan önce doğrulanması gerekenler: kaynaklar, kesme ve eksik kıyaslamalar
Inkling'i bir katalizör olarak ele almanın ana sorunu, birincil eserlerin doğrulanmasıdır. Paket, doğrudan Hugging Face ile bir Thinking Machines model kartı içermemektedir.bağlantı, veya alıntının köşeli alıntılarının arkasındaki belgeler, bu nedenle ilk doğrulama noktası, ağırlıklara ekli Apache 2.0 lisanslama ve kullanım koşullarına sahip gerçek model sayfasıdır.
İkinci eksik parça performans kanıtıdır. Pakette herhangi bir kıyaslama, gecikme sayıları, verimlilik iddiaları veya uzun bağlam değerlendirmeleri sağlanmamış ve alıntı, konum kodlaması tartışmasının ortasında kesilmiştir.
Üçüncü taraf değerlendirmeleri, özellikle bir milyon token penceresi yakınındaki uzun bağlam davranışını sorgulayan testler, "1M token destekliyor" ile "1M token kabul ediyor ama önemli olanı unutuyor" arasındaki ayrımı yapmanın en hızlı yolu olacaktır.
Üçüncü doğrulama, belirtilen ayak izlerinde dağıtılabilirliktir. Ayrıntılar, tam hassasiyet ve kuantize edilmiş kontrol noktaları için belirli bellek hedefleri verir ve 55/11 dikkat bölmesi için vLLM entegrasyon notlarına atıfta bulunur.
Bu yapılandırmalarda başarılı çalışmalara dair raporlar ve yaygın çıkarım yığınlarının belirtilen dikkat desenini işlediğine dair kanıtlar, bunun insanların yalnızca indirmekle kalmayıp gerçekten barındırabileceği bir model olduğunu doğrulama güvenini artırır.
Benim okuma şeklim: açık ağırlıklar + açık ayak izleri, model lansmanları ile hesap ticaretleri arasındaki geri bildirim döngüsünü sıkılaştırır.
Inkling'in piyasalara önemli olup olmadığını belirleyen kısım, 975B başlığı değil, seyrek aktivasyon ve açık dağıtım ayak izlerinin birleşimidir. Her token başına yalnızca ~41B parametreyi etkinleştiren bir MoE modeli, "neredeyse bir trilyon parametre" pazarlama havasını kaybetmeden token başına maliyet eğrisini makul bir şekilde değiştirebilir ve bu, genellikle tüccarların tahmin etmesi gereken türden bir belirsizliktir.
Önemli olan eşik, Apache 2.0 Hugging Face listesinin ve 2TB'tan 600GB'a bellek iddialarının gerçek dağıtımlarda geçerli olup olmadığıdır, ardından bunlar ince ayarlar, kuantizasyon varyantları ve barındırılan çıkarım teklifleri tarafından yankılanır. Bu doğrulamalar gelirse, "açık uzun bağlam" bir anlatı olmaktan çıkar ve yığın boyunca yayılabilen ölçülebilir bir GPU kapasitesi girişi haline gelir.