
ماشینهای اندیشمند، مدل Inkling با وزنهای آزاد منتشر کرد
شرکت میگوید تنها ~41 میلیارد پارامتر برای هر توکن فعال است و ردپای حافظهای بین 2TB تا 600GB برای استقرار منتشر میکند.
شرکت Thinking Machines مدل Inkling را منتشر کرده است، یک مدل Mixture-of-Experts که از صفر ساخته شده و میگوید که در مجموع 975 میلیارد پارامتر دارد در حالی که به طور تقریبی 41 میلیارد پارامتر را برای هر توکن فعال میکند. وزنها به عنوان موجود در Hugging Face تحت مجوز Apache 2.0 توصیف شدهاند، به همراه الزامات حافظه GPU به طور غیرمعمول صریح که "باز بودن" مدل را به محدودیتهای واقعی پیادهسازی متصل میکند.
نکات کلیدی
- شرکت Thinking Machines مدل Inkling را در تاریخ 15 ژوئیه 2026 منتشر کرد و آن را به عنوان اولین مدل شرکت که از صفر آموزش دیده است، معرفی کرد.
- مدل Inkling به عنوان یک مدل Mixture-of-Experts با 975 میلیارد پارامتر توصیف شده است که به طور تقریبی 41 میلیارد پارامتر فعال برای هر توکن دارد و از مسیریابی پراکنده به جای محاسبات متراکم استفاده میکند.
- معماری به عنوان 66 لایه با 256 کارشناس در هر لایه مشخص شده است، که شش کارشناس را برای هر توکن و دو کارشناس مشترک که بر روی هر توکن اجرا میشوند، مسیریابی میکند.
- پایههای پیادهسازی به طور مستقیم بیان شدهاند: حدود 2 ترابایت حافظه GPU ترکیبی برای دقت کامل و حدود 600 گیگابایت برای یک نقطه بررسی کمی شده.
مدل Inkling به عنوان یک انتشار MoE از صفر تحت مجوز Apache 2.0 منتشر میشود.
شرکت Thinking Machines مدلی به نام Inkling را در تاریخ 15 ژوئیه 2026 منتشر کرد. این شرکت به عنوان ارائهدهنده وزنها در Hugging Face تحت مجوز Apache 2.0 توصیف شده است، که معمولاً اجازه استفاده و تغییرات گسترده را با توجه به شرایط مجوز میدهد.
مدل Inkling به عنوان یک سیستم Mixture-of-Experts (MoE) معرفی شده است، به این معنی که مدل بسیاری از "کارشناسان" پارامتر را ذخیره میکند اما فقط یک زیرمجموعه را برای هر توکن تولید شده اجرا میکند. اندازهگیری اصلی در تجزیه و تحلیل فنی فاصله بین تعداد کل پارامتر 975 میلیارد و تقریباً 41 میلیارد پارامتر درگیر در پردازش هر توکن منفرد، یا حدود 4% فعال در یک زمان است.
جزئیات بسته از یک تجزیه و تحلیل فنی ثانویه میآید که به طور صریح هشدار میدهد که از "جزئیات به اشتراک گذاشته شده عمومی از منابع مختلف" جمعآوری شده است و از خوانندگان میخواهد که نادرستیها را علامتگذاری کنند. ارجاعات زیرین و آثار اصلی انتشار در اینجا گنجانده نشدهاند، بنابراین مکانیزم واضح است اما تأیید مستقیم محدود به آنچه در گزیده است، میباشد.
اعداد مورد توجه معاملهگران: ۲TB دقت کامل، ~۶۰۰GB کمیسازی شده
انتشار Inkling مانند یک داستان زیرساختی است زیرا ردپای حافظهی ملموس را به نقاط چکپوینت مدل متصل میکند، نه فقط تعداد پارامترها. تجزیه و تحلیل نشان میدهد که چکپوینت دقت کامل به حداقل ۲ TB حافظهی ترکیبی GPU نیاز دارد، که به عنوان هشت کارت NVIDIA B300 یا شانزده کارت H200 ارائه شده است. همچنین یک چکپوینت کمیسازی شده در حدود ۶۰۰ GB توصیف میشود که روی چهار کارت B300 جا میگیرد.
این اعداد مهم هستند زیرا “وزنهای باز” را به یک مشکل برنامهریزی ظرفیت تبدیل میکنند. اگر یک مدل قابل دانلود و اجرا باشد، معاملهگران میتوانند آن ادعا را به یک صورتحساب سختافزاری تقریبی متصل کنند، سپس به اقتصاد استنتاج میزبانی شده و سپس به تقاضا برای ظرفیت GPU و انباشتهایی که آن را ارائه میدهند. یک عدد ۹۷۵B میتواند به تنهایی سوخت داستان باشد، اما یک نیاز ۲TB یک محدودیت است که در تأمین، برنامهریزی colo و قیمتگذاری ظاهر میشود.
MoE پل بین این دو واقعیت است. طراحی Inkling به عنوان جداسازی هزینه ذخیرهسازی از هزینه استنتاج به ازای هر توکن توصیف میشود: شما هنوز هم باید چکپوینت کامل را در حافظه بارگذاری کنید تا آن را اجرا کنید، اما هر توکن تنها یک بخش کوچک از پارامترها را فعال میکند. این دلیل این است که چرا یک مدل میتواند روی کاغذ “بسیار بزرگ” باشد در حالی که هزینه اجرای آن به ازای هر توکن کمتر از آنچه تعداد کل پارامترها نشان میدهد، است.
چگونه Inkling به ۱M توکن میرسد: ۵۵ لایهی پنجرهی لغزشی و ۱۱ لایهی توجه کامل
Inkling به عنوان پشتیبانی از یک پنجرهی متنی یک میلیون توکن توصیف میشود، که حداکثر مقدار متنی است که میتواند به طور همزمان در نظر گرفته شود. مکانیزمی که برای ممکن ساختن این ارائه شده، پراکندگی توجه است: بیشتر لایهها از توجه پنجرهی لغزشی استفاده میکنند، جایی که هر توکن تنها به یک دامنهی محدود اخیر توجه میکند، و تعداد کمتری از لایهها از توجه کامل استفاده میکنند، جایی که توکنها میتوانند به کل توالی قبلی توجه کنند.
تجزیه و تحلیل یک تناوب ۵:۱ بین لایههای پنجرهی لغزشی و لایههای توجه کامل را توصیف میکند. همچنین یادداشتهای ادغام vLLM را ذکر میکند که اعداد را بر روی تقسیم قرار میدهد: ۵۵ لایهی پنجرهی لغزشی و ۱۱ لایهی توجه کامل از ۶۶ لایهی کل.
این یک معاملهی معماری خاص است، نه یک ادعای بازاریابی به تنهایی. لایههای پنجرهی لغزشی از انفجار محاسبات با طول توالی جلوگیری میکنند، اما همچنین خطر از دست دادن یادآوری بلندمدت را به همراه دارند زیرا حقایق دور در بیشتر لایهها به طور مستقیم قابل مشاهده نیستند. لایههای توجه کامل دورهای، راه فرار هستند و نقاط “بهروزرسانی” جهانی را فراهم میکنند که در آن اطلاعات از زمانهای بسیار قبل میتواند به جلو کشیده شده و سپس دوباره به صورت محلی حمل شود.
چه چیزی را قبل از اینکه بازارها آن را قیمتگذاری کنند، باید تأیید کرد: منابع، برش، و معیارهای گمشده
مسئلهی اصلی برای در نظر گرفتن Inkling به عنوان یک کاتالیزور، تأیید آثار اولیه است. بسته شامل یک کارت مدل Thinking Machines نیست، یک Hugging Face مستقیم.لینکیا اسناد مرجع پشت استنادهای داخل براکت، بنابراین اولین نقطه تأیید، صفحه مدل واقعی و شرایط دقیق مجوز و استفاده Apache 2.0 مرتبط با وزنها است.
قطعه دوم گم شده، شواهد عملکرد است. هیچ بنچمارک، عدد تأخیر، ادعای توان عملیاتی یا ارزیابیهای طولانیمدت در بسته ارائه نشده است و بخش نقل قول در میانه بحث درباره کدگذاری موقعیت قطع شده است. ارزیابیهای شخص ثالث، به ویژه آزمایشهایی که رفتار طولانیمدت را در نزدیکی پنجره یک میلیون توکن بررسی میکنند، سریعترین راه برای تفکیک "پشتیبانی از 1M توکن" از "پذیرش 1M توکن اما فراموش کردن آنچه مهم است" خواهد بود.
سومین تأیید، قابلیت استقرار در پاهای مشخص شده است. تجزیه و تحلیل اهداف حافظه خاصی را برای چکپوینتهای دقت کامل و کمینهسازی شده ارائه میدهد و به یادداشتهای ادغام vLLM برای تقسیم توجه 55/11 اشاره میکند.
گزارشهای موفقیتآمیز در این پیکربندیها، به علاوه شواهدی که نشان میدهد استکهای استنتاج رایج الگوی توجه را همانطور که توصیف شده است، مدیریت میکنند، اعتماد به این که این یک مدل است که مردم واقعاً میتوانند میزبانی کنند نه فقط دانلود، را تقویت میکند.
خوانش من: وزنهای باز + پاهای مشخص، حلقه بازخورد بین راهاندازی مدلها و تجارتهای محاسباتی را تنگتر میکند.
بخشی که تصمیم میگیرد آیا Inkling برای بازارها مهم است یا نه، سرخط 975B نیست، بلکه ترکیب فعالسازی پراکنده و پاهای استقرار مشخص است. یک مدل MoE که تنها ~41B پارامتر را در هر توکن فعال میکند، میتواند به طور منطقی منحنی هزینه به ازای هر توکن را بدون از دست دادن جاذبه بازاری "نزدیک به یک تریلیون پارامتر" تغییر دهد و این دقیقاً نوعی ابهام است که معاملهگران معمولاً باید حدس بزنند.
آستانهای که مهم است این است که آیا فهرست Apache 2.0 Hugging Face و ادعای حافظه 2TB تا 600GB در استقرارهای واقعی برقرار است یا خیر، سپس توسط تنظیمات دقیق، انواع کمینهسازی و پیشنهادات استنتاج میزبانی شده تکرار میشود. اگر این تأییدات به دست آید، "باز طولانیمدت" دیگر یک روایت نخواهد بود و شروع به تبدیل شدن به یک ورودی قابل اندازهگیری ظرفیت GPU خواهد کرد که میتواند در سراسر استک منتقل شود.