Rows of server racks with illuminated components
هوش مصنوعی

ماشین‌های اندیشمند، مدل Inkling با وزن‌های آزاد منتشر کرد

شرکت می‌گوید تنها ~41 میلیارد پارامتر برای هر توکن فعال است و ردپای حافظه‌ای بین 2TB تا 600GB برای استقرار منتشر می‌کند.

نوشته Elliot Marsh6 دقیقه مطالعه

شرکت Thinking Machines مدل Inkling را منتشر کرده است، یک مدل Mixture-of-Experts که از صفر ساخته شده و می‌گوید که در مجموع 975 میلیارد پارامتر دارد در حالی که به طور تقریبی 41 میلیارد پارامتر را برای هر توکن فعال می‌کند. وزن‌ها به عنوان موجود در Hugging Face تحت مجوز Apache 2.0 توصیف شده‌اند، به همراه الزامات حافظه GPU به طور غیرمعمول صریح که "باز بودن" مدل را به محدودیت‌های واقعی پیاده‌سازی متصل می‌کند.

نکات کلیدی

  • شرکت Thinking Machines مدل Inkling را در تاریخ 15 ژوئیه 2026 منتشر کرد و آن را به عنوان اولین مدل شرکت که از صفر آموزش دیده است، معرفی کرد.
  • مدل Inkling به عنوان یک مدل Mixture-of-Experts با 975 میلیارد پارامتر توصیف شده است که به طور تقریبی 41 میلیارد پارامتر فعال برای هر توکن دارد و از مسیریابی پراکنده به جای محاسبات متراکم استفاده می‌کند.
  • معماری به عنوان 66 لایه با 256 کارشناس در هر لایه مشخص شده است، که شش کارشناس را برای هر توکن و دو کارشناس مشترک که بر روی هر توکن اجرا می‌شوند، مسیریابی می‌کند.
  • پایه‌های پیاده‌سازی به طور مستقیم بیان شده‌اند: حدود 2 ترابایت حافظه GPU ترکیبی برای دقت کامل و حدود 600 گیگابایت برای یک نقطه بررسی کمی شده.

مدل Inkling به عنوان یک انتشار MoE از صفر تحت مجوز Apache 2.0 منتشر می‌شود.

شرکت Thinking Machines مدلی به نام Inkling را در تاریخ 15 ژوئیه 2026 منتشر کرد. این شرکت به عنوان ارائه‌دهنده وزن‌ها در Hugging Face تحت مجوز Apache 2.0 توصیف شده است، که معمولاً اجازه استفاده و تغییرات گسترده را با توجه به شرایط مجوز می‌دهد.

مدل Inkling به عنوان یک سیستم Mixture-of-Experts (MoE) معرفی شده است، به این معنی که مدل بسیاری از "کارشناسان" پارامتر را ذخیره می‌کند اما فقط یک زیرمجموعه را برای هر توکن تولید شده اجرا می‌کند. اندازه‌گیری اصلی در تجزیه و تحلیل فنی فاصله بین تعداد کل پارامتر 975 میلیارد و تقریباً 41 میلیارد پارامتر درگیر در پردازش هر توکن منفرد، یا حدود 4% فعال در یک زمان است.

جزئیات بسته از یک تجزیه و تحلیل فنی ثانویه می‌آید که به طور صریح هشدار می‌دهد که از "جزئیات به اشتراک گذاشته شده عمومی از منابع مختلف" جمع‌آوری شده است و از خوانندگان می‌خواهد که نادرستی‌ها را علامت‌گذاری کنند. ارجاعات زیرین و آثار اصلی انتشار در اینجا گنجانده نشده‌اند، بنابراین مکانیزم واضح است اما تأیید مستقیم محدود به آنچه در گزیده است، می‌باشد.

اعداد مورد توجه معامله‌گران: ۲TB دقت کامل، ~۶۰۰GB کمی‌سازی شده

انتشار Inkling مانند یک داستان زیرساختی است زیرا ردپای حافظه‌ی ملموس را به نقاط چک‌پوینت مدل متصل می‌کند، نه فقط تعداد پارامترها. تجزیه و تحلیل نشان می‌دهد که چک‌پوینت دقت کامل به حداقل ۲ TB حافظه‌ی ترکیبی GPU نیاز دارد، که به عنوان هشت کارت NVIDIA B300 یا شانزده کارت H200 ارائه شده است. همچنین یک چک‌پوینت کمی‌سازی شده در حدود ۶۰۰ GB توصیف می‌شود که روی چهار کارت B300 جا می‌گیرد.

این اعداد مهم هستند زیرا “وزن‌های باز” را به یک مشکل برنامه‌ریزی ظرفیت تبدیل می‌کنند. اگر یک مدل قابل دانلود و اجرا باشد، معامله‌گران می‌توانند آن ادعا را به یک صورت‌حساب سخت‌افزاری تقریبی متصل کنند، سپس به اقتصاد استنتاج میزبانی شده و سپس به تقاضا برای ظرفیت GPU و انباشت‌هایی که آن را ارائه می‌دهند. یک عدد ۹۷۵B می‌تواند به تنهایی سوخت داستان باشد، اما یک نیاز ۲TB یک محدودیت است که در تأمین، برنامه‌ریزی colo و قیمت‌گذاری ظاهر می‌شود.

MoE پل بین این دو واقعیت است. طراحی Inkling به عنوان جداسازی هزینه ذخیره‌سازی از هزینه استنتاج به ازای هر توکن توصیف می‌شود: شما هنوز هم باید چک‌پوینت کامل را در حافظه بارگذاری کنید تا آن را اجرا کنید، اما هر توکن تنها یک بخش کوچک از پارامترها را فعال می‌کند. این دلیل این است که چرا یک مدل می‌تواند روی کاغذ “بسیار بزرگ” باشد در حالی که هزینه اجرای آن به ازای هر توکن کمتر از آنچه تعداد کل پارامترها نشان می‌دهد، است.

چگونه Inkling به ۱M توکن می‌رسد: ۵۵ لایه‌ی پنجره‌ی لغزشی و ۱۱ لایه‌ی توجه کامل

Inkling به عنوان پشتیبانی از یک پنجره‌ی متنی یک میلیون توکن توصیف می‌شود، که حداکثر مقدار متنی است که می‌تواند به طور همزمان در نظر گرفته شود. مکانیزمی که برای ممکن ساختن این ارائه شده، پراکندگی توجه است: بیشتر لایه‌ها از توجه پنجره‌ی لغزشی استفاده می‌کنند، جایی که هر توکن تنها به یک دامنه‌ی محدود اخیر توجه می‌کند، و تعداد کمتری از لایه‌ها از توجه کامل استفاده می‌کنند، جایی که توکن‌ها می‌توانند به کل توالی قبلی توجه کنند.

تجزیه و تحلیل یک تناوب ۵:۱ بین لایه‌های پنجره‌ی لغزشی و لایه‌های توجه کامل را توصیف می‌کند. همچنین یادداشت‌های ادغام vLLM را ذکر می‌کند که اعداد را بر روی تقسیم قرار می‌دهد: ۵۵ لایه‌ی پنجره‌ی لغزشی و ۱۱ لایه‌ی توجه کامل از ۶۶ لایه‌ی کل.

این یک معامله‌ی معماری خاص است، نه یک ادعای بازاریابی به تنهایی. لایه‌های پنجره‌ی لغزشی از انفجار محاسبات با طول توالی جلوگیری می‌کنند، اما همچنین خطر از دست دادن یادآوری بلندمدت را به همراه دارند زیرا حقایق دور در بیشتر لایه‌ها به طور مستقیم قابل مشاهده نیستند. لایه‌های توجه کامل دوره‌ای، راه فرار هستند و نقاط “به‌روزرسانی” جهانی را فراهم می‌کنند که در آن اطلاعات از زمان‌های بسیار قبل می‌تواند به جلو کشیده شده و سپس دوباره به صورت محلی حمل شود.

چه چیزی را قبل از اینکه بازارها آن را قیمت‌گذاری کنند، باید تأیید کرد: منابع، برش، و معیارهای گمشده

مسئله‌ی اصلی برای در نظر گرفتن Inkling به عنوان یک کاتالیزور، تأیید آثار اولیه است. بسته شامل یک کارت مدل Thinking Machines نیست، یک Hugging Face مستقیم.لینکیا اسناد مرجع پشت استنادهای داخل براکت، بنابراین اولین نقطه تأیید، صفحه مدل واقعی و شرایط دقیق مجوز و استفاده Apache 2.0 مرتبط با وزن‌ها است.

قطعه دوم گم شده، شواهد عملکرد است. هیچ بنچمارک، عدد تأخیر، ادعای توان عملیاتی یا ارزیابی‌های طولانی‌مدت در بسته ارائه نشده است و بخش نقل قول در میانه بحث درباره کدگذاری موقعیت قطع شده است. ارزیابی‌های شخص ثالث، به ویژه آزمایش‌هایی که رفتار طولانی‌مدت را در نزدیکی پنجره یک میلیون توکن بررسی می‌کنند، سریع‌ترین راه برای تفکیک "پشتیبانی از 1M توکن" از "پذیرش 1M توکن اما فراموش کردن آنچه مهم است" خواهد بود.

سومین تأیید، قابلیت استقرار در پاهای مشخص شده است. تجزیه و تحلیل اهداف حافظه خاصی را برای چک‌پوینت‌های دقت کامل و کمینه‌سازی شده ارائه می‌دهد و به یادداشت‌های ادغام vLLM برای تقسیم توجه 55/11 اشاره می‌کند.

گزارش‌های موفقیت‌آمیز در این پیکربندی‌ها، به علاوه شواهدی که نشان می‌دهد استک‌های استنتاج رایج الگوی توجه را همان‌طور که توصیف شده است، مدیریت می‌کنند، اعتماد به این که این یک مدل است که مردم واقعاً می‌توانند میزبانی کنند نه فقط دانلود، را تقویت می‌کند.

خوانش من: وزن‌های باز + پاهای مشخص، حلقه بازخورد بین راه‌اندازی مدل‌ها و تجارت‌های محاسباتی را تنگ‌تر می‌کند.

بخشی که تصمیم می‌گیرد آیا Inkling برای بازارها مهم است یا نه، سرخط 975B نیست، بلکه ترکیب فعال‌سازی پراکنده و پاهای استقرار مشخص است. یک مدل MoE که تنها ~41B پارامتر را در هر توکن فعال می‌کند، می‌تواند به طور منطقی منحنی هزینه به ازای هر توکن را بدون از دست دادن جاذبه بازاری "نزدیک به یک تریلیون پارامتر" تغییر دهد و این دقیقاً نوعی ابهام است که معامله‌گران معمولاً باید حدس بزنند.

آستانه‌ای که مهم است این است که آیا فهرست Apache 2.0 Hugging Face و ادعای حافظه 2TB تا 600GB در استقرارهای واقعی برقرار است یا خیر، سپس توسط تنظیمات دقیق، انواع کمینه‌سازی و پیشنهادات استنتاج میزبانی شده تکرار می‌شود. اگر این تأییدات به دست آید، "باز طولانی‌مدت" دیگر یک روایت نخواهد بود و شروع به تبدیل شدن به یک ورودی قابل اندازه‌گیری ظرفیت GPU خواهد کرد که می‌تواند در سراسر استک منتقل شود.

منابع