Rows of server racks with illuminated components
人工智能

Thinking Machines发布975B MoE模型Inkling,开源权重

该公司表示,每个令牌仅有约41亿个参数处于活动状态,并发布了2TB到600GB的内存占用以供部署。

作者:Elliot Marsh阅读 6 分钟

思考机器公司发布了Inkling,这是一个从零开始的专家混合模型,声称总参数量为9750亿,同时每个token激活大约410亿个参数。权重被描述为在Hugging Face上以Apache 2.0许可证提供,并附有异常明确的GPU内存要求,将模型的“开放性”与实际部署限制相映射。

关键要点

  • 思考机器公司于2026年7月15日发布了Inkling,将其定位为公司首个从零开始训练的模型。
  • Inkling被描述为一个975B参数的专家混合模型,每个token大约激活41B参数,使用稀疏路由而非密集计算。
  • 架构被指定为66层,每层256个专家,每个token路由六个专家,加上两个在每个token上运行的共享专家。
  • 部署足迹直接说明:全精度大约需要2TB的GPU内存,而量化检查点大约需要600GB。

Inkling作为Apache 2.0的从零开始的MoE发布

思考机器公司于2026年7月15日发布了一种名为Inkling的模型。该公司被描述为在Hugging Face上以Apache 2.0许可证提供权重,这通常允许在许可证条款下进行广泛的重用和修改。

Inkling被框定为一个专家混合(MoE)系统,这意味着模型存储了许多参数“专家”,但每个生成的token只运行一部分。技术细分中的主要规模是9750亿总参数计数与处理任何单个token时涉及的约410亿参数之间的差距,或者大约4%同时激活。

该数据包的详细信息来自一个次级技术细分,明确警告它是从“各种来源公开共享的细节”编译而成,并要求读者标记不准确之处。这里没有包含基础参考和主要发布文档,因此机制是明确的,但直接验证仅限于摘录中的内容。

交易者将关注的数字:2TB全精度,约600GB量化

Inkling的发布像是一个基础设施故事,因为它将具体的内存占用与模型检查点关联,而不仅仅是参数计数。细分说明全精度检查点至少需要2 TB的组合GPU内存,相当于八张NVIDIA B300卡或十六张H200卡。它还描述了一个约600 GB的量化检查点,可以放在四张B300卡上。

这些数字很重要,因为它们将“开放权重”转变为一个容量规划问题。如果一个模型可以被下载和运行,交易者可以将这一主张映射到粗略的硬件材料清单,然后映射到托管推理经济,再到对GPU容量的需求以及提供这些服务的堆栈。975B的头条数字本身可以成为叙述的燃料,但2TB的需求是一个在采购、数据中心规划和定价中显现的约束。

MoE是这两种现实之间的桥梁。Inkling的设计被描述为将存储成本与每个令牌的推理成本分开:你仍然需要将完整的检查点加载到内存中以运行它,但每个令牌仅激活一小部分参数。这就是为什么一个模型在纸面上可以“非常大”,而每个令牌的运行成本却低于其总参数计数所暗示的原因。

Inkling如何达到100万令牌:55个滑动窗口层和11个全注意力层

Inkling被描述为支持一百万令牌的上下文窗口,这是它一次可以考虑的最大文本量。实现这一目标的机制是注意力稀疏性:大多数层使用滑动窗口注意力,每个令牌仅关注有限的最近范围,而较少数的层使用全注意力,令牌可以关注整个先前序列。

细分描述了滑动窗口层与全注意力层之间的5:1交替。它还引用了vLLM集成笔记,给出了分割的数字:66个总层中有55个滑动窗口层和11个全注意力层。

这是一个具体的架构权衡,而不是孤立的市场营销主张。滑动窗口层防止计算随着序列长度的增加而爆炸,但它们也有失去长距离回忆的风险,因为在大多数层中,远处的事实并不直接可见。周期性的全注意力层是逃生口,提供全球“刷新点”,可以将序列中更早的信息向前提取,然后再次局部携带。

在市场定价之前需要验证的内容:来源、截断和缺失基准

将Inkling视为催化剂的关键问题是对主要文物的验证。该数据包不包括Thinking Machines模型卡,也没有直接的Hugging Face链接或引用文献后面括号内的文件,因此第一个确认点是实际的模型页面以及附加于权重的确切Apache 2.0许可和使用条款。

第二个缺失的部分是性能证据。数据包中没有基准测试、延迟数字、吞吐量声明或长上下文评估,摘录在讨论位置编码时被截断。第三方评估,特别是探测接近一百万令牌窗口的长上下文行为的测试,将是区分“支持1M令牌”和“接受1M令牌但忘记重要内容”的最快方式。

第三个确认是以所述足迹的可部署性。细分给出了全精度和量化检查点的具体内存目标,并参考了55/11注意力分割的vLLM集成说明。在这些配置上成功运行的报告,加上常见推理堆栈处理所描述的注意力模式的证据,将增强人们对这是一个可以实际托管而不仅仅是下载的模型的信心。

我的理解:开放权重 + 明确的足迹缩短了模型发布与计算交易之间的反馈循环。

决定Inkling对市场是否重要的部分不是975B的头条,而是稀疏激活和明确部署足迹的组合。一个每个令牌仅激活约41B参数的MoE模型可以合理地改变每个令牌的成本曲线,而不放弃“近乎一万亿参数”的营销光环,这正是交易者通常需要猜测的模糊性。

重要的阈值是Apache 2.0 Hugging Face列表和2TB到600GB内存声明在实际部署中是否成立,然后通过微调、量化变体和托管推理产品得到回应。如果这些确认到达,“开放长上下文”就不再是一个叙述,而是一个可以在堆栈中传播的可测量GPU容量输入。

来源