A graphics card in the foreground with a laptop
人工智能

Nvidia开源Nemotron 3.5 Lightning,推出单GPU“免费AI”

该模型可以免费下载、使用和修改,并配备了旨在代理式推理的NeMo Switchyard路由。

作者:Elliot Marsh阅读 6 分钟

英伟达于8月11日发布了Nemotron 3.5 Lightning,作为一个开源AI模型,称其为“轻量级”,能够在笔记本或台式机的单个GPU上运行。该公司将此次发布框定为“免费AI”,旨在扩大推理使用,同时仍然推动对GPU的需求。

关键要点

  • Nemotron 3.5 Lightning是英伟达新发布的开源模型,描述为“轻量级”,旨在在笔记本或台式机设置中运行于单个GPU上。
  • 英伟达允许公司下载、使用和修改该模型,无需许可或支付,将其定位为本地推理的无摩擦入口。
  • 该公司表示,它使用蒸馏技术使较小的Lightning模型具备与较大Nemotron模型类似的能力。
  • 分发将通过HuggingFace和英伟达的网站进行,配合NeMo Switchyard软件,选择“最便宜和最合适”的模型以完成特定任务。

Nemotron 3.5 Lightning:英伟达的单GPU、可免费修改的开放模型

英伟达于8月11日发布了Nemotron 3.5 Lightning,称其为“轻量级”的开源AI模型,能够在笔记本或台式机的单个GPU上运行。其定位明确:本地单机推理,而非仅限于云端的按需付费API。API姿态。

商业条款是机制的另一半。Nvidia表示,该模型可以免费供公司下载、使用和修改,“无需获得许可或支付Nvidia费用”,这消除了通常会减缓采用的两个障碍:许可谈判和按令牌定价。

Nvidia还将发布与特定的构建技术联系在一起。公司代表表示,使用了蒸馏技术,使Nemotron 3.5 Lightning具备与更大Nemotron模型“类似的能力”,这一说法很重要,因为该模型是以效率而非原始规模进行销售的。

“免费AI”作为GPU需求策略——以及它对加密计算叙事的重要性

Nvidia的论点是,开放分发并不会蚕食硬件需求,而是扩大了需求。该公司的论据很简单:即使是“免费”的模型仍然需要在某个地方运行,降低推理的边际成本可以增加与专有替代方案相比的总使用量。

首席执行官黄仁勋对这一框架表现得异常直接。在七月的采访中,他表示:“免费AI应该对硬件有很大好处。免费AI应该对芯片有很大好处。”这就是支持单GPU模型的赌注,该模型可以在开发者工作站、小型企业服务器或运行后台任务的专用设备上运行。

对于加密交易者而言,相关性不在于某个模型的基准分数,而在于它所暗示的需求形态。如果本地推理变得足够便宜以至于可以始终在线,计算需求将从突发的集中式API调用转变为更像基础设施支出的持续工作负载。这种叙述对市场如何定价GPU稀缺性、DePIN计算网络以及“人工智能代理“依赖于持续推理而非偶尔提示的代币故事。”

问题在于,摘录的发布细节并没有量化这些内容。没有披露的参数数量,没有发布的基准测试,也没有采用指标,因此“免费AI驱动更多GPU”的说法仍然是一个战略性声明,而不是一个经过衡量的结果。

分发、代理和NeMo开关场:降低始终在线推理的摩擦

英伟达正在通过使模型可操作的渠道推动Nemotron 3.5 Lightning,而不仅仅是宣布。该公司表示,该模型将在HuggingFace和英伟达自己的官网上提供,这是希望提取权重、微调和部署而不依赖于托管服务的开发者的实际路径。

产品框架也倾向于代理。英伟达表示,该模型特别为AI代理开发,这意味着可以在后台自主运行的程序。这很重要,因为代理在设计上是推理密集型的:它们持续工作,调用工具,并生成许多小输出,其中每个任务的成本占主导地位。

除了模型,英伟达还发布了NeMo Switchyard软件,称其可以确定给定任务的“最便宜和最合适”的AI模型。从机制上讲,这是一种路由层:而不是将每个请求默认指向可用的最大模型,当任务允许时,工作负载可以被引导到更小或更便宜的模型。

这个路由故事对英伟达来说是双刃剑。如果Switchyard在仍然在英伟达GPU上运行最佳的菜单中进行优化,它可以增加总推理量,并将工作负载固定在英伟达的技术栈上。如果它成为一个中立的中介,当替代方案更便宜时,它会绕过英伟达硬件,这将成为竞争对手可以利用的楔子。摘录中没有具体说明Switchyard是如何做出决策的,或者它可以跨越哪些模型集进行路由。

关注信号:观察英伟达是否开源Nemotron 3.5 Lightning模型

第一个验证点是技术披露。英伟达是否发布基准测试、参数计数或第三方评估将决定交易者对“单GPU”和“类似能力”声明的重视程度,尤其是在延迟和工具使用可靠性重要的代理型工作负载中。

第二个是看起来像部署而不是摆弄的采用。英伟达表示,CrowdStrike、CodeRabbit和Harvey测试并定制了该模型,这是一个早期的企业信号,但市场希望看到可重复的模式:HuggingFace的吸引力、更多命名的生产用例,以及公司实际上在产品中交付Lightning的证据。

政策是可以迅速重新定价整个开放模型交易的悬而未决因素。该发布正值华盛顿辩论之中,该辩论在中国的Moonshot AI宣布Kimi K3后加剧,政治家们对蒸馏作为潜在知识产权盗窃途径表示担忧。任何新的美国声明或关于开放权重发布或蒸馏的提议限制将比营销周期更重要,因为它们可以改变“自由修改”在实践中的含义。

最后,关注NeMo Switchyard如何演变。更新将澄清如何确定“最便宜/最合适”的路由,以及默认设置是否将工作负载推向英伟达GPU,这将告诉交易者这是一个开发者便利功能还是一个有意控制推理支出的控制平面。

我的看法:开放模型正在成为竞争前沿,而不是慈善举动

决定这个故事的部分不是Nemotron 3.5 Lightning是否在严格的许可意义上是“开源”,而是Nvidia是否能够将开放权重转化为每天更多的推理分钟。一个可以自由修改的单GPU模型是一种规模化的玩法,而黄仁勋所说的“免费AI应该对芯片有利”是Nvidia所提供的最清晰的意图声明。

真正的考验在于路由层是否成为习惯。如果NeMo Switchyard最终坐在代理工作负载前,并且始终选择在Nvidia GPU上高效运行的模型,那么开放发布开始看起来像是一种扩展需求的分发策略,而不是一次性的公关姿态。

来源