A dark room filled with computer servers and
人工智能

Moonshot的Kimi K3缩小前沿差距,压低美国代币价格

OpenRouter 和 Hugging Face 的数据显示,中国模型在这些渠道上占据了主导份额,因为美国的禁令讨论和 IPO 叙事相互交织。

作者:Elliot Marsh阅读 11 分钟

Moonshot的Kimi K3被定位为与Anthropic最先进的模型几乎平起平坐,同时运行成本却低得多,将成本推回前沿模型竞争的中心。OpenRouter和Hugging Face上的采用代理现在显示,中国模型在这些特定渠道上处于领先地位,这种混合引发了美国限制的讨论,并在美国AI IPO窗口之前复杂化了估值故事。

关键要点

  • Moonshot的Kimi K3被框架为几乎匹配Anthropic最先进的模型,同时每单位输出的收费远低于其成本。
  • 在开发者中,中国模型占Hugging Face生成模型下载的41.4%,比美国模型高出约5个百分点。
  • OpenRouter的每月代币份额指标显示,中国模型的使用在6月份超过了美国平台,并在上个月清除了60%的市场份额,尽管该数据集不包括直接到提供商的流量。
  • 一个标准化的“Brewberg”代理构建测试在大多数模型中产生了功能相当的网站,其中Claude Fable 5的成本约为50美元,而Kimi K3的成本为12美元。

Kimi K3的性价比冲击正值中国最新的“大片”模型问世之际。

Kimi K3是最新发布的中国模型,被视为一次变革,因为它将前沿相邻基准定位与看起来更像商品输入而非高端软件服务的定价相结合。该模型被描述为几乎匹配Anthropic最先进模型的能力,但成本却低得多,这种框架很重要,因为它将竞争轴心从“谁是最好的”转变为“谁在最低边际成本下足够接近”。

这种动态自早期中国发布以来一直在发展,尽管华盛顿收紧了对美国芯片销售到中国的控制,但中国模型在编码和推理方面迅速改善。关键不在于任何单一实验室是否保持领先,而在于发布节奏足够快,以至于差距可以在单一产品周期内缩小,成本成为持久的差异化因素。

这个机制很简单。如果买家能够在编码和代理工作流程上获得可比的任务完成,同时每个输出代币的支付显著降低,那么切换成本就变成了操作性而非技术性。这就是“几乎一样好”如何转变为“足够好”,尤其是在延迟、精致度和品牌信任是次要的背景任务中。

采用指标翻转:OpenRouter份额与Hugging Face下载混合

现在,两条独立的分销渠道朝着同一个方向发展:中国模型在开发者用来尝试、路由和下载模型的平台上占据了领先份额。

在OpenRouter上,这个平台提供对数百个模型的访问并发布广受关注的使用指标,6月份中国模型的使用首次在全球范围内超过了美国平台。相同的OpenRouter数据显示,上个月中国模型在OpenRouter上的月度代币份额超过了60%。

这个警告是结构性的,而不是表面的。OpenRouter 明确不捕获直接发送到提供者的流量,它仅代表全球 AI 使用的一部分。因此,这里的“市场份额”是指 OpenRouter 追踪的代币份额,而不是全球总消费量。尽管如此,这仍然是开发者在一个成本和延迟通常是首要过滤条件的环境中路由行为的真实信号。

Hugging Face,开放模型的默认托管和分发层,从不同的角度讲述了类似的故事。中国的AI模型在开发者中的生成模型下载中占据了41.4%,比美国模型高出约5个百分点,中国发布的模型被描述为该平台上生成模型下载的最大份额。

这两个指标测量的是不同的内容。OpenRouter 反映的是通过特定聚合器路由的使用情况。Hugging Face 反映的是下载量,这些下载偏向于开放权重分发和本地部署。重叠的地方在于:中国实验室在“立即尝试”渠道和“带回家”渠道上都取得了胜利。

基准测试与Brewberg构建:平价出现的地方与账单分歧的地方

基准测试虽然有噪音,但最近的快照显示Kimi K3的表现足够接近顶级,使得价格成为焦点。在人工分析的Terminal-Bench 2.1排行榜上(截至2026年8月12日的数据),Kimi K3(最大值)排名第6,得分为85.0%。排名前列的条目是OpenAI的GPT-5.6。索尔(xhigh) 为 89.5%,Anthropic 的 Claude Opus 5 (max) 为 89.1%。

Terminal-Bench 2.1 之所以重要,是因为它不是一个琐事测试。它评估实际的软件工程任务,如修复错误、设置服务器和管理文件。如果一个模型在这种测试中得分相近,买家就会开始询问他们在付费时究竟在支付什么,因为账单是一个约束条件。

截至2026年8月14日,人工分析的智能指数v4.1.1、Epoch AI的能力指数和Vals指数的更广泛基准快照也将Kimi K3列为表现优异的产品,并逐渐接近美国前沿模型。这些指数的共同点并不是它们只选出一个赢家,而是它们使“仅限美国前沿”的默认采购规则更难以捍卫。

数据包中最清晰的成本比较不是排行榜,而是标准化构建。在一个定制的“氛围编码”测试中,七个前沿模型被要求使用相同的指令创建一个名为 Brewberg 的虚构咖啡电子商务网站。尽管偶尔出现设计失误,但大多数模型实现了 100% 的功能准确性,而代币成本却出现了明显的差异。

Claude Fable 5 在不到一个小时内构建了该网站,功能达到100%,费用约为50美元。Kimi K3 以12美元的价格制作了一个外观相似、功能相同的网站,节省了超过75%。

定价原理解释了为何即使输出趋同,差距仍然存在。Moonshot 对 Kimi K3 收取每百万输出代币 15 美元。DeepSeek 的 V4-Pro 在高峰时段的价格为每百万代币 3.96 美元,在非高峰时段则为其一半。Anthropic 的 Fable 5 服务定价为 50 美元。

Brewberg 的分析还显示了代理工作流程如何放大成本差异。Claude Fable 5 的账单归因于更高的代币价格以及多次调试和优化,包括基于截图的验证,这增加了代币的使用量,超出了文本输入。其初始设置审查阶段的成本约为 $0.34,但浏览和调试占据了主要开支。

开放权重分配面临美国政策风险:为何禁令难以执行

正在讨论的政策风险并不是关于单一的API端点。这是关于美国政府是否采取措施限制中国AI模型在美国的可用性,属于与之前对中国电动汽车和太阳能电池板进口控制相同的广泛类别。

执行问题在于许多领先的中国模型是开放权重的。开放权重模型是指其权重被发布,其他人可以下载、复制并在本地或自己的服务器上运行,而不是仅通过提供商的API访问。这与闭合权重模型相反,后者无法下载,通常只能通过提供商控制的付费API或订阅使用。

如果一个模型可以被下载并在本地运行,针对面向消费者的API访问的禁令并不能消除这种能力。它只是改变了分发路径。这就是为什么任何限制可能需要针对企业部署、分发渠道或采购规则,即便如此,它仍然会是有漏洞的。

国内的反对声音已经组织起来。近200家美国公司反对禁止中国AI模型,认为这会增加成本并损害它们在国际竞争中的能力。这个论点并不是意识形态上的,而是一个成本项目。

采用名单也削弱了这纯粹是海外现象的观点。包括Airbnb、DoorDash和Coinbase在内的美国公司被引用为采用了托管在本地服务器上的中国模型,这种部署模式明确减少了数据安全问题,同时仍然捕获了成本优势。

IPO季节的估值叙事:更便宜的近似同行对美国实验室和买家的意义

对于美国前沿实验室来说,时机尴尬,因为“持久优越性”叙事是支持进入潜在公共市场窗口的非常大私人估值的一部分。Anthropic考虑在十月尽快进行IPO,而OpenAI则计划明年上市。Anthropic在五月以9650亿美元的估值筹集资金,而OpenAI最近一轮融资在三月的估值为8520亿美元。

Moonshot的估值被引用为350亿美元,而这个数字与美国领导者之间的差距就是关键。如果一个估值较低的竞争对手能够以明显较低的代币价格提供近似同行的能力,市场必须决定现有企业是在销售差异化产品还是在销售稀缺性。

在这里,成本成为估值变量,而不仅仅是客户投诉。输出代币是计费单位,代理工作流程会因为系统规划、浏览、调试和迭代时最小化人类干预而增加代币消耗。当工作流程是多步骤时,即使最佳模型仍然是最佳,最便宜的“足够好”模型也能获胜。

中国实验室已经倾向于开放权重分发,可以托管在外国云服务上,即使以牺牲直接回报为代价,也减少了海外数据安全问题。Interconnected Capital的Kevin Xu这样描述这种姿态:“因为AI是如此新,我认为所有这些开放模型和公司仍处于客户争夺或土地争夺模式,”他认为中国实验室更愿意容忍较低的利润以获得市场份额。

这种权衡是双向的。彭博情报的Robert Lea表示,中国的AI实验室尚未找到明确的盈利路径,他预计该行业对超便宜代币供应的依赖将在未来三年内使其持续亏损。如果这种观点是正确的,那么今天买家的定价压力是真实存在的,但如果补贴阶段结束,供应曲线可能会发生变化。

关注中国AI模型在以下方面超越美国的信号

美国的限制风险只有在变得具体时才会对市场产生影响。第一个信号是任何具体的政策提案或机构行动,旨在限制中国AI模型在美国的可用性,以及它是否针对API访问、分发渠道或企业部署。每个目标意味着不同的执行面,而开放权重分发使得“可用性”成为一个模糊的概念。

第二个信号是OpenRouter的每月代币份额指标是否能维持中国模型在60%以上,或者是否会逆转。该数据集排除了直接到提供者的流量,因此它不是一个完整的市场份额统计,但它清晰地反映了平台开发者实际使用中的路由行为。

第三个问题是,Hugging Face生成模型的下载比例是否保持在引用的41.4%的中国份额,或者在新版本发布时是否会相对于美国模型有所扩大。下载量并不等同于收入,但它们是一个分发优势,而分发是使价格战持久的关键。

最后一个信号是首次公开募股(IPO)时间表的明确性以及任何更新的估值或收入披露。地址定价压力。Anthropic的“最早在十月”窗口和OpenAI的“明年”计划相近,投资者将被迫在一个近似同行正在训练用户期待更便宜代币的世界中承担利润假设。

我的看法是:这笔交易不是“中国赢了”,而是“人工智能的利润空间被竞争消耗得比市场预期的更快”。

决定这一点的不是Kimi K3在排行榜上是否击败了顶级美国模型,而是“足够接近”加上75%以上的账单减少是否成为日益增长的代理性、背景性和成本敏感的AI使用的默认采购逻辑。Brewberg测试是一个有用的缩影,因为它保持提示不变,让经济学来发声:大多数模型达到了100%的功能准确性,但账单仍然使Claude Fable 5与Kimi K3之间相差约50美元,Kimi K3的费用为12美元。

如果这种模式能够推广,那么压力将落在两个地方。买家获得了一个可信的外部选择,这压缩了通过付费API和订阅进行货币化的封闭权重现有企业的定价权。美国政策风险因此成为一个次要杠杆,而不是主要驱动因素:限制可能会在边际上减缓采用,但开放权重分配使得彻底禁令难以执行,近200家美国公司已经争辩称,阻止更便宜的模型将会提高他们的成本。

存在一个失效案例。如果OpenRouter的市场份额再次跌回60%以下,而Hugging Face的下载份额不再偏向中文版本,那么“采用势头”的读数将迅速减弱,因为这两个指标是数据包中的具体衡量标准。此外,供应方面也存在可持续性问题:如果罗伯特·利亚(Robert Lea)是对的,即超便宜的代币供应使中国的实验室在未来三年内持续亏损,那么市场必须决定今天的价格是稳定的均衡还是土地争夺补贴。

重要的阈值是成本是否仍然是决定性差异因素,即使能力在Terminal-Bench等实际基准上保持在几个点之内,因为这将确认AI利润正在比IPO时代的估值假设更快地被竞争所侵蚀。

来源