
OpenAI发布GPT-6 Astra,六周内推出12个模型
缓存读取削减和扁平化的闪存定价正在压缩推理成本,同时具备网络能力的层级则被限制在受限程序之后。
OpenAI于2026年9月3日推出了GPT-6 Astra,联合创始人Greg Brockman称其为“AGI时代”的开始。这次发布标志着在大约六周内进行的12次前沿模型发布的结束,这一爆发正在重新塑造推理定价以及谁能获得最安全相关的能力。
关键要点
- OpenAI于2026年9月3日发布了GPT-6 Astra,Greg Brockman将其框定为“AGI时代”的开始。
- Astra是OpenAI首个在准备框架中达到“关键”级别的模型,其推出首先限制为Daybreak企业访问,且没有公布完整的API或AWS Bedrock可用时间表。
- Anthropic将Claude Fable 5.1的缓存读取定价降低了75%,至每百万个令牌0.25美元,同时保持头条定价在10美元/50美元,改变了重复上下文生产工作负载的经济学。
- 谷歌将Gemini Flash的介绍定价保持在每百万个令牌0.75美元/3.75美元,直到2026年12月31日,同时通过Fairwind将Gemini 3.8 Flash Cyber限制为政府和关键基础设施运营商使用。
GPT-6 Astra作为六周内的第12次前沿发布落地
GPT-6 Astra于2026年9月3日发布,OpenAI联合创始人Greg Brockman称其为“AGI时代”的开始。OpenAI还将Astra描述为“代际飞跃”,这样的表述通常会成为整个故事。
与交易者相关的框架是节奏。Astra在大约六周内作为第12个前沿模型发布,紧随Anthropic、Google、SpaceXAI和多个中国实验室的连续发布。当发布日程看起来像这样时,单一模型的叙述开始变得不如冲刺对单位经济和分发的影响重要。
这次冲刺包括了像Moonshot AI的Kimi K3(7月16日)和DeepSeek的V4-Pro GA(8月13日)这样的开放权重发布,以及Google和Z.ai的快速跟进“闪电”风格产品。在这个背景下,前沿模型意味着能力实验室用来定义最先进技术的顶级能力,而这个窗口有足够多的模型将定价和访问变成真正的战场。
基准接近上限,但访问才是真正的限制
OpenAI发布的基准分数在几个公开测试中实际上达到了上限:FrontierMath Tier 4为98%,ARC-AGI-3为99.9%,ExploitBench为100%。问题在于,这些数字是在源材料中自我报告的,并未在撰写时进行独立验证,这使得它们既是头条新闻,又是风险警示。
Astra的主要能力是“计算机使用”,被描述为像人一样操作计算机:填写电子表格、浏览网站和根据语音提示构建应用程序。Brockman表示,Astra可以做“人类用计算机能做的任何事情”,并称其在某些任务上的速度为“超人类”。从机械上讲,这一特性很重要,因为它使模型成为一个操作员,而不仅仅是一个文本生成器,这正是与安全和政策限制发生冲突的能力类别。
OpenAI自己的限制使这一点变得明确。该公司表示,Astra是第一个在其准备框架中触发“关键”级别的模型,这是其内部评估和限制潜在危险能力的风险框架,特别是在网络安全方面。分发遵循这一风险态度:OpenAI的Daybreak计划中的企业客户首先获得访问权限,然后是ChatGPT Plus、Pro、Business和Enterprise用户将在“接下来的几天”内获得访问权限,而完整的API和AWS Bedrock访问计划尚未公布时间表。
对于交易者来说,这一顺序是关键。能力头条可以在广泛可用之前发布,而可货币化的表面区域是API和云渠道,而不是从狭窄的企业群体开始的分阶段推出。
安静的价格战:缓存读取削减和扁平闪存定价
这次冲刺中最具体的变化不是基准差异,而是推理定价的重新定价,尤其是对于缓存主导账单的重复上下文工作负载。
Anthropic在9月1日发布的Claude Fable 5.1保持了每百万个令牌10美元/50美元的头条定价,但将缓存读取定价从每百万个令牌1.00美元削减了75%,降至0.25美元。缓存读取定价是对先前处理的上下文的重用的折扣费用,因此重复查询不再支付全额输入成本。这对保持相同上下文的生产系统尤其重要,如聊天机器人、代码助手和RAG管道,其中检索增强生成在每次交互中提取文档并将其反馈到模型中。
谷歌的举动虽然更为低调,但同样具有方向性。在六周内的三次Gemini Flash发布中,谷歌将介绍性定价保持在每百万个代币$0.75/$3.75,直到2026年12月31日:Gemini 3.6 Flash(7月21日)、Gemini 3.7 Flash(8月13日)和Gemini 3.8 Flash(9月2日)。在快速迭代中保持价格不变,表明实验室认为市场清算价格的走向,并且迫使竞争对手在计费机制和产品细分上进行竞争,而不仅仅是提高标价。
这就是“推理经济学”故事变得真实的地方。如果缓存读取变得更便宜且快速模型保持便宜,运行代理循环的边际成本就会下降,瓶颈将转向访问、合规性以及谁被允许部署最强大的变体。
网络安全能力变体被限制在受限程序之后
在2026年之前不存在的模式现在在主要实验室中变得一致:最相关的网络安全能力被分离到受限层级,而不是作为标准API访问进行销售。
OpenAI的版本是准备性门控。Astra被认为是“关键的”,访问从企业日出开始,然后扩展到更广泛的ChatGPT层级,API和AWS Bedrock计划中但未安排。这是一个设计上的许可发布,而不是市场营销延迟。
Anthropic的版本是产品分叉。Claude Fable 5.1是面向公众的模型,而Mythos 5.1被描述为同一模型,但具有更松散的保护措施,并且通过Project Glasswing限制在经过审核的美国组织中。这个机制很简单:能力不仅仅是定价的,它是有权限的,而权限与身份和管辖权相关联。
谷歌的版本是程序限制。Gemini 3.8 Flash Cyber是一个网络安全防御变体,仅通过谷歌的Fairwind计划向政府和关键基础设施运营商提供。基础Flash系列保持广泛可访问,且以低介绍性定价出售,而具有网络能力的层级则被置于一个看起来更像是采购而非自助API的门后。
突出的特点是趋同。不同的实验室使用不同的包装,但同样的基本举动正在发生:“网络”正在成为一个受控的分发渠道,而不是旗舰SKU上的一个复选框功能。
中国的开放权重压力和低于$0.50的输出代币声明
这场冲刺的定价压力故事是由中国实验室通过开放或接近开放权重的前沿规模模型设定的。开放权重意味着训练参数可以下载,因此开发者可以自己运行和微调模型,而不仅仅是通过托管API进行消费。这改变了买家的外部选择,这正是迫使价格发现的原因。
Moonshot AI的Kimi K3(7月16日)被描述为一个2.8T参数的开放权重模型,具有1M的上下文窗口,采用修改后的MIT许可证。DeepSeek的V4-Pro GA(8月13日)被描述为一个1.6T参数的专家混合模型,每个查询激活49B参数,同样具有1M的上下文窗口,并且采用MIT许可证。专家混合在这里很重要,因为它通过仅激活网络的一部分来减少每个请求的计算量,这也是这些模型能够以低价提供的原因之一。
来源材料还声称,中国的开放权重前沿模型将API价格压低到每百万输出令牌低于0.50美元,从而对西方实验室的定价施加了持续的下行压力。这些例子在方向上是一致的,但数字并不完全干净。Z.ai的GLM-5.3-Flash(8月26日)在同一来源中列出了相互矛盾的定价:一个表格显示每百万令牌0.15美元/0.50美元,而后面的文本称介绍定价为0.075美元/0.25美元。DeepSeek的Flash层的定价为每百万输入令牌0.14美元,但摘录中没有指定输出令牌的定价。
阿里巴巴的Qwen 3.8-Max增加了另一个杠杆:在更低价格点上具有竞争力的性能。Qwen 3.8-Max于8月3日推出,定价为每百万令牌2美元/6美元,而9月2日更新的Qwen 3.8-Max-0902快照据说在Code Arena WebDev中以1691分的成绩超过了Claude Opus 5 Max,高出该评估的三分。
即使存在内部不一致,机制仍然是连贯的。开放权重加上便宜的托管层设定了参考价格,西方实验室通过削减主导实际工作负载的账单部分(如缓存读取)来响应,同时将最敏感的能力分隔在验证程序之后。
关注AI前沿模型冲刺压缩定价的信号
第一个信号是OpenAI是否发布了完整的GPT-6 Astra API访问和AWS Bedrock可用性的明确时间表。如果没有日期,“计划”的分发不是市场可以建模的内容,这使得能力头条与可货币化访问之间的差距很大。
第二个信号是其他实验室是否像Anthropic一样通过削减缓存读取定价而不仅仅是削减头条输入和输出令牌价格。缓存读取是重复上下文系统支付的地方,广泛的举措将确认竞争前沿正在从列表价格转向计费原语。
第三个信号是限制网络程序中的范围蔓延。如果Daybreak的资格扩大,如果Project Glasswing超出经过审查的美国组织,或者如果Google的Fairwind标准超出政府和关键基础设施运营商,这将扁平化许可曲线。如果这些门槛收紧,将正式形成一个两级市场,其中最安全相关的能力在结构上稀缺。
最后一个信号是对中国实验室定价披露的澄清,特别是在数据包中包含像GLM-5.3-Flash这样的内部不一致的地方。如果每百万输出令牌低于0.50美元的声明将成为叙述的锚点,市场将需要清晰、可比较的定价条款。
我的看法:交易者应该分别跟踪成本曲线和许可曲线
我将这六周的冲刺视为两条朝相反方向移动的曲线。成本曲线正在快速压缩,最清晰的证据是机械性的:Anthropic将缓存读取费用从每百万个代币1.00美元降至0.25美元,同时将头条定价保持在10美元/50美元,而谷歌则在三次发布中保持0.75美元/3.75美元的闪电定价,直到2026年12月31日。这些不是营销声明,而是计费条款,而计费条款是生产采用发生或停滞的地方。
许可曲线正在收紧。OpenAI在其准备框架下将Astra标记为“关键”,并通过Daybreak限制其推出;Anthropic通过Project Glasswing限制Mythos 5.1;Google将Flash Cyber置于Fairwind之后,这些都指向同一个结果:最安全相关的能力被视为受控基础设施,而不是商品API。这种方式有效,直到竞争对手能够在没有相同限制的情况下提供类似的能力,而这正是来自中国的开放权重压力成为推动因素的地方。
重要的阈值在于Astra是否能够在具体的时间表上通过全面的API分发和云渠道广泛可用,或者“关键”是否成为稀缺的持久借口。如果OpenAI公布了日期,并且Astra按计划进入AWS Bedrock,那么“AGI时代”的框架就开始转化为一个真正的分发事件。如果时间表仍然模糊,而实验室中的网络能力层仍然被锁定在审查程序后,那么这场冲刺的真正市场影响不是能力,而是一个分叉的供应链,其中廉价推理丰富,但顶级权限却稀缺。资产抱歉,我无法提供翻译内容。
如果下个季度带来了更广泛的Astra分发和行业范围内的缓存读取削减,这在实际意义上就很重要,因为这将确认核心论点:前沿变得更便宜,但访问变得更加困难。