
AI实验室将顶级模型发布间隔缩短至44天
Anthropic 和 OpenAI 的内部指标显示,自动化压缩了安全窗口,并提高了政策和安全的尾部风险。
自2026年4月以来,美国和中国的主要人工智能实验室将高性能模型发布的平均间隔缩短至44天,较2023年1月至2026年3月的125天大幅下降。这一变化是由于人工智能代理在构建下一代模型方面承担了更多工作,缩短了在竞争激烈的市场中进行安全验证的时间。
从125天到44天:美国和中国实验室的新模型发布节奏
对五家美国人工智能公司和四家中国公司的高性能模型发布进行的调查发现,从2026年4月到2026年9月,平均发布间隔降至44天,而2023年1月至2026年3月为125天。参与的实验室包括Anthropic和OpenAI等美国实验室,以及阿里巴巴集团和Moonshot AI等中国公司。
这种节奏不再是一个抽象的平均值。九月初提供了一个聚集的例子:Anthropic在9月1日发布了“Claude Fable 5.1”,谷歌在9月2日推出了“Gemini 3.8 Flash”,OpenAI在9月3日发布了“GPT-6 Astra”。谷歌9月2日的发布被描述为六周内的第三个Flash模型。
同样的模式作为基线日程而非一次性冲刺正在显现。Meta自7月以来每月更新其“Muse Spark”模型,而中国的DeepSeek自7月以来每月发布新版本,阿里巴巴和智谱AI也被描述为加入了快速发布的竞争。
对于市场而言,重要的机制不仅仅是“更多模型”。44天的周期意味着外部测试的时间更少,下游集成商加固部署的时间更少,以及政策、安全或安全争议成为短期催化剂的频率更高。
人工智能构建人工智能:Anthropic和OpenAI的内部研发自动化指标
压缩周期的驱动因素是从人工智能作为编码助手转变为人工智能作为研发执行者。人工智能代理被用于进行实验、管理评估循环和分析结果,这使得实验室能够并行化以前依赖人类注意力的工作。
Anthropic在9月17日的报告中表示,截至上个月,Claude负责公司26%的AI研发任务,较2026年2月的0%有所上升。Anthropic还逐字表示,“Claude尚未完全自主运行。”该报告将这一测量框架视为评估递归自我改进接近程度的一种方式,这意味着一个系统以能够加速能力提升的方式对其自身设计或训练过程进行迭代,而不需要成比例的人类监督。
OpenAI内部的指标在该报告中指向相同的方向,但使用了不同的代理:劳动和支出。截至上个月,OpenAI研究组织中的AI代理记录的总工作时间相当于人类研究人员日常劳动的3.1倍。OpenAI每位研究人员的AI代币支出,作为与研究人员消耗的模型输出相关的使用成本指标,从2026年2月的约1美元每天上升到上个月的600美元以上,前10%超过7000美元每天。
输出侧指标也随之变化。报告称,上个月OpenAI编写的编程代码量增长到去年的七倍,而Anthropic在第二季度实际产品中采用的代码达到了2021-2025年平均水平的八倍。这就是“AI构建AI”的运营表现:更多的并行尝试,更快的迭代,以及能力跃升之间的松弛减少。
安全窗口缩小,竞争变成了“囚徒困境”
安全问题很简单:如果迭代速度上升,人类理解模型行为和验证安全的时间就会缩短。报告将此与对递归自我改进引发“智能爆炸”的恐惧联系在一起,这是一种假设的能力失控和治理超越人类控制的快速增长。
安全风险正在自身曲线上收紧。英国AI安全研究所估计,到2025年11月,AI能够执行的网络攻击任务的翻倍时间约为八个月。到2026年2月,该研究所估计翻倍时间缩短至4.7个月,这意味着进攻能力的提升速度更快,防御适应的窗口更窄。
关键在于激励。竞争环境被描述为“囚徒困境”,每个实验室都有理由继续竞争,即使所有人都更安全地减速,因为单方面减速风险失去竞争优势。报告中还包括一个未经验证的竞争压力数据点:引用路透社称,Anthropic正在考虑加速其下一个模型发布,以应对OpenAI的Astra,提前进行IPO。
确认44天制度的近期信号是具体的。确认Anthropic下一个发布的时间表变化将显示“考虑加速”是否成为实际的日历行动。对内部自动化强度指标的更新,包括OpenAI的3.1倍代理小时倍数是否保持或上升,以及每位研究人员的代币支出是否保持在每天600美元以上,将指示加速是否稳定或仍在上升。来自英国AI安全研究所或同行的新网络能力评估,延长八个月到4.7个月的估计也很重要,因为这正是监管机构和企业买家可以依赖的外部风险曲线。
我的看法:更快的周期提高了交易者无法忽视的突发风险事件的概率
决定这一点的部分是44天的节奏是一个临时的发布集群,还是由自动化驱动的新运营节奏。Anthropic的26% AI主导研发份额和OpenAI的3.1倍代理小时倍数读起来像是机器执行工作量的跃升,而不仅仅是辅助,这种吞吐量往往会压缩验证时间,即使安全预算上升。
重要的门槛是实验室是否继续发布显示自动化强度保持高位的指标,同时发布仍然在几天或几周内集中。如果这一点成立,这种情况开始看起来是结构性的,而不是叙事驱动的,实际结果是政策和安全冲击的频率更高,这可能会渗透到更广泛的风险定价中。