Four people gathered around a glowing blue brain
人工智能

前Anthropic研究员警告AI快速发展或致灭绝风险

雅各布·考克森的“近期未来”警告引发了反对和支持,因为Anthropic支持一种合法的、可验证的发布节奏机制。

作者:Elliot Marsh阅读 6 分钟

前Anthropic研究员雅各布·考克森表示,人工智能实验室的员工对前沿模型进展的速度感到“真正害怕”,并警告说,如果不减缓速度,人类在“近期内”可能会面临“强烈的死亡风险”。Anthropic回应称,强调安全措施和“积极”的测试,同时支持一种合法、可验证的方式来让行业控制发布速度,因为一些知名的人工智能领导者在如何认真对待灭绝风险的框架上公开分歧。

关键要点

  • 前Anthropic研究员雅各布·考克森表示,人工智能实验室的员工对进展的速度及其对人类的意义感到“真正害怕”。
  • 考克森警告说,如果不减缓发展,“我们在近期内都可能面临强烈的死亡风险”,并认为任何真正的减缓都需要与中国协调,以避免国际竞赛。
  • Anthropic表示,它构建的模型具有“行业中一些最强的安全措施”,对系统进行“积极”的测试,发布研究结果以帮助审查,并支持一种合法、可验证的机制来控制强大模型的发布速度。
  • 公众反应在一些高管的否定和Anthropic内部的支持之间分裂,包括埃文·哈宾格声称灭绝风险在“未来十年内超过10%。”

前Anthropic内部人士:随着人工智能进展加速,员工感到“真正害怕”

雅各布·考克森,27岁,前Anthropic研究员,曾在OpenAI工作,他以直言不讳的信息将人工智能风险辩论推回主流:构建前沿人工智能模型的人们感到害怕,他们认为时间紧迫。在“与劳拉·库恩斯伯格的星期天”采访中,考克森表示,人工智能公司的员工对进展的速度及其对人类的影响感到“真正害怕”。

考克森将这种恐惧与对监管和控制的呼吁联系在一起,而不是模糊的“安全”请求。他说:“我相信,如果我们不以当前的进展速度减缓,那么我们在近期内都可能面临强烈的死亡风险。”

对于市场而言,立即相关的不是考克森个人时间表是否正确,而是前员工在Anthropic领导层公开主张减缓发布机制的同时,提出极端的短期主张。这种组合使得“控制”、“监督”和“监管”的叙述保持活跃,即使没有新的法案或执法行动。

考克森对减速的论点——以及他为何认为中国必须参与其中

考克森的论点围绕着一种竞争动态。他表示,AI工作者在要求监管时是“完全认真的”,因为他们感到“被困在竞争中”,并且“害怕这种竞争的结果”。他所指的机制是竞争部署压力:如果一个实验室认为另一个实验室将推出更强大的模型,那么即使集体上更安全,克制在个人层面上也会变得代价高昂。

这就是为什么考克森将任何有意义的减速框架为地缘政治,而不仅仅是企业。他说:“山姆·阿尔特曼和埃隆·马斯克已经同意这是一个好主意。但我认为,如果我们要避免国际范围内的竞争,就需要与中国进行某种协调的减速。”

他还提供了一个具体的失败模式,呼应了达里奥·阿莫代伊评论中提到的场景:一群“像超级计算机一样运作的机器人”,可能会接管互联网。考克森表示,这种场景在“六个月到一年”内可能变得现实,并补充说,同行们担心危险可能在“接下来的两年内”到来。这些是评估,而不是在材料中有技术证据支持的主张,但它们通过为辩论设定时间限制而发挥叙事作用。

关键在于实施。“与中国的协调减速”是一个高标准,因为这意味着在竞争国家之间进行验证和执行。在实践中,这往往会将政策讨论从完全暂停转向监测、标准和可以审计的披露机制。

Anthropic的回应:保障措施、“激进”的测试和可验证的节奏机制

Anthropic的回应并没有承认考克森的时间表,但确实验证了风险类别和协调的必要性。一位发言人表示,该公司“始终透明地表示,AI将带来巨大的好处和前所未有的风险”,并且它继续构建“行业中一些最强大的保障措施”的模型。

该公司描述了一种旨在让外部人士易于理解的安全姿态:它“积极”测试模型并发布研究结果,以帮助审查并防止“AI不对齐”的事件,这一术语指的是系统的行为偏离人类的意图。Anthropic还表示,它是第一个发布减轻模型开发风险框架的公司。

最与市场相关的是明确支持将节奏作为一种行业机制,而不是单方面的选择。发言人表示:“这项工作也是我们相信,世界将受益于行业采用合法、可验证的方式共同协作,以控制我们发布强大模型的节奏。”

这种语言与首席执行官达里奥·阿莫代伊周六发表的文章《我们必须控制前沿》的内容一致。阿莫代伊提出了一个三部分计划:在开发过程中对AI模型进行独立监测、行业范围内的监管和全球监管。在这种框架下,独立监测是指在开发过程中进行第三方监督,而不是仅依赖于构建系统的实验室。

跟踪信号:AI领导者之间的可信度分裂与下一个监管钩子

AI领导者之间的公众分裂现在已成为故事的一部分,这对叙事驱动的定位产生了双向影响。Hugging Face首席执行官Clément Delangue批评了Coxon关于灭绝风险评论的框架,在X上写道:“抱歉,但问Jacob关于AI灭绝风险就像问你的空调师傅气候变化。”他补充道:“并不是说这本身就一定不有趣或错误,但我们要保持事情的视角。”在Amodei的文章之后,Delangue还表示愿意帮助寻找潜在解决方案。

Nvidia首席执行官黄仁勋也进行了反驳。在上周由高盛主办的会议上,团体中的多位人士表示,黄仁勋驳斥了Coxon的评论为不真实。黄仁勋之前曾称AI“将是人类的终结”的观点为“完全的胡说八道”。

另一方面,Anthropic科学家Evan Hubinger公开支持核心恐惧。他在X上写道:“我们确实真诚地相信AI可能会杀死所有人类!我个人认为在下一个十年内这个概率超过10%。”

下一个钩子是具体的,而不是修辞性的:Amodei的独立监测概念是否会转变为命名的第三方、标准或试点。主要实验室或政府是否明确支持或拒绝“合法、可验证”的节奏机制。以及国际协调语言,尤其是对中国的明确提及,是否开始出现在政策演讲或AI安全峰会的成果中。另一个迹象是是否有更多高级管理人员公开表态,采用Coxon或Hubinger式的概率,这将使这一主张主流化或孤立化。

我的看法:为什么这场辩论仍然可能溢出到AI代币情绪中,而没有任何新政策

决定这一点的部分不是Coxon的“近期未来”时间表。关键在于Anthropic同时在捍卫其安全措施并要求一种合法、可验证的方式来控制发布节奏,这使得第三方监督和协调标准即使在没有监管者采取行动时也能保持在讨论中。

真正的考验在于“独立监测”是否成为交易者可以指向的真实对象,是否有命名的监测者和可以检查的标准,而不是对责任的一般呼吁。如果这转变为试点或正式的支持,节奏叙事将不再是媒体周期,而是开始看起来像一种可以塑造前沿AI如何发布和营销的约束。

来源