Hands assembling a colorful geometric model
人工智能

OpenAI发布370多项数学结果 IAS警告证明可能无法验证

OpenAI表示将与高等研究院合作,但并未承诺停止在封闭模型上测试前沿问题。

作者:Elliot Marsh阅读 4 分钟

OpenAI 发布了超过 370 个数学结果,涵盖代数、理论计算机科学和数学逻辑等领域,将其最先进模型的研究成果公之于众。这一发布加剧了关于专有前沿模型是否能够生成更广泛数学社区无法访问、验证或承担责任的证明的治理争论。

OpenAI 的 370+ 数学结果发布将验证置于聚光灯下

OpenAI 发布了超过 370 个涵盖代数、理论计算机科学和数学逻辑的数学结果。这一批量发布是在上个月更高调的声明的阴影下进行的,当时 OpenAI 表示它解决了 Navier–Stokes 方程,这是一个被描述为提供 100 万美元奖励的基础流体动力学问题。

从机械上讲,紧张关系很简单:前沿实验室可以通过外部无法自由访问或检查的模型运行高级问题,然后发布看似研究结果的输出。这作为能力演示是有效的,但它也将验证转变为一个治理问题,因为被要求验证工作的社区可能没有相同的工具、模型访问权限或可追溯性来重现它。

直接的反对意见并不是关于“370”是否是一个大数字。它关乎于产生这些结果的流程是否足够清晰,以便进行独立检查,以及私营实验室的激励是否与使数学声明持久的尽职调查规范相一致。

IAS 和数学家标出了核心风险:不可验证的证明、责任和访问

新泽西州普林斯顿的高级研究所 (IAS) 表示,它不支持前沿实验室在不对更广泛数学社区开放的专有 AI 模型上测试高级数学问题的做法。它的反对意见被框定为由模型输出造成的责任缺口,这些输出可能超出人类的理解能力。

IAS 表示:“现在的情况是,AI 可以在没有提示它的人能够理解、验证或对其负责的情况下输出数学论证。”该研究所补充道:“我们相信人类对数学的理解仍然至关重要。在这个新时代,我们如何朝着一个新的范式努力,使人类对数学的理解成为负责任的学术成果的一部分?”

另一个分歧点是来源,而不仅仅是正确性。纽约大学数学家 Tristan Buckmaster 警告说,提示的行为本身可能会注入关键信息,模糊“结果”来自何处以及谁应得信用。Buckmaster 还提出了模型辅助工作有效完成他人部分开发的想法的风险:“可能会有一堆结果,他们拿走某人的工作,然后将其完成。”

一个顾问委员会还敦促 AI 实验室向全球数学社区提供“公平访问”其 AI 模型,认为封闭的内部系统有可能将该领域分裂为有与没有。“AI 实验室使用专有内部模型进行数学研究的做法,可能会创造一个双层系统,使实验室超越其他领域,有效地使数学社区与其自身学科疏远,”该小组写道。

OpenAI的IAS外展对前沿模型治理的信号

OpenAI的回应是参与,而不是撤退。该公司表示将与IAS合作,让“数学家在我们如何前进中发声”,但并未表示将停止用高级数学问题测试其AI模型。

这使得核心争议仍然存在:前沿模型研究是否可以在没有社区访问的情况下被视为社区科学。下一个具体信号将是一个已发布的框架,明确谁参与、什么被审查以及在什么时间表上,因为没有范围的“声音”不是一种控制。

还有两个里程碑对这个故事的解决至关重要。一个是OpenAI或其他前沿实验室是否朝着咨询委员会所呼吁的“公平访问”标准迈进,这将直接减少两级动态。另一个是验证状态:源材料并未建立370多个结果或声称的Navier–Stokes解的独立复制或同行评审,因此任何关于可重复性和审查路径的更新将比另一个头条数字更具分量。

我的看法:对于交易者来说,这是一种AI信任叙事催化剂,而不是你可以定价的数学突破

在这里推动市场的部分不是一个封闭模型是否能输出数百个数学结果。是IAS对前沿实验室在更广泛领域无法访问的系统上测试高级问题划定了一条明确的界限,因为这将“能力”转变为一个治理和合法性问题,可能会影响AI代币的情绪。

重要的门槛是OpenAI和IAS是否将外展转变为一个具体的验证和访问框架,以及370多个结果或Navier–Stokes声明是否获得外部可以实际运行的独立验证路径。如果发生这种情况,故事将从叙事风险转变为可测量的过程,这在实际意义上使其变得重要。

来源