OpenAI 公开内部前沿模型的一批新数学成果:附 Lean 形式化与算力披露
2026年10月6日,OpenAI 公开了一批由内部前沿模型产出的新数学结果。结果发布在 GitHub 仓库,附带论文修订与引用协议,并包含大量证明的 Lean 形式化版本。OpenAI 还披露了推理摘要、算力估算和尝试问题的统计:平均每项结果约耗费三小时 ChatGPT Pro 思考的算力。发布流程参考了普林斯顿高等研究院(IAS)独立咨询小组的建议。OpenAI 称正在负责任地推进该模型的对外发布,并将资助相关研讨会与会议。
一、发布了什么 2026年10月6日,OpenAI 在其研究栏目发表《Sharing AI progress in mathematics》,公开了一批由内部前沿模型产出的新数学结果。关键词是「一批」:这不是单篇论文,也不是单个定理,而是覆盖面较广的一组成果。OpenAI 把它们放进一个 GitHub 仓库,并配上论文修订与引用的协议。文章同时说明,团队仍在探索符合咨询委员会指南的、由社区托管的替代发布渠道。 需要先说清边界。原文没有列出具体定理的名称,也没有给出解决了多少个问题的总数。它给出的是发布方式、披露内容和一个平均算力数字。本文只依据这些已公开信息来分析,不对具体数学内容作推测。 二、发布流程:向数学界的规范靠拢 这次发布最有意思的部分,是它的流程。OpenAI 表示,为了改进与数学界分享成果的方式,他们咨询了普林斯顿高等研究院(IAS)的独立「数学与人工智能咨询小组」,并参考其建议与公开推荐来决定如何发布。
这背后的现实是:数学界有自己的发表、署名与审稿传统。如果 AI 实验室直接发一篇博客说「我们的模型证明了某某」,数学家很难判断真假,也不知道该如何引用。把结果放进带修订协议和引用协议的仓库,等于承认这些成果需要被社区审阅、更正并正式引用。OpenAI 还承诺,未来的发布会继续改进论文质量,包括引用、数学表述和结果的呈现方式,让读者更容易理解。 三、Lean 形式化:让机器来核对证明 仓库里的另一个重点,是许多证明的 Lean 形式化版本。Lean 是一种编程语言,可以让计算机逐步检查数学证明是否正确。 这一点对 AI 生成的数学尤其关键。语言模型可能写出读起来很严谨、却含有隐蔽漏洞的论证,而人工审稿既慢又昂贵。形式化证明由证明检查器逐条核对,只要形式化的陈述与原问题一致,证明本身就不必再靠信任。这样,社区可以把精力放在两个更难的问题上:这个形式陈述是否真的捕捉了原问题,以及这个结果有没有数学价值。 OpenAI 明确说,会在取得更多形式化后继续更新仓库。这意味着今天并不是所有结果都已形式化。读者应以仓库的当前状态为准。 四、透明度:推理摘要、算力和尝试次数 除了成果本身,OpenAI 还在仓库里公布了获得这些结果的额外细节:10 份模型推理摘要、以 ChatGPT Pro 使用量折算的算力估计,以及尝试问题数量的统计。已公布的平均数字是:一项结果平均相当于约三小时的 ChatGPT Pro 思考算力。 这三类信息各有用处。推理摘要让外界看到模型是怎样走到结论的。算力估计给出「一项结果大约值多少钱」的量级,这对评估 AI 科研的经济性至关重要。尝试问题的统计则回应了一个老问题:我们看到的成功,是从多少次失败里挑出来的?没有分母的成功率没有意义,公布分母是一种难得的诚实。 需要注意的是,「三小时 ChatGPT Pro 思考」是 OpenAI 自己的折算口径,并不等同于具体的 GPU 小时数,外界无法据此精确复算成本。这是读数字时应保留的谨慎。 五、对科学界与行业的含义 对数学家而言,这是一个可以直接审阅的材料库:论文、证明、统计都在同一处,并有明确的修订与引用渠道。对 AI 行业而言,它给出了一个披露样板:成果加形式化证明加算力账本加失败统计。以后其他实验室宣布类似进展时,读者有理由以同样的标准提问。
对企业而言,信号更复杂。一方面,这表明前沿推理模型在长时间思考后,能产出可验证的、研究级别的输出。另一方面,OpenAI 只表示正在努力负责任地发布产出这些结果的模型,并没有给出时间表。因此,不应把它当成已经可用的产品能力。 对开发者来说,这次发布还有一层启发:评估推理模型,不能只看基准分数,还要看它能否交出别人可以独立复核的产物。形式化证明、可追溯的推理摘要和公开的失败统计,都是把「模型很强」这句话变成可检验结论的办法。OpenAI 也表示,持续评估内部前沿模型在数学和其他科学上的表现,有助于加速研发推动这些领域的工具。 六、后续与挑战 OpenAI 说,将资助一系列围绕「理解 AI 产出的重大成果」的研讨会、会议和专项计划,细节会在不久后公布。这是一个务实的信号:理解一个由机器给出的证明,本身就是一项需要人力的工作,瓶颈从「产生结果」转向了「消化结果」。 挑战同样明显。第一,形式化覆盖是否会跟上成果产出的速度。第二,形式陈述的正确翻译仍需要人来确认。第三,署名、功劳与责任如何在人与模型之间划分,数学界还没有定论。第四,一次性发布的做法能否成为常态,取决于 OpenAI 是否真如所言持续更新标准、回应社区反馈。 总的来说,这次发布的价值不只在数学内容,更在它试图为 AI 科研成果建立一套可检验、可引用、可更正的披露规范。规范是否站得住,要看未来几个月社区的审阅结果。