展开目录 ▾
#OpenAI#数学#Lean#前沿研究#AI 伦理#开源

OpenAI 一次放出 722 篇数学手稿:372 个结果族、约 4000 道题里筛出来的

10 月 7 日 OpenAI 在 GitHub 公开 openai/math:722 篇由内部未发布模型产出的数学手稿、372 个结果族,官方称平均每个结果花 3 小时 ChatGPT Pro 算力,整个评测约 4000 道题。约 162 篇带 Lean 形式化,其余多数未经机器校验、全部未经同行评议;README 点名 CM 阿贝尔簇的 Hodge 猜想与 ζ 函数无零点区域两处为例外。

预计阅读 12 分钟

一句话总结

9 月底,独立数学家顾问组刚建议 AI 公司「不要把数学成果当营销工具」;10 月 7 日,OpenAI 就把 722 篇数学手稿一次性推上了 GitHub。这些手稿来自一个内部未发布的模型,官方口径是:平均每个结果花掉约 3 小时 ChatGPT Pro 算力,整个评测过程中模型被喂了大约 4000 道题,最后聚合成 372 个结果族。其中最受关注的一处,是 README 里点名的 CM 阿贝尔簇上的 Hodge 猜想——千禧年七大难题之一。

数据来源:OpenAI 官方仓库 openai/math(2026-10-07 首次提交,README / CONTENTS.md / formalization.yaml / overview.pdf 均取自仓库公开文件)、The Verge 同日报道(记者 Robert Hart)。


这次放出的到底是什么

不是一篇论文,也不是一个基准分数,而是一整个资料库。openai/math 仓库根目录下并列着四个东西:preprints/(722 个目录,每个放 PDF、源文件与引用说明)、lean/(形式化证明库与 formalization catalog)、reasoning_traces/(抽出的推理摘要)、以及一份把全部结果串起来的 CONTENTS.md 清单。README 对仓库内容的定义只有一句:

This repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model.

openai/math 仓库首页:Apache-2.0、单次 initial commit、lean / preprints / reasoning_traces 三个目录

一个直观的细节:仓库只有 1 次 commit,作者显示为 Anonymous,License 是 Apache-2.0。它不是「开源研究过程」,而是一次性的成果倾倒——这也正是争议的起点。

overview.pdf 第 1 页:OpenAI Research Catalog,372 个结果族分 722 篇手稿,按数学分支列出目录

按 overview.pdf 的分支目录,这些结果铺得很开:数论、代数与复几何、实与复分析、凸几何、理论计算机科学、动力系统与遍历论、组合数学、代数、概率与统计力学、数理逻辑、群论、数学物理、算子代数、拓扑、泛函分析、微分几何、偏微分方程……基本覆盖了纯数学的主要分区。

数字怎么来的:约 4000 道题、每个结果约 3 小时

README 里有一段把口径写得很清楚的话,值得原样记住:

On average, each result used three hours of ChatGPT Pro thinking compute with that model. Over the course of the evaluation, the model was posed approximately 4,000 problems.

翻译一下:模型被喂了大约 4000 道开放研究问题,平均每个最终结果消耗约 3 小时的 ChatGPT Pro 级思考算力;随后把输出聚合成结果族与手稿,并「要求达到适当的显著性水平」,才得到现在这份目录。

一次发布的数字解剖:722 篇手稿、372 个结果族、约 4000 道题、约 3 小时算力、162 篇有 Lean、560 篇无机器校验

这里有个容易被忽略的口径差异:README 说的是被喂了约 4000 道题,而最终公布的是 722 篇手稿 / 372 个结果族。也就是说,题目数量远多于产出数量——中间经过了「聚合 + 显著性筛选」。OpenAI 自己把这段写成了方法说明,而不是把 4000 道题都算成「成果」。

另外附带说明:OpenAI 在 9 月曾表示其模型「在大多数数学领域解决了 100 多个长期开放问题」。从「100 多个开放问题」到这次的 372 个结果族,规模确实在放大。

CONTENTS.md 正文:722 manuscripts covering 372 result families,每个结果下列出构成它的手稿与摘要

校验的缺口:162 篇有 Lean,560 篇没有

这是整件事里最该盯住的地方。

仓库带了一个 Lean 形式化库(lean/formalization.yaml)。把 722 个手稿目录与形式化目录逐条对齐后,能对应到形式化证明的约为 162 篇,占 22.4%;剩下约 560 篇(77.6%)没有机器可查的证明。这不是外界猜的,是仓库自己的数据能算出来的。

722 篇里机器能验的只有 162 篇:按手稿目录日期分组看,校验覆盖几乎全部集中在 9 月 22–27 日那一周

更值得说的是时间分布:把目录名里的日期拆开统计,9 月 22 日至 27 日那批(共 566 篇)里有 159 篇带 Lean;而最后几天新增的 143 篇(10 月 3–6 日,其中 112 篇集中在 10 月 5 日)一篇都没有 Lean。换句话说,越是新近的结果,越缺机器校验。(另有 2 个目录未标注日期,因此这里按 720 篇分组。)

OpenAI 对此没有回避,README 原文是:

This collection includes results at different stages of verification. Not all have accompanying Lean formalizations. We will continue to update this repository with Lean formalizations as we obtain them.

后一句还补了半句:「部分未形式化的结果可能存在问题」(Some of the unformalized results could have issues)。这句自我保留,比任何外部质疑都更有分量——它等于承认:722 这个数字里,混着不同成熟度的东西。

好消息是,模型这次不只交了结论,还交了思维过程摘要。reasoning_traces/ 目录下公开了 10 个结果族的推理链(族 007、017、087、102、159、197、221、271、287、362),从「π 的无理指数是 2」到「Mézard–Parisi 公式」,都是可以逐段读的。

reasoning_traces 目录:公开了 10 个结果族的推理摘要 PDF,含 π 无理指数、Mézard–Parisi 公式、自由群因子同构等

推理摘要示例:π 的无理指数为 2,Part I 从 Flint–Hills 级数收敛讲到高度障碍,含 verbatim 摘录

两处例外:Hodge 猜想与 ζ 函数

README 把「不按标准流程走」的工作单独点了出来:

Exceptions to this fixed procedure include work on a zero-free region for the Riemann zeta function and proof of the Hodge Conjecture for CM abelian varieties.

CM 阿贝尔簇上的 Hodge 猜想——Hodge 猜想本身是千禧年七大难题之一,CM 情形是它的一个重要特例方向。The Verge 在报道里也确认,这批结果中「包含与一个千禧年难题相关的结果」。另有黎曼 ζ 函数的无零点区域工作,其中 Re(s) > 11/12 的那份写作为了可读性经过了人工编辑——这一条 OpenAI 主动写在了 README 里,属于必要的披露。

需要说清楚的是:这不等于千禧年难题被解决。README 只说自己做了 CM 情形的证明工作,而完整 Hodge 猜想仍在开放状态。把它读成「AI 攻克千禧年难题」,是对这批材料最常见的误读。

时机很微妙:顾问组 9 月底刚说「别把数学当营销」

更耐人寻味的是时间线。今年 9 月底,一个名为 AGMAI(Advisory Group on Mathematics and Artificial Intelligence)的独立数学家顾问组发布了第一份建议,其中明确要求 AI 公司:

  • 尽快发布数学结果,且尽量走既有学术渠道;
  • 披露模型名称、提问方式与算力成本;
  • 「不要把数学结果的发布当作推广自家模型的营销手段」(refrain from treating the release of mathematical results as marketing vehicles)。

不到两周,722 篇手稿就以「一次 commit 全量倾倒」的方式上线了。OpenAI 对此的说明是:这批结果通过 GitHub 仓库发布,带有论文修订与引用协议,同时也在探索其他符合委员会指南的社区托管方案。

客观地说,这次发布确实附带了算力估算、题目数量、推理摘要和形式化清单,比「只发一条推文宣布突破」要透明得多。但「GitHub 一次性倾倒 722 篇、其中 560 篇没有机器校验、全部未经同行评议」这套做法,仍然把数学界推到了一个不轻松的位置:没有任何一个数学社区能在一夜之间消化 722 篇手稿。

争议的另一半指向更现实的问题:这些结果建立在大量人类数学家的既有工作上,如何署名、如何引用、如何区分「模型独立完成」与「模型站在前人肩膀上」,行业至今没有共识。The Verge 的报道把这一年的状态概括为——AI 实验室冲进数学的速度,已经让研究实践、学术伦理与署名规则同时承压。

为什么这件事值得记一笔

抛开立场,三个可验证的事实值得留下:

  1. 规模真实存在:722 篇手稿、372 个结果族、约 4000 道题的评测过程,都能在公开仓库里逐条点开核对,不是宣传语。
  2. 校验缺口是明账:能对上 Lean 形式化的约 162 篇(22.4%),越新的批次越少;OpenAI 自己也承认未形式化的部分「可能存在问题」。这个比例,比「多少个开放问题被解决」更能说明当前的水平与边界。
  3. 发布机制正在被倒逼成形:顾问组的建议、仓库的修订与引用协议、推理摘要的公开,都是这一轮之后才被迫明确下来的规则。对后来者来说,这套「怎么发、发什么、披露到哪一层」的默契,可能比 722 这个数字更有长期价值。

对普通用户而言,最直接可用的部分反而是 reasoning_traces/ 里那 10 份推理摘要——它们展示了大模型在真实前沿问题上的思考长相:不是灵光一闪,而是大量失败的路线、被排除的构造和一步步收紧的界。想理解「AI 做数学」到底长什么样,从那里开始读,比看新闻标题有用得多。

总结

  • 10 月 7 日,OpenAI 在 GitHub 公开 openai/math:722 篇手稿 / 372 个结果族,来自内部未发布模型;
  • 官方口径:评测约 4000 道题,平均每个结果约 3 小时 ChatGPT Pro 算力,结果经聚合与显著性筛选;
  • 校验是明账:约 162 篇带 Lean 形式化(22.4%),其余约 560 篇未经机器校验,全部未经同行评议;
  • README 点名两处例外:CM 阿贝尔簇的 Hodge 猜想与 黎曼 ζ 函数无零点区域(后者写作经人工编辑),但完整 Hodge 猜想仍开放;
  • 发布时机紧贴 AGMAI「别把数学当营销」的建议,把「AI 与数学界如何相处」的问题从伦理讨论推向了具体机制。

图片出处:封面与「数字解剖」「校验缺口」示意图由 UU AI Hub 自制;仓库首页、CONTENTS.md、reasoning_traces 目录、overview.pdf 与 π 推理摘要页面取自 OpenAI 公开仓库 openai/math。

Related

相关文章

延伸阅读

查看全部 →
Mistral

Mistral Large 4「Le Chonk」:1 万亿参数、3800 张自训 GPU,欧洲把开源权重押成主权牌

Mistral 10 月 6 日发布 Mistral Large 4 公开预览:1 万亿参数、520 亿激活的原生多模态 MoE,在 3800 张 NVIDIA Grace Blackwell 上于自有欧洲数据中心从零训练,权重月底放出。网络安全基准上「复现并修补真实漏洞」拿到 82%,官方称为全场最高——Claude Opus 5.5 与 GPT-6 Astra 因拒绝执行而接近 0 分。

Aleph Alpha

Aleph Alpha 开源 Kolibri:78B 只激活 3.46B,欧洲用「主权」切开源模型这条口子

Aleph Alpha 在德国统一日开源 Kolibri:英德双语 MoE,78B 总参数、每 token 约 3.46B 激活,1M 上下文,权重已在 Hugging Face 按 Apache 2.0 发布。它把「主权」拆成研发主权与部署主权两件事,并把 EU AI Act、GDPR 与版权合规写进训练数据治理(450 万条 URL 黑名单);本文拆解参数取舍、官方基准与 Cohere 合并背景。

Reflection AI

Reflection AI 开源 501B 的 Beam:23B 激活、1/3 推理算力,西方开源权重的正面回应

英伟达投资的 Reflection AI 于 10 月 5 日发布首个开源权重模型 Beam:稀疏 MoE,501B 总参数只激活 23B,23.8T token 预训练、1 亿次 RL rollout。官方称推理能力接近 GLM-5.2 而推理算力只要 1/3 至 1/4,但自家对比表里多数编程任务仍落后 GLM-5.3、Kimi K3 与 DeepSeek V4.1 Flash;权重按 Apache 2.0 本月晚些放出。