← 返回全部文章

文章 ·

OpenAI 一次公开 722 篇数学手稿,数学家的价值会如何变化?

当 AI 能批量提出数学结果,选题、核验、理解与知识整合会怎样重新分工?从 OpenAI 的数学手稿发布谈起。

看到“722 篇数学手稿”这个数字,很容易把它理解成一场人与机器的竞赛:数学家花几年研究的问题,AI 是否已经可以批量解决?如果证明也能自动生成,数学家还剩下什么价值?

我更关心的是研究工作的分工。数学研究包含提出问题、寻找证明、检查论证、解释机制,以及把新结果接到已有知识上。AI 在其中一个环节取得进步,会改变其他环节的成本与重要性。

我的判断是:如果 AI 能稳定产出正确且有意义的结果,数学家的价值会更多体现在问题判断、概念创造和知识整合上。同时,部分以独立产出证明为核心的工作,也会承受真实的替代压力。 这是对未来分工的分析,并非这次发布已经证明的职业结论。

先看清 722 篇意味着什么

OpenAI 于 2026 年 10 月 6 日宣布公开一批数学研究结果。截至本文核对时,官方仓库列有 722 篇手稿,归为 372 个结果族(result families)。一个结果族可以包含主结果、配套论证、推论或另一种证明,因此篇数不能直接换算成解决开放问题的数量。

仓库称,这些结果来自尚未发布的内部模型,验证程度各不相同,部分未形式化结果可能存在问题。公开手稿与获得数学共同体认可之间,仍有需要完成的工作。来源:仓库说明

这里需要区分三件事:模型提出了一份论证;这份论证得到可靠核验;研究者理解了它的思想,并能在其他问题上使用。每一步都有价值,后一步也不能由前一步自动推出。

本文没有逐篇审查这些证明,也没有运行整个 Lean 工程。我讨论的是这次发布提出的研究组织问题,不对具体重大猜想是否已获解决作独立背书。

证明更容易产生之后,什么会变得稀缺?

可以设想一个未来情景:针对一个准确表述的问题,研究者能用相对低的成本得到多份候选证明,其中一部分还附有机器可检查的材料。

此时,研究者每天面对的任务可能从“怎样找到一条可行路线”,扩展为“怎样判断这些路线中哪些正确、哪些重要、哪些值得继续”。供给增加,会把筛选和理解推到更显眼的位置。

但这里有一个条件:增加的必须是可用结果,不能只有看起来像论文的文本。 如果每份输出都要专家花大量时间排除细微错误,生成速度越快,积压的核验工作可能越多。反过来,如果形式化工具和 AI 核验也持续进步,核验成本同样可能下降。

所以,“数学家以后主要给 AI 判卷”只是一个可能的过渡阶段。更长远的变化,取决于生成、核验和理解这几个环节各自进步多快。

下面是我对这种分工变化的概括,属于分析框架:

研究环节 AI 进步可能带来的变化 需要重新评价的贡献
提出问题 更容易生成猜想与候选方向 判断问题的重要性、可行性与关联
寻找证明 能探索更多构造与论证路线 设计有效的搜索方向,识别关键思想
核验结果 可更多使用形式化检查与自动辅助 核对命题、假设、依赖和实际覆盖范围
解释证明 更容易生成不同版本的讲解 提炼可迁移的机制,检验解释是否准确
组织知识 可辅助检索、归类和比较 建立概念联系,形成新的研究纲领

这些贡献也可能得到 AI 的帮助。人的优势需要在实际研究中体现,而不能只靠一句“机器没有直觉”来保证。

Lean 能检查证明,谁来检查证明了什么?

OpenAI 同时公开了部分结果的 Lean 形式化材料,并提供形式化目录。该文件说明其收录对象是具有形式化主结果的论文;不能据此推断每篇手稿的所有论断都已被覆盖。

对读者来说,一份形式化证明至少有两层需要核对。第一层是形式系统内部:证明对象是否在指定环境和依赖下通过检查。第二层是数学表达之间的对应:形式化命题是否准确表达了论文声称的结论。

例如,一篇论文讨论所有满足某条件的对象,形式化命题却额外加入了一个很强的假设。后者即使通过检查,也需要说明它与原命题之间的差距。类似地,关键结论若依赖尚未证明的前提,也应当把依赖列清楚。

这并不削弱形式化的价值。它让原本容易被自然语言掩盖的条件变得可见,给共同核验提供更明确的对象。但核验时还要问:哪些内容已经覆盖,哪些仍待补充,所用定义和假设是否符合研究目标?

数学家的领域知识在这里有具体用途:识别命题的含义、条件的强弱,以及结论与已有结果的关系。形式化专家则帮助把这种判断落实为可检查的材料。两种工作可以互相促进。

一份正确的证明,还能带来多少理解?

证明成立,意味着某个结论有了可靠依据。研究者接下来仍可能追问:哪个步骤真正起作用?为什么这个条件必要?是否存在更简单的证明?方法能否推广?

假设一个模型给出很长的正确证明,其中混合了多个技巧。另一位研究者找到一个简短引理,解释了整条论证为何可行,还指出它能用于另外一类问题。后者创造了新的研究价值,即使最初的定理已经被证明。

这也是我理解“数学家的价值变化”的核心:从一个结果中提炼出可复用的思想,可以产生比结果本身更广的影响。 教材、讲义、概念统一和新的证明方法,都在扩大知识的可使用范围。

当然,AI 也可能帮助简化证明、寻找推广和提出概念。我们不能把“解释”预先划成机器无法进入的领域。更有意义的评价是:谁的贡献让问题更清楚,让下一项研究更容易开始?

真正难以外包的判断,需要怎样建立?

一个好问题通常包含多重判断:它与重要结构是否有关,已有方法为什么卡住,可能的答案会改变什么,以及解决它需要哪些新工具。

这些判断来自长期研究经验,也可以被讨论、比较和修正。AI 可以提供大量候选问题,研究者则需要说明选择某一个的理由。模型提出一个新定义时,也要检查它是否只是改写旧概念,还是确实让不同现象得到统一解释。

对年轻研究者来说,这意味着基本功仍然重要。亲手尝试证明、构造反例、检查边界条件,既是在学习做题,也是在建立判断他人论证的能力。没有这些经验,很容易把流畅表达当成可靠解释。

训练方式则可以改变。例如,面对一份 AI 生成的证明,要求学生补出隐藏步骤、找出最强的假设、尝试削弱条件,再独立讲清楚核心机制。这种练习比单纯检查最终答案,更接近真实研究。

职业价值会受到制度和工具分配的影响

学术贡献如何获得署名、职位和经费,并不只取决于技术能力。如果评价继续高度依赖论文数量,而候选手稿的产出成本下降,指标就可能越来越难区分重要贡献与大量相似输出。

我的建议是,把贡献说明写得更具体:谁提出问题,谁设计研究过程,谁找到或修正论证,谁完成形式化,谁核对文献,谁负责最终内容。独立核验、简化证明和整理知识,也应当有获得认可的途径。这是制度建议,尚不能当成已经普遍实行的标准。

数学与人工智能顾问小组 AGMAI 在负责任发布建议中强调,人类理解应得到支持,而且相关工作应由数学共同体主导。它还明确反对使用共同体无法访问的专有模型测试高等数学问题。因此,OpenAI 咨询该小组,不能被理解为小组对其全部实践的认可。

这个分歧很实际:即使人人都能阅读手稿,也未必人人都能调用产生手稿的工具。如果模型访问、计算预算和核验资源集中在少数机构,研究机会就可能变得更不均等。公开结果、开放工具和公平获取资源,是不同层面的事情。

因此,即使数学家的某些能力变得更重要,也不能直接推出数学家的岗位、收入或议价能力会上升。知识生产的价值如何分配,还取决于资助、评价和工具获取制度。

我会关注哪些后续证据?

判断这次发布的长期意义,我会重点看四类进展:

  1. 独立核验。 哪些结论得到领域专家认可,哪些被修订,哪些仍存在争议?
  2. 理解与复用。 是否出现清楚的独立讲解、更简单的证明,以及使用这些思想的新研究?
  3. 过程透明度。 外部研究者能否了解问题选择、失败尝试和实际成本,并有条件复现相关探索?
  4. 贡献分配。 修正错误、完成形式化、补全文献和组织理解的人,是否获得明确的学术认可?

这些证据比手稿数量更能说明 AI 怎样改变数学研究。

722 篇手稿让一个问题变得具体:当机器越来越擅长寻找论证,我们如何把这些输出转化为共同体能够理解、检查和继续发展的知识?

数学家的工作会随工具改变。值得争取的方向,是让研究者有更多时间追问重要问题、创造有用概念,并把可靠结果变成可共享的理解。这个方向需要技术进步,也需要主动调整研究组织与评价方式。


资料与核对说明

事实核对日期:2026 年 10 月 8 日。仓库内容和验证状态可能继续更新;本文的职业与制度分析为作者观点。

评论

使用 GitHub 账号参与讨论。 前往 GitHub 评论

感谢阅读。 继续浏览文章 →