庞加莱猜想,由机器逐行核验
检查一个证明是数学中要求最高的任务之一,当论证横跨多个领域时尤其如此。随着AI加快了证明的产出,可靠的验证变得更加重要。Lean 4等证明助手提供了一种解决办法:定义、命题和证明都被写成代码,由软件中一个小而可信的核心——它的“内核”——检查每一步。一个通过内核检查的证明就确立了它的命题;留给人类的任务,是确认这个命题确实表达了数学家想表达的意思。
浓缩的证明,缺失的库
由佩雷尔曼证明的庞加莱猜想指出:每一个闭的、单连通的三维流形——通俗地说,就是一个有限的、没有任何能套住一个圈的“洞”的三维空间——都等价于三维球面。这一证明遵循理查德·汉密尔顿开创的里奇流纲领。佩雷尔曼在2002–2003年发表的三篇预印本以高度浓缩的形式给出了关键论证;随后出现了详细的阐述,其中包括约翰·摩根(John Morgan)和田刚2007年的专著,本项目正是以它为蓝本。
这一证明依赖于几何分析,而Lean的社区数学库Mathlib在这方面基本空白。大量基础内容只能从零开始构建。
由数学家冻结的里程碑
北京大学及北京其他机构的张志远(Zhiyuan Zhang)、Axel Delaval、董彬、刘春雷(Chunlei Liu)等人于2026年5月启动了这项工作:三名受过数学训练的“AI工程师”与数学家并肩工作。他们最初的做法——把大块的背景理论形式化——进展缓慢,产出的代码也未达到他们的预期。
2026年9月,他们推倒重来。证明被切分成约90个里程碑,每个都是一个精确的Lean命题,并附有它所需的定义。数学家们在这些命题被形式化之前或期间对其进行审核,然后将其冻结:智能体不能修改它们,任何更正都必须返回给数学家处理。由于没有人能读完智能体写下的每一行代码,这些里程碑就成了人类核验数学内容的检查点。
随后,智能体们并行工作:一方面通过与编程工具(主要是Codex和Claude Code)的交互式会话,另一方面通过一个名为Archon Horizon的系统——它把范围明确的“任务”分派到许多服务器上。一个机器人负责编译每一份贡献,并合并被接受的部分。GPT-6-Astra承担了大部分命题形式化和证明构建工作;Fable-5.1则用于独立检查、诊断卡住的任务以及审核命题。
约两周写出280万行
经过数月的准备,主体形式化工作只用了两周多一点。AI订阅和租用服务器的费用约为2.5万美元。这一成果同时证明了该定理的拓扑版本和光滑版本,能够完整编译,并通过了一项独立检查——与仅用Mathlib写成的目标命题进行比对。
它的规模极其庞大:约320万行Lean代码,只保留最终定理所依赖的部分后精简为280万行。按作者的统计,其中近一半是背景理论。摩根和田刚只在一个脚注中提到的一个经典结果——关于三维流形上的光滑结构——单独就占了约65万行。
人类仍然做了什么
作者把遇到的障碍分为三类:数学上的漏洞、Lean实现上的问题,以及协调上的问题。人类负责确定命题的范围(例如,何时把一个结果限制在三维),发现缺失的论证——比如一个智能体找不到的局部紧性步骤——并揪出隐藏的假设。他们得到的主要经验是:工作的组织方式与智能体的能力同样重要。他们从Anthropic近期对费马大定理的形式化中得出了同样的结论,那个项目也曾因早期尝试失去对项目状态的把握而不得不重新开始。
已经验证,但尚未整理
作者并不认为这项工作已经完成。代码中充斥着重复;智能体给出的证明并不总是沿着参考文献的路线;把它变成一个可复用的几何分析库是下一步的工作。另一个团队也已宣布对同一猜想进行了独立的形式化。他们的希望是:有一天,一位数学家能独自用这样的工具来验证自己的研究。
利益冲突。 该团队使用了Claude Code和Fable-5.1模型,两者都来自Anthropic;同时使用了通过OpenAI订阅调用的GPT-6-Astra,后者完成了大部分工作。论文还将该项目与Anthropic对费马大定理的形式化进行了比较。本文由Claude撰写。
