ポアンカレ予想、機械が一行ずつ検証
証明を確かめることは、数学で最も骨の折れる作業の一つだ。議論がいくつもの分野にまたがる場合はなおさらだ。AIが証明づくりを加速させるにつれ、信頼できる検証の重要性は増している。Lean 4のような証明支援系は、その一つの答えになる。定義、命題、証明をコードとして書き、ソフトウェアの中核にある小さな信頼できる部分、「カーネル」があらゆるステップを検証する。カーネルを通った証明は、その命題を確立する。人間に残されるのは、その命題が本当に数学者の意図どおりのことを言っているかを確かめることだ。
凝縮された証明と、足りないライブラリ
ペレルマンが証明したポアンカレ予想は、閉じた単連結の3次元多様体、くだけた言い方をすれば、輪がひっかかるような穴のない有限の3次元空間は、すべて3次元球面と同等だと述べる。証明は、リチャード・ハミルトン(Richard Hamilton)が始めたリッチフローの計画にのっとっている。ペレルマンの2002〜2003年の三つのプレプリントは、鍵となる議論をきわめて凝縮した形で示した。そのあとに詳しい解説が続き、その中にこのプロジェクトがよりどころにした、ジョン・モーガン(John Morgan)とガン・ティアン(Gang Tian)による2007年のモノグラフがある。
この証明は幾何解析に頼っているが、LeanのコミュニティーライブラリMathlibには、それがほとんどなかった。基礎の多くを一からつくらなければならなかった。
数学者が凍結した節目
北京大学と北京のほかの研究機関のジーユエン・ジャン(Zhiyuan Zhang)、アクセル・ドゥラヴァル(Axel Delaval)、ビン・ドン(Bin Dong)、チュンレイ・リウ(Chunlei Liu)らは、2026年5月に作業を始めた。数学の素養をもつ3人の「AIエンジニア」が、数学者と並んで働いた。最初のやり方、つまり背景理論を大きなかたまりごとに形式化する方法は進みが遅く、できあがったコードも期待に届かなかった。
2026年9月、彼らは一からやり直した。証明は約90の節目に切り分けられた。それぞれが、必要な定義をともなう正確なLeanの命題だ。数学者はこれらの命題を、形式化される前か、その最中に見直し、そのあと命題は凍結された。エージェントはそれを変えられず、修正はすべて数学者を通して行われた。エージェントが書いたすべての行を読める人はいないので、これらの節目が、人間が数学を検証するチェックポイントになった。
そのうえでエージェントたちが並行して作業した。コーディングツール(主にCodexとClaude Code)を使った対話的なセッションと、Archon Horizonと呼ばれるシステムを通じてだ。このシステムは、範囲を区切った「ミッション」を多数のサーバーに割り振る。ボットが各貢献をコンパイルし、受け入れたものを統合した。命題の形式化と証明の構築の大半はGPT-6-Astraが担い、Fable-5.1は独立した確認、行き詰まったタスクの診断、命題の見直しに使われた。
約2週間で280万行
数か月の準備のあと、主要な形式化にかかったのは2週間あまりだった。AIのサブスクリプションとレンタルサーバーの費用は約2万5000ドル。この成果は、定理の位相的な版と滑らかな版の両方を証明し、全体がコンパイルを通り、Mathlibだけで書かれた目標の命題に照らした独立した確認にも合格している。
その規模は途方もない。Leanで約320万行あり、最終的な定理が依存する部分だけを残すと280万行になる。著者らの数えでは、その半分近くが背景理論だ。モーガンとティアンがたった一つの脚注で触れている古典的な結果(3次元多様体上の滑らかな構造についてのもの)だけで、約65万行を要した。
それでも人間がしたこと
著者らは障害を三種類に分ける。数学的な穴、Leanでの実装の問題、そして連携の問題だ。人間は命題の範囲を決め(たとえば、ある結果を3次元に限るのはいつか)、欠けている議論を見つけ(エージェントが見つけられなかった局所コンパクト性のステップなど)、隠れた仮定を見抜いた。彼らの主な教訓はこうだ。作業の組み立て方は、エージェントの能力と同じくらい重要だった。Anthropicが最近行ったフェルマーの最終定理の形式化からも、彼らは同じ結論を引き出している。そちらも、初期の試みがプロジェクトの状態を見失ったため、やり直さなければならなかった。
検証済み、だがまだ整っていない
著者らは、この仕事が終わったとは考えていない。コードは重複だらけで、エージェントの証明はいつも参照した道筋をたどっているわけではない。これを再利用できる幾何解析のライブラリに仕上げるのが次の仕事だ。別のチームによる同じ予想の独立した形式化も発表されている。彼らの願いは、いつか一人の数学者がこうした道具を使って、自分の研究を検証できるようになることだ。
利益相反。 チームは、作業の大半をこなしたOpenAIのサブスクリプション経由のGPT-6-Astraと並んで、どちらもAnthropic製のClaude CodeとFable-5.1モデルを使った。論文はまた、このプロジェクトをAnthropicによるフェルマーの最終定理の形式化と比べている。この記事はClaudeが書いたものだ。
