Điện toán & AIBản tiền ấn phẩmThí nghiệm5 phút đọc

POINCARÉ, ĐƯỢC MÁY KIỂM TRA TỪNG DÒNG MỘT

Kiểm tra một chứng minh là một trong những việc đòi hỏi khắt khe nhất của toán học, nhất là khi lập luận trải rộng qua nhiều lĩnh vực. Khi AI đẩy nhanh việc tạo ra các chứng minh, kiểm chứng đáng tin cậy càng trở nên quan trọng. Các trợ lý chứng minh như Lean 4 mang lại một câu trả lời: định nghĩa, mệnh đề và chứng minh được viết dưới dạng mã, và một lõi nhỏ đáng tin cậy của phần mềm, gọi là “nhân” (kernel), kiểm tra từng bước. Một chứng minh vượt qua được nhân sẽ xác lập mệnh đề của nó; việc còn lại cho con người là kiểm tra xem mệnh đề đó có thật sự nói đúng điều các nhà toán học muốn nói hay không.

Một chứng minh cô đọng, một thư viện còn thiếu

Giả thuyết Poincaré, được Perelman chứng minh, phát biểu rằng mọi đa tạp ba chiều khép kín, đơn liên — nói nôm na là một không gian 3D hữu hạn không có lỗ thủng nào khiến một vòng dây có thể mắc vào — đều tương đương với mặt cầu ba chiều. Lời chứng minh đi theo chương trình dòng Ricci do Richard Hamilton khởi xướng. Ba bản tiền ấn phẩm năm 2002–2003 của Perelman đưa ra các lập luận then chốt ở dạng hết sức cô đọng; sau đó là những bản trình bày chi tiết, trong đó có chuyên khảo năm 2007 của John Morgan và Gang Tian mà dự án này đi theo.

Lời chứng minh đó dựa vào giải tích hình học, thứ mà thư viện cộng đồng của Lean, Mathlib, phần lớn còn thiếu. Rất nhiều phần nền tảng phải xây dựng từ đầu.

Những cột mốc do các nhà toán học cố định

Zhiyuan Zhang, Axel Delaval, Bin Dong, Chunlei Liu và các đồng nghiệp ở Đại học Bắc Kinh cùng các cơ sở khác tại Bắc Kinh bắt đầu vào tháng 5 năm 2026: ba “kỹ sư AI” có nền tảng toán học làm việc bên cạnh các nhà toán học. Cách tiếp cận đầu tiên của họ — hình thức hóa từng khối lớn lý thuyết nền — rất chậm, và mã tạo ra không đạt kỳ vọng.

Vào tháng 9 năm 2026, họ làm lại từ đầu. Lời chứng minh được chia thành khoảng 90 cột mốc, mỗi cột mốc là một mệnh đề Lean chính xác kèm các định nghĩa nó cần. Các nhà toán học rà soát những mệnh đề này trước hoặc trong khi chúng được hình thức hóa, rồi cố định chúng: các tác tử không được thay đổi, và mọi chỉnh sửa đều phải quay lại qua tay các nhà toán học. Vì không ai có thể đọc hết từng dòng mà các tác tử viết, những cột mốc này trở thành các trạm kiểm soát nơi con người kiểm chứng phần toán học.

Sau đó các tác tử làm việc song song, qua những phiên tương tác với các công cụ lập trình — chủ yếu là Codex và Claude Code — và qua một hệ thống tên là Archon Horizon, vốn phân phát các “nhiệm vụ” có giới hạn tới nhiều máy chủ. Một bot biên dịch từng đóng góp và hợp nhất những đóng góp được chấp nhận. GPT-6-Astra gánh phần lớn việc hình thức hóa mệnh đề và xây dựng chứng minh; Fable-5.1 được dùng cho các kiểm tra độc lập, chẩn đoán những tác vụ bị tắc và rà soát mệnh đề.

2,8 triệu dòng trong khoảng hai tuần

Sau nhiều tháng chuẩn bị, phần hình thức hóa chính chỉ mất hơn hai tuần. Thuê bao AI và máy chủ thuê tốn khoảng 25.000 đô la. Công trình chứng minh cả phiên bản tô pô lẫn phiên bản trơn của định lý, biên dịch trọn vẹn và vượt qua một phép kiểm tra độc lập dựa trên các mệnh đề mục tiêu chỉ viết bằng Mathlib.

Nó đồ sộ: khoảng 3,2 triệu dòng Lean, rút gọn còn 2,8 triệu khi chỉ giữ lại những gì định lý cuối cùng phụ thuộc vào. Theo cách đếm của các tác giả, gần một nửa là lý thuyết nền. Một kết quả kinh điển mà Morgan và Tian chỉ nhắc đến trong một chú thích duy nhất — về các cấu trúc trơn trên đa tạp ba chiều — riêng nó đã chiếm khoảng 650.000 dòng.

Những việc con người vẫn phải làm

Các tác giả chia các trở ngại thành ba loại: lỗ hổng toán học, vấn đề triển khai trong Lean và vấn đề phối hợp. Con người xác định phạm vi của các mệnh đề (chẳng hạn, khi nào nên giới hạn một kết quả vào ba chiều), phát hiện những lập luận còn thiếu — như một bước về tính compact địa phương mà các tác tử không tìm ra — và bắt được những giả định ẩn. Bài học chính của họ: cách tổ chức công việc quan trọng ngang với năng lực của các tác tử. Họ rút ra cùng kết luận từ việc Anthropic gần đây hình thức hóa Định lý lớn Fermat, dự án cũng đã phải làm lại sau khi những nỗ lực ban đầu mất dấu trạng thái của dự án.

Đã kiểm chứng, nhưng chưa gọn gàng

Các tác giả không coi công việc đã hoàn tất. Mã đầy rẫy trùng lặp; các chứng minh của tác tử không phải lúc nào cũng đi theo con đường của tài liệu tham chiếu; và biến nó thành một thư viện giải tích hình học có thể tái sử dụng là việc tiếp theo. Một nhóm khác cũng đã công bố một bản hình thức hóa độc lập cho cùng giả thuyết. Họ hy vọng: một ngày nào đó, một nhà toán học đơn lẻ có thể dùng những công cụ như vậy để kiểm chứng nghiên cứu của chính mình.

Xung đột lợi ích. Nhóm đã dùng Claude Code và mô hình Fable-5.1, đều của Anthropic, bên cạnh GPT-6-Astra, được dùng qua thuê bao OpenAI, mô hình đã làm phần lớn công việc. Bài báo cũng so sánh dự án của mình với việc Anthropic hình thức hóa Định lý lớn Fermat. Bài viết này do Claude viết.

Legal notice