Komputasi & AIPracetakEksperimen3 menit baca

POINCARÉ, DIPERIKSA BARIS DEMI BARIS OLEH MESIN

Memeriksa sebuah bukti adalah salah satu tugas paling berat dalam matematika, terutama ketika sebuah argumen melintasi beberapa bidang. Ketika AI mempercepat produksi bukti, verifikasi yang andal menjadi makin penting. Asisten bukti (proof assistant) seperti Lean 4 menawarkan satu jawaban: definisi, pernyataan, dan bukti ditulis sebagai kode, dan inti perangkat lunak yang kecil dan tepercaya, yaitu “kernel”-nya, memeriksa setiap langkah. Bukti yang lolos dari kernel menetapkan pernyataannya; yang tersisa bagi manusia adalah memastikan bahwa pernyataan itu memang mengatakan apa yang dimaksud para matematikawan.

Bukti yang padat, pustaka yang belum ada

Konjektur Poincaré, yang dibuktikan oleh Perelman, menyatakan bahwa setiap manifold tiga dimensi yang tertutup dan terhubung sederhana — secara informal, ruang 3D berhingga tanpa lubang tempat sebuah simpul bisa tersangkut — setara dengan bola tiga dimensi. Buktinya mengikuti program aliran Ricci (Ricci flow) yang dirintis Richard Hamilton. Tiga pracetak Perelman pada 2002–2003 menyajikan argumen-argumen kunci dalam bentuk yang sangat padat; uraian terperinci menyusul kemudian, termasuk monografi tahun 2007 karya John Morgan dan Gang Tian yang diikuti proyek ini.

Bukti itu bertumpu pada analisis geometris yang sebagian besar belum tersedia di pustaka komunitas Lean, Mathlib. Banyak fondasinya harus dibangun dari nol.

Tonggak yang dibekukan oleh matematikawan

Zhiyuan Zhang, Axel Delaval, Bin Dong, Chunlei Liu, dan rekan-rekan di Universitas Peking serta lembaga lain di Beijing memulai pada Mei 2026: tiga “insinyur AI” berlatar belakang matematika bekerja berdampingan dengan para matematikawan. Pendekatan pertama mereka — memformalkan potongan besar teori latar — berjalan lambat, dan kode yang dihasilkan tidak memenuhi harapan mereka.

Pada September 2026, mereka memulai dari awal. Bukti itu dipecah menjadi sekitar 90 tonggak, masing-masing berupa pernyataan Lean yang tepat beserta definisi yang dibutuhkannya. Para matematikawan menelaah pernyataan-pernyataan ini sebelum atau selama pemformalannya, lalu pernyataan itu dibekukan: agen tidak boleh mengubahnya, dan setiap koreksi harus kembali melalui para matematikawan. Karena tidak ada yang bisa membaca setiap baris yang ditulis para agen, tonggak-tonggak ini menjadi titik periksa tempat manusia memverifikasi matematikanya.

Para agen kemudian bekerja secara paralel, melalui sesi interaktif dengan alat pemrograman — terutama Codex dan Claude Code — dan melalui sistem bernama Archon Horizon yang mengirimkan “misi” terbatas ke banyak server. Sebuah bot mengompilasi setiap kontribusi dan menggabungkan yang diterima. GPT-6-Astra menangani sebagian besar pemformalan pernyataan dan penyusunan bukti; Fable-5.1 dipakai untuk pemeriksaan independen, mendiagnosis tugas yang macet, dan menelaah pernyataan.

2,8 juta baris dalam sekitar dua pekan

Setelah berbulan-bulan persiapan, pemformalan utamanya memakan sedikit lebih dari dua pekan. Langganan AI dan sewa server menelan biaya sekitar US$25.000. Hasil pengembangan ini membuktikan teorema dalam versi topologis maupun versi mulus (smooth), terkompilasi sepenuhnya, dan lolos pemeriksaan independen terhadap pernyataan sasaran yang ditulis hanya dengan Mathlib.

Ukurannya sangat besar: sekitar 3,2 juta baris Lean, dipangkas menjadi 2,8 juta dengan hanya menyisakan bagian yang dibutuhkan teorema akhir. Menurut hitungan para penulis, hampir separuhnya adalah teori latar. Satu hasil klasik yang disebut Morgan dan Tian hanya dalam satu catatan kaki — tentang struktur mulus pada manifold tiga dimensi — sendirian menghabiskan sekitar 650.000 baris.

Apa yang masih dikerjakan manusia

Para penulis mengelompokkan hambatan ke dalam tiga jenis: celah matematis, masalah implementasi di Lean, dan masalah koordinasi. Manusia menentukan cakupan pernyataan (misalnya, kapan sebuah hasil dibatasi pada tiga dimensi), menemukan argumen yang hilang — seperti satu langkah kekompakan lokal yang tidak bisa ditemukan agen — dan menangkap asumsi tersembunyi. Pelajaran utama mereka: pengorganisasian kerja sama pentingnya dengan kemampuan agen. Mereka menarik kesimpulan yang sama dari pemformalan Teorema Terakhir Fermat yang baru-baru ini dilakukan Anthropic, yang juga harus dimulai ulang setelah upaya-upaya awal kehilangan jejak status proyeknya.

Terverifikasi, tetapi belum rapi

Para penulis tidak menganggap pekerjaan ini selesai. Kodenya penuh duplikasi; bukti-bukti dari agen tidak selalu mengikuti jalur rujukan; dan mengubahnya menjadi pustaka analisis geometris yang dapat dipakai ulang adalah tugas berikutnya. Pemformalan independen atas konjektur yang sama oleh tim lain juga sudah diumumkan. Harapan mereka: suatu hari seorang matematikawan seorang diri bisa memakai alat semacam ini untuk memverifikasi risetnya sendiri.

Konflik kepentingan. Tim ini memakai Claude Code dan model Fable-5.1, keduanya dari Anthropic, di samping GPT-6-Astra, yang dipakai melalui langganan OpenAI dan mengerjakan sebagian besar pekerjaan. Makalah ini juga membandingkan proyeknya dengan pemformalan Teorema Terakhir Fermat oleh Anthropic. Artikel ini ditulis oleh Claude.

Legal notice