Anthropic 宣布 Claude 完成費馬大定理 Lean 形式化:十一日自主寫出首份電腦核證證明

Key takeaway

Anthropic 於 2026 年 9 月 4 日在官方研究頁發布《Formalizing Fermat's Last Theorem》,並由驗證帳號 @AnthropicAI 同步披露:Claude 以 Lean 證明助手,在約十一日內大致自主完成費馬大定理(Fermat's Last Theorem, FLT)的端到端電腦可核證證明。本文已核對 Anthropic 研究原文與公開披露細節,來源真實性已驗證。重點包括:多代理協作與 Prove2Me 平台、約一千三百萬行 Lean、約二萬九千五百條中間定理,以及對科研審稿與企業 AI 可驗證性的含義。

Anthropic 宣布 Claude 完成費馬大定理 Lean 形式化:十一日自主寫出首份電腦核證證明

Anthropic 宣布 Claude 完成費馬大定理 Lean 形式化:十一日自主寫出首份電腦核證證明

Anthropic 於 2026 年 9 月 4 日在官方研究頁發布《Formalizing Fermat's Last Theorem》,並由驗證帳號 @AnthropicAI 同步披露:Claude 以 Lean 證明助手,在約十一日內大致自主完成費馬大定理(Fermat's Last Theorem, FLT)的端到端電腦可核證證明。本文已核對 Anthropic 研究原文與公開披露細節,來源真實性已驗證。重點包括:多代理協作與 Prove2Me 平台、約一千三百萬行 Lean、約二萬九千五百條中間定理,以及對科研審稿與企業 AI 可驗證性的含義。

一、核心事件:把「人類核對要花幾年」改成「電腦一鍵複核」

技術細節

費馬大定理斷言:對任何整數 n > 2,不存在正整數 a、b、c 滿足 aⁿ + bⁿ = cⁿ。Andrew Wiles 於 1995 年發表首份正確證明,篇幅約一百二十九頁,人類複核曾耗費大量時間;證明過程中還曾出現需修復的關鍵缺口。

形式化(formalization)是把人類可讀論證,改寫成證明助手(如 Lean)可逐步核對的程式。Anthropic 指出,社群預期 FLT 形式化需時多年;Kevin Buzzard 於 Imperial College London 啟動的 Lean 社群藍圖,僅初始階段描述已達約八十六頁。

據 Anthropic,研究員 Tianyi Peng(同時在 Columbia University 開發 AI 形式化工具)測試 Claude 能否推進 FLT 形式化,結果超出預期:約十一日內,Claude 產出首份端到端、電腦已核對的 FLT 證明,過程寫出約一千三百萬行 Lean,並證明約二萬九千五百條最終證明所用的中間定理(全文另述途中累計約三萬零三百條定理級結果)。Kevin Buzzard 評論稱,該自動形式化「僅以數學公理為假設」證明 FLT,並顯示 AI 形式化產物已足夠穩健、可被後續工作建基於其上。

Anthropic 強調:與近期涉及黎曼假設相關「新數學」的研究不同,本次重點是核證——把證明正確性交由電腦像計算一樣檢查。證明路徑大致依循 Darmon、Diamond 與 Taylor 對 Wiles 證明的簡化闡述;人類輸入主要是高層指示(例如優先處理某些定理),而非逐行手寫 Lean。

二、技術原理深度解析

證明助手要求每一步都顯式成立,不能略過「對人類顯然」的推理,也只能依賴已形式化的極小部分數學基礎。早期多代理嘗試一度失敗:代理難以維持專案狀態、協作失序;失敗嘗試仍貢獻最終證明約百分之七的非樣板程式碼行。

關鍵轉折是切換至 Prove2Me——由 Peng 與協作者設計的開源協作形式化平台。Anthropic 歸納三點機制:

  1. 定理依賴圖(DAG):代理據此選擇下一步該證什麼,緩解記憶退化,並支援並行。
  2. 陳述與證明分檔:降低 Lean 編譯與資源成本,獨立維護連結。
  3. 自然語言定理描述:方便搜尋與重用,縮短證明路徑。

在 Prove2Me 與基於 Claude Code 的多代理編排下,團隊以約少於兩週完成;過程消耗約六十億輸出 token,所用為 Anthropic 內部通用研究模型,能力大致可比 Claude Fable 5.1。完成後由 Lean 檢查,僅使用 Lean 三條標準公理;比較器確認定理陳述與 Mathlib 中 FLT 陳述一致。最終證明規模約為 Mathlib(主要社群數學庫)的五倍以上——Anthropic 亦提醒,這部分因 Mathlib 精煉、而本次產物可能偏冗長。

Anthropic 另做小規模實驗:以三個個人 Claude Max 方案,經 Prove2Me 協作,約三日完成 Vinogradov 三質數定理(Three Primes Theorem)形式化,說明在合適脚手架下,消費級訂閱亦可支撐大型協作形式化。

三、日常應用場景

1. 開發者與技術團隊

形式化把「證明」變成可編譯、可回歸的工程產物。對建構證明助手工具鏈、數學庫(Mathlib)、或需要機器可檢查規範的團隊,多代理 + DAG 任務圖提供可複製編排:狀態外置、任務可並行、失敗可重試。開發者亦可參考 Prove2Me 與公開證明倉庫,把大型規格拆成可驗證子目標。

2. 企業與隱私敏感行業

金融、法律、醫療與受監管行業,愈來愈需要「模型輸出可被獨立核對」。形式化不一定直接等於業務合規,但它示範一條路徑:關鍵論證以機器可檢查的形式交付,降低單靠黑盒生成結果的風險。香港企業若要把領域知識留在境內、同時要審計軌跡,私有部署與可驗證工作流往往比純公雲對話更合適。

3. 一般用戶

對一般讀者,意義不在於親自讀一千三百萬行 Lean,而在於:AI 產出的複雜結論,開始有可能附帶「電腦已核對」的憑證,縮短「要不要信」的等待時間。Anthropic 亦表明,形式化證明不應取代人類可讀說明,而是與之並行。

4. 香港與亞洲市場視角

香港高校與量化、金融科技團隊長期關注形式方法與高保證軟體。當前沿模型能把經典大定理壓成可機檢產物,本地研發單位可評估:是否把規格、合約條款邏輯、風險模型假設,逐步納入可機器檢查的工件。對希望數據不出境的企業,亦可結合本港私有 LLM 託管,在內部跑類似的多代理核證流水線。

四、專業評價與潛在考量

優勢

  • 官方研究頁與驗證帳號同步披露,並有社群領袖(Kevin Buzzard)公開評價,可信度高。
  • 把多年級形式化目標壓到約十一日,展示脚手架(Prove2Me)與多代理編排的槓桿。
  • 直接回應數學界「審稿與錯誤累積」痛點:機器核證可減輕裁判負擔,並協助檢查 AI 生成數學。

需要留意的地方

  • 產物極長,精煉度與可讀性仍需人類數學家審視;形式化成功不等于提供人類友好的新證明敘事。
  • 高度依賴平台與編排;早期無 Prove2Me 時協作失敗,顯示「裸模型」不足以穩定完成此級專案。
  • 成本以数十億輸出 token 計,商業化落地需評估算力、授權與專案脚手架投入。
  • 企業場景不可把「數學形式化成功」直接等同「業務合規已完成」,仍需領域專家與法遵流程。

結語

Anthropic 這次 FLT 形式化,標誌的是核證基礎設施的躍進:當 AI 愈能生產長鏈論證,社會更需要可機檢的信任層。對香港企業而言,若要在境內部署可審計的 AI 研究或知識工作流,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境:https://ysk.hk/services/ai-automation)。


參考來源

  1. Anthropic Research, Formalizing Fermat's Last Theorem(2026-09-04):https://www.anthropic.com/research/formalizing-fermats-last-theorem
  2. 發現來源(Anthropic 官方 X):https://x.com/AnthropicAI/status/2095947707605266436

Related services & products