OpenAI/官方:未發布內部模型一次過公開七百二十二份數學手稿——約四千題篩出三百七十二組成果,平均每項耗約三小時 ChatGPT Pro 推理;一百六十二份附 Lean 形式化,數學界仍批「新聞稿式數學」

重點摘要

OpenAI 於十月六日公開一批由未發布內部前沿模型產出的數學成果,以 GitHub 儲存庫形式一次過放出七百二十二份手稿,歸納為三百七十二組「成果家族」。官方指模型在評估期間共獲派約四千道題目,平均每項成果耗用相當於約三小時 ChatGPT Pro 推理的算力;目前有一百六十二份論文的主要結果附 Lean 電腦形式化證明,其餘仍待核證,官方亦承認未形式化的結果「可能有問題」。

OpenAI/官方:未發布內部模型一次過公開七百二十二份數學手稿——約四千題篩出三百七十二組成果,平均每項耗約三小時 ChatGPT Pro 推理;一百六十二份附 Lean 形式化,數學界仍批「新聞稿式數學」

OpenAI 於十月六日公開一批由未發布內部前沿模型產出的數學成果,以 GitHub 儲存庫形式一次過放出七百二十二份手稿,歸納為三百七十二組「成果家族」。官方指模型在評估期間共獲派約四千道題目,平均每項成果耗用相當於約三小時 ChatGPT Pro 推理的算力;目前有一百六十二份論文的主要結果附 Lean 電腦形式化證明,其餘仍待核證,官方亦承認未形式化的結果「可能有問題」。

儲存庫列出的成果包括聲稱證明加泰蘭常數為無理數、π 的無理性指數等於二、有理數域上的希爾伯特第十問題,以及狄利克雷 L 函數在實部大於八分之七的半平面無零點等。不過,獨立數學諮詢組早前已要求 AI 實驗室透過學術渠道發表、避免把數學成果當作模型宣傳,多位數學家批評今次仍屬「新聞稿式數學」。對香港的研究機構與企業而言,重點不在追捧單一突破,而在於如何驗證、引用與管理大批 AI 產出的專業成果。

OpenAI 一次過公開七百二十二份 AI 數學手稿:約四千題篩出三百七十二組成果,Lean 形式化成核證關鍵

本文根據 OpenAI 官方研究公告(二零二六年十月六日)、官方 GitHub 儲存庫的說明文件、成果目錄與 Lean 形式化目錄,並對照 The Verge(Robert Hart)與 WIRED(Isabella Ward)同日報道整理,來源真實性已驗證。需要強調:以下數學成果均為 OpenAI 自行公布,尚未經同行評審;文中描述的是「聲稱證明」,而非數學界已確認的定論。

一、核心事件:從「解了逾百題」到正式放出手稿

OpenAI 九月時曾表示,內部模型已「解決逾一百道橫跨大部分數學領域的長期開放難題」(本站九月二十二日亦曾報道其成立獨立數學諮詢組)。今次是首次把具體成果連同文稿正式公開。

技術細節

  • 規模:儲存庫說明列明目前收錄七百二十二份手稿,歸入三百七十二個成果家族;每個家族可包含主要結果、配套論證、推論或另一種證明,並按數學分支分類。
  • 產出流程:官方指絕大部分結果以同一固定流程、由同一個未發布內部模型產出,模型共獲派約四千道題目,再按重要性門檻篩選、整理成目錄。平均每項成果耗用約三小時 ChatGPT Pro 推理算力。
  • 例外:黎曼 ζ 函數無零區域的相關工作,以及 CM 阿貝爾簇的 Hodge 猜想證明,並非用固定流程完成;其中實部大於十二分之十一無零區域的文稿,官方註明曾經人手編輯以提升可讀性。
  • 形式化:Lean 形式化目錄(v0.4 版)列出一百六十二份主要結果已形式化的論文;官方表示會陸續補上更多形式化。
  • 推理摘要:公開十份模型推理過程的節錄摘要,題目涵蓋乘法函數雙點相關、π 的無理性指數、Mahler 猜想、半正定門檻的 NP 困難性、算術級數的擬多項式界、Kaplansky 直接有限性猜想、稀釋自旋玻璃的 Mézard–Parisi 公式、量子 Heisenberg 鐵磁體自發磁化、自由群因子同構,以及三維相對論 Vlasov–Maxwell 系統。
  • 版本管理:官方承諾保留公開版本歷史,更正與修訂以新版本記錄,舊版仍可存取;每份手稿附獨立引用格式。

成果目錄中最受注目的條目包括:證明每個狄利克雷 L 函數(包括黎曼 ζ 函數)在實部大於八分之七的半平面內無零點(目錄稱為「擬黎曼假設」);否定解決有理數域上的希爾伯特第十問題,即不存在演算法能判定任意整係數多項式是否有有理數解;證明加泰蘭常數為無理數;以及證明 π 的無理性指數為二。目錄另列出與 Birch–Swinnerton-Dyer 猜想相關的部分結果。上述每一項若最終成立,在各自領域都屬重大進展,因此更需要時間由專家逐份審閱。

二、技術原理深度解析

1. 「大量出題、自動篩選」取代單點突破

OpenAI 解釋,原有數學評測基準已經飽和,因此改以開放研究難題作評估,並允許模型在早前自身產出的結果上繼續推進。這代表研究模式已由「挑一道名題全力攻堅」,轉為「批量派題、以算力換覆蓋面,再按重要性篩選」。約四千題篩出三百七十二組成果,本身亦說明大部分嘗試未有達到收錄門檻。

2. Lean 形式化:把「相信」變成「可核對」

Lean 是一種可由電腦逐步檢查數學證明的程式語言。若一份證明的主要定理已在 Lean 中完成形式化並通過檢查,讀者毋須逐行信任模型的文字推理,只需確認定理陳述是否正確對應原命題。今次約七百多份手稿中只有一百六十二份主要結果已形式化,意味着大部分文稿仍需人手審閱;官方亦坦言部分未形式化結果可能存在錯誤,會盡快修正。

3. 推理摘要與算力披露

數學家諮詢組九月底的建議,要求 AI 實驗室披露模型名稱、提示詞及算力成本。OpenAI 今次提供推理摘要、以 ChatGPT Pro 使用量換算的算力估算及嘗試題數統計,屬部分回應;但模型名稱仍未公開,模型本身亦未發布,官方只表示正「負責任地」準備推出。

三、日常應用場景

1. 開發者與技術團隊

形式化驗證不只屬於純數學。金融結算邏輯、密碼學協議、智能合約與安全關鍵系統,同樣可以用 Lean 或類似工具把「AI 寫的程式」轉化為「可機器核證的程式」。今次案例顯示,AI 產出規模一旦以百計,人手覆核根本追不上,自動化核證管線會成為工程團隊的必要投資。

2. 企業與研究機構

藥廠、物料科學、量化交易等依賴數學建模的行業,可預期前沿模型很快會以「批量假設、批量證明」方式進入研發流程。企業需要建立的不是單一模型,而是一套管理 AI 成果的制度:版本追蹤、來源標註、引用規範、內部審核與知識產權歸屬。OpenAI 在儲存庫內設立修訂與引用協定,正是同一問題的公開示範。

3. 一般用戶與學生

官方披露平均每項成果約需三小時 ChatGPT Pro 推理,反映高階推理仍然昂貴,一般用戶短期內未必能以同等算力重現。學生與教師則需正視:AI 已能大量產出研究級文稿,學術誠信、署名與評核方式都要重新設計。

4. 香港與亞洲市場視角

香港各大學數學系與研究院,可以把這批文稿視為審閱與教學素材,同時參與形式化驗證工作,在全球核證工作中佔一席位。政府近期提出推動人工智能研發及 AI Agent 安全管理指引,學界與業界亦可借鏡今次爭議,預先訂立 AI 產出研究成果的披露與署名守則。對本地企業而言,若要在內部研發中大量使用 AI 推理,數據與成果的保密及審計記錄同樣重要。

四、專業評價與潛在考量

優勢

  • 公開規模空前,且以儲存庫、版本記錄及獨立引用格式發布,比單篇網誌或社交平台貼文更利於學界核對與追蹤。
  • 附帶 Lean 形式化、推理摘要與算力估算,透明度較以往同類公告有所提升。
  • 官方承諾資助工作坊、研討會及專題計劃,協助學界消化 AI 產出的重大結果。

需要留意的地方

  • 未經同行評審:所有結果均屬 OpenAI 自行公布;形式化只覆蓋部分論文,官方亦承認未形式化結果可能有問題。
  • 發表方式爭議:據 The Verge 報道,獨立數學諮詢組九月底建議 AI 實驗室盡可能經既有學術渠道發表,並「避免把數學成果當作推廣模型的工具」。據 WIRED 報道,曾參與八月閉門會議的西北大學數學家 Bryna Kra 指學界要求以論文形式發表的意見「顯然被忽略」,並批評「以推文和新聞稿做數學」不利學術生態;紐約大學訪問教授 Nestor Guillen 則指,數學界對 AI 公司存在「黑幫作風」的觀感。OpenAI 發言人對相關形容表示不認同,並稱正與數學界合作。
  • 署名與功勞歸屬:WIRED 同時重提九月 Navier–Stokes 相關成果的署名爭議,學界對 AI 公司如何歸功於其所依賴的人類前作仍有疑慮。
  • 一次過大量發布:數百份研究級文稿同時面世,審閱工作量遠超正常學術節奏,錯誤可能需要較長時間才被發現。

結語

今次發布標誌着 AI 數學研究由零星宣佈進入「批量出版」階段:七百二十二份手稿、三百七十二組成果、一百六十二份 Lean 形式化,數字背後真正的挑戰是核證與信任。未來數月,關注點將落在三方面:學界對重點成果(如擬黎曼假設、希爾伯特第十問題、加泰蘭常數無理性)的審閱結論;OpenAI 會否改用社群主導的發表平台;以及產出這批成果的模型何時、以何種形式開放。

對香港企業而言,若希望在內部研發或專業工作中使用大型語言模型,同時確保數據與成果留在自家環境、保留完整審計記錄,可參考 YSK Limited 的企業私有 LLM 全託管方案(年費 HK$88,000 起,https://ysk.hk/services/ai-automation);如需要額外的開發人手建立 AI 驗證或自動化管線,亦可了解遠端開發者外判服務(HK$2,000/月起,https://ysk.hk/services/outsourcing)。


參考來源

  1. OpenAI 官方研究公告:Sharing AI progress in mathematics(2026-10-06)https://openai.com/index/sharing-ai-progress-in-mathematics
  2. OpenAI 官方 GitHub 儲存庫(說明文件、成果目錄 CONTENTS.md、Lean 形式化目錄 formalization.yaml)https://github.com/openai/math
  3. The Verge:OpenAI drops another batch of mathematical breakthroughs(Robert Hart,2026-10-06)https://www.theverge.com/ai-artificial-intelligence/1005004/openai-math-release-github
  4. WIRED:OpenAI Is Pissing Off a Bunch of Mathematicians—Again(Isabella Ward,2026-10-06)https://www.wired.com/story/openai-is-pissing-off-a-bunch-of-mathematicians-again/
  5. 發現渠道:OpenAI 官方 RSS、The Verge RSS

延伸閱讀 · 相關服務與產品