OpenAI 公開內部前沿模型的一批新數學成果:附 Lean 形式化與算力披露
2026年10月6日,OpenAI 公開了一批由內部前沿模型產出的新數學結果。結果釋出在 GitHub 倉庫,附帶論文修訂與引用協議,幷包含大量證明的 Lean 形式化版本。OpenAI 還披露了推理摘要、算力估算和嘗試問題的統計:平均每項結果約耗費三小時 ChatGPT Pro 思考的算力。釋出流程參考了普林斯頓高等研究院(IAS)獨立諮詢小組的建議。OpenAI 稱正在負責任地推進該模型的對外發布,並將資助相關研討會與會議。
一、釋出了什麼 2026年10月6日,OpenAI 在其研究欄目發表《Sharing AI progress in mathematics》,公開了一批由內部前沿模型產出的新數學結果。關鍵詞是「一批」:這不是單篇論文,也不是單個定理,而是覆蓋面較廣的一組成果。OpenAI 把它們放進一個 GitHub 倉庫,並配上論文修訂與引用的協議。文章同時說明,團隊仍在探索符合諮詢委員會指南的、由社群託管的替代釋出渠道。 需要先說清邊界。原文沒有列出具體定理的名稱,也沒有給出解決了多少個問題的總數。它給出的是釋出方式、披露內容和一個平均算力數字。本文只依據這些已公開資訊來分析,不對具體數學內容作推測。 二、釋出流程:向數學界的規範靠攏 這次釋出最有意思的部分,是它的流程。OpenAI 表示,為了改進與數學界分享成果的方式,他們諮詢了普林斯頓高等研究院(IAS)的獨立「數學與人工智慧諮詢小組」,並參考其建議與公開推薦來決定如何釋出。
這背後的現實是:數學界有自己的發表、署名與審稿傳統。如果 AI 實驗室直接發一篇部落格說「我們的模型證明了某某」,數學家很難判斷真假,也不知道該如何引用。把結果放進帶修訂協議和引用協議的倉庫,等於承認這些成果需要被社群審閱、更正並正式引用。OpenAI 還承諾,未來的釋出會繼續改進論文質量,包括引用、數學表述和結果的呈現方式,讓讀者更容易理解。 三、Lean 形式化:讓機器來核對證明 倉庫裡的另一個重點,是許多證明的 Lean 形式化版本。Lean 是一種程式語言,可以讓計算機逐步檢查數學證明是否正確。 這一點對 AI 生成的數學尤其關鍵。語言模型可能寫出讀起來很嚴謹、卻含有隱蔽漏洞的論證,而人工審稿既慢又昂貴。形式化證明由證明檢查器逐條核對,只要形式化的陳述與原問題一致,證明本身就不必再靠信任。這樣,社群可以把精力放在兩個更難的問題上:這個形式陳述是否真的捕捉了原問題,以及這個結果有沒有數學價值。 OpenAI 明確說,會在取得更多形式化後繼續更新倉庫。這意味著今天並不是所有結果都已形式化。讀者應以倉庫的當前狀態為準。 四、透明度:推理摘要、算力和嘗試次數 除了成果本身,OpenAI 還在倉庫裡公佈了獲得這些結果的額外細節:10 份模型推理摘要、以 ChatGPT Pro 使用量折算的算力估計,以及嘗試問題數量的統計。已公佈的平均數字是:一項結果平均相當於約三小時的 ChatGPT Pro 思考算力。 這三類資訊各有用處。推理摘要讓外界看到模型是怎樣走到結論的。算力估計給出「一項結果大約值多少錢」的量級,這對評估 AI 科研的經濟性至關重要。嘗試問題的統計則回應了一個老問題:我們看到的成功,是從多少次失敗裡挑出來的?沒有分母的成功率沒有意義,公佈分母是一種難得的誠實。 需要注意的是,「三小時 ChatGPT Pro 思考」是 OpenAI 自己的折算口徑,並不等同於具體的 GPU 小時數,外界無法據此精確復算成本。這是讀數字時應保留的謹慎。 五、對科學界與行業的含義 對數學家而言,這是一個可以直接審閱的材料庫:論文、證明、統計都在同一處,並有明確的修訂與引用渠道。對 AI 行業而言,它給出了一個披露樣板:成果加形式化證明加算力賬本加失敗統計。以後其他實驗室宣佈類似進展時,讀者有理由以同樣的標準提問。
對企業而言,訊號更復雜。一方面,這表明前沿推理模型在長時間思考後,能產出可驗證的、研究級別的輸出。另一方面,OpenAI 只表示正在努力負責任地釋出產出這些結果的模型,並沒有給出時間表。因此,不應把它當成已經可用的產品能力。 對開發者來說,這次釋出還有一層啟發:評估推理模型,不能只看基準分數,還要看它能否交出別人可以獨立複核的產物。形式化證明、可追溯的推理摘要和公開的失敗統計,都是把「模型很強」這句話變成可檢驗結論的辦法。OpenAI 也表示,持續評估內部前沿模型在數學和其他科學上的表現,有助於加速研發推動這些領域的工具。 六、後續與挑戰 OpenAI 說,將資助一系列圍繞「理解 AI 產出的重大成果」的研討會、會議和專項計劃,細節會在不久後公佈。這是一個務實的訊號:理解一個由機器給出的證明,本身就是一項需要人力的工作,瓶頸從「產生結果」轉向了「消化結果」。 挑戰同樣明顯。第一,形式化覆蓋是否會跟上成果產出的速度。第二,形式陳述的正確翻譯仍需要人來確認。第三,署名、功勞與責任如何在人與模型之間劃分,數學界還沒有定論。第四,一次性發布的做法能否成為常態,取決於 OpenAI 是否真如所言持續更新標準、回應社群反饋。 總的來說,這次釋出的價值不只在數學內容,更在它試圖為 AI 科研成果建立一套可檢驗、可引用、可更正的披露規範。規範是否站得住,要看未來幾個月社群的審閱結果。