OpenAI生成式AIAI與學術AI可信度

OpenAI 發表 722 篇 AI 生成數學論文 — 三天內 3 篇撤回、14 篇修正,學術界反彈加劇

10 月 6 日,OpenAI 在 GitHub 上公開了一個驚人的成果:722 篇數學論文,涵蓋代數幾何、數論、數學物理等約 20 個領域,分為 372 個結果家族。這些論文全部由一個未公開的內部前沿模型生成——該模型不對外開放,OpenAI 甚至不願公布其名稱。

但僅過了一天,10 月 7 日,OpenAI 就不得不撤回其中 3 篇論文,並緊急修正 14 篇。原因是?一個最基本的數學錯誤——正負號(sign)寫錯了。這起事件迅速點燃了學術界對 AI 生成研究的信任危機。

發生了什麼?一個符號錯誤如何推倒三篇論文

被撤回的三篇論文都與霍奇猜想(Hodge Conjecture)——千禧年大獎難題之一——相關:

  1. 〈Algebraicity of Weil classes on split abelian eightfolds〉——錯誤的源頭
  2. 〈Algebraicity of Kuga–Satake Correspondences for K3 Surfaces〉——依賴第一篇的構造
  3. 〈The rational Hodge conjecture for products of K3 surfaces〉——同樣依賴第一篇

錯誤的細節非常簡單:在第一篇論文的一個關鍵論證中,模型使用了 +1 作為某個幾何操作的符號,但根據論文自身的約定,正確答案應該是 -1。一個正號與負號的差異,導致了「穩定化-跡抵消論證」失效——本應相互抵消歸零的計數變成了非零數,而論文依賴的核心定理恰恰要求這個計數為零。

這三篇論文屬於同一個結果家族(Repository Outcome Family 032),原本是這次發表中最受關注的成果之一。撤回後,該家族的名稱也從「所有射影 K3 曲面的霍奇與 Kuga–Satake 結果」更改為「CM 阿貝爾簇的理性霍奇猜想」。

更大的透明度問題:只有 42% 經過形式化驗證

這場爭議的核心不僅僅是 AI 犯了個數學錯誤。更深層的問題在於透明度的不對稱:

  • OpenAI 用一個外界無法存取的內部模型生成了這些結果;
  • 722 篇論文中,只有 10 篇附有推理過程摘要;
  • 僅 300 篇(約 42%) 的頂線結果經過了 Lean 形式化驗證——即機器可檢查的邏輯證明;
  • 其餘 58% 的論文完全未經形式化驗證。OpenAI 自己在 README 中承認:「一些未經形式化驗證的結果可能存在問題。」

Lean 驗證只能確認一個證明在邏輯上是一致的,但它無法告訴你這套形式化是否正確對應了原來的數學陳述,也無法判斷該結果是否新穎或有意義。

MIT 教授 Andrew Sutherland 直言:「在你發布模型、讓人們能夠複現結果之前,所有宣稱都應被視為未經證實。」MIT 的 Dor Minzer 則稱這種做法為「新聞稿式數學(math by press release)」。

學術界的反彈:人類數學協會呼籲抵制

10 月 8 日,新成立的人類數學協會(Association for Human Mathematics, AHM) 發表了一份措辭強硬的聲明,稱 OpenAI 的發布「不是學術的展示,而是權力的展示」,並呼籲數學家停止與該公司的合作。

更諷刺的是,OpenAI 的顧問機構——數學與人工智慧諮詢小組(AGMAI)——此前曾明確建議各實驗室不要在專有模型上測試高級數學問題。OpenAI 卻以「透明度」為名繼續行動,同時拒絕公開模型本身。

菲爾茲獎得主陶哲軒(Terence Tao)在 Mastodon 上指出一個更深遠的擔憂:AI 正在將數學的「難度地貌」夷為平地——當所有問題都可以快速被 AI 解決,研究人員將失去判斷哪些問題真正值得投入的基準。

對企業與開發者的啟示

這起事件對香港的 AI 從業者和企業管理者有幾個關鍵教訓:

  • AI 輸出需要人類監督:即使是最先進的 AI 模型,仍然會犯最基本的錯誤——小到一個正負號。在任何高風險的 AI 應用場景(法律文件、財務合規、代碼審查)中,人類最終查核不可取代;

  • 透明模型 vs 黑盒模型:OpenAI 使用內部專有模型且不公開推理過程,導致外部無法獨立驗證其成果。企業在選擇 AI 平台時,應優先考慮提供可審核、可重現結果的模型;

  • 形式化驗證是重要的安全網:Lean 這樣的形式化驗證工具雖然昂貴且耗時,但對於關鍵應用的可靠性至關重要。企業在部署 AI 用於分析或生成具有法律或財務影響的內容時,應建立類似的形式化驗證/人工雙重檢查機制;

  • 不要被規模迷惑:722 這個數字聽起來驚人,但數量不等於質量。企業在評估 AI 供應商時,應深入瞭解其模型在真實場景中的錯誤率、透明度和可解釋性,而非只看宣稱的能力範圍。

OpenAI 的 722 篇論文事件,表面上是學術界的一場風波,實質上凸顯了生成式 AI 在專業領域應用中的根本挑戰:當模型能大規模產出看似合理的結果時,如何確保這些結果的可靠性?這對香港任何正在或計劃將 AI 整合入專業工作流程的企業而言,都是一個值得深思的問題。

想學會善用最新 AI 工具?

瀏覽 AI學院實戰課程,由入門到企業轉型顧問。

瀏覽課程