Google生成式AI提示工程AI研究企業AI

Google 研究顛覆常識:前沿模型編碼 98% 事實但記不起來——「多思考幾秒」就能恢復 65% 的「遺失記憶」

當大型語言模型(LLM)產生幻覺時,開發者通常假設模型缺少相關知識。標準應對方案是擴大模型規模、增加訓練資料或建立複雜的檢索增強生成(RAG)架構。然而,Google Research 與 Technion 在 9 月 1 日發表的一項新研究完全顛覆了這個假設——知識通常沒有丟失,模型已經編碼了這些事實,只是無法在生成時成功提取。

根據 VentureBeat 的報導,研究人員的實驗顯示,GPT-5Gemini-3 等前沿模型編碼了 95-98% 的測試事實。這意味著在許多情況下,**回憶(recall)而非編碼(encoding)**才是影響事實準確性的主要瓶頸。

知識剖析:從「對錯」到「事實輪廓」

研究團隊提出了一個全新的評估框架——事實層級剖析(fact-level profiling)。與傳統的問答準確率評估不同,這個方法測試單一事實在不同條件下的表現

  • 直接回憶(Direct recall):模型編碼了事實並能輕鬆回答直接問題
  • 編碼失敗(Encoding failure):模型既未編碼也不知道該事實,需要增加預訓練資料或模型容量
  • 回憶失敗(Recall failure):模型編碼了事實但無法訪問——類似人類的「話到嘴邊說不出」狀態
  • 透過思考回憶(Recall with thinking):模型無法直接回答,但透過推理時計算(如 Chain-of-Thought)成功提取被鎖住的答案
  • 無編碼的推理(Inference without encoding):模型從未明確編碼該事實,但透過串聯其他已知事實推斷出正確答案

研究人員將這比喻為「空 shelves(編碼失敗)」vs「lost keys(回憶失敗)」——前者是倉庫裡根本沒有貨,後者是貨在倉庫裡但你找不到鑰匙去開門。這兩種失敗在傳統準確率指標下看起來一模一樣,但解決方案截然不同

前沿模型的事實真相:編碼接近極限,回憶才是瓶頸

研究團隊評估了 13 個 LLM 在超過 400 萬條回應上的表現,使用包含 2,150 個從 Wikipedia 提取事實的 WikiProfile 基準。

關鍵發現:

  • 前沿模型(GPT-5、Gemini-3)的編碼率已達 95-98%,接近飽和
  • 但這些模型仍無法直接回憶 26-34% 的已編碼事實
  • 提供推理時間計算後,成功恢復了 40-65% 的鎖住知識
  • 僅有 10-20% 的事實實際需要額外思考——其餘的事實模型可以憑記憶直接回答

研究人員指出一個反直覺的現象:擴大模型規模並不能自動解決回憶問題。在 Gemma3 系列中,從 10 億參數擴大到 270 億參數,編碼失敗率從 85% 降至 23%,但回憶失敗的比例反而增加,最高達到 40%。這是因為更大的模型記住了更多事實,但同時有更大比例的知識卡在「已編碼但無法訪問」的狀態。

對提示工程與 AI 部署的實戰啟示

這項研究對企業如何部署 AI 提供了幾個重要方向:

不要每個幻覺問題都用 RAG 解決

「當事實出錯時,許多團隊的反應是部署 RAG、擴大向量資料庫或攝入更多領域文件,」Google 研究科學家 Nitay Calderon 告訴 VentureBeat。「如果事實真的缺失,RAG 是正確的修復方案。但如果事實已編碼而模型只是無法回憶,RAG 和擴大模型只是在真正問題上疊加成本。」

Calderon 估計,團隊用 RAG 解決的許多問題,模型其實已經從記憶中知道答案。這意味著企業在沒有診斷根本原因的情況下,為每個 API 呼叫增加了不必要的延遲和成本。

有選擇性地啟用推理計算

思考恢復了 40-65% 的鎖住知識,但僅有 10-20% 的事實需要思考。全域啟用推理計算會浪費大量計算預算。真正的挑戰在於動態路由查詢——模型需要能在回答前感知到「直接回答即將失敗」,從而提前升級為推理模式。

「這種自我意識本身就是一種技能,今天的模型還不能可靠地做到這一點,」Calderon 說。這也是 Google 研究人員正在開發「忠實不確定性(faithful uncertainty)」框架的原因——讓模型能夠準確評估自己的信心水平,在幻覺產生之前觸發深度推理。

建立「生成-驗證」流程

因為模型識別事實(驗證)比從頭生成事實更容易,開發者可以建立架構循環:模型生成回應後,被提示明確反思並驗證自己的主張。由於識別正確答案比生成更容易,驗證環節可以捕捉到純生成遺漏的錯誤。

測試語義訪問而非僅基準準確率

標準準確率指標掩蓋了模型的真實能力。評估應該針對同一事實使用不同的措辭、語境和提問方向來探測——這樣才能真正了解模型知道什麼,以及它能否可靠地訪問這些知識。

對企業與在職人士的啟示

第一,告別「越大越好」的模型策略。 Google 的研究清楚地表明,擴大模型規模主要解決「存儲」問題而非「訪問」問題。對香港企業而言,盲目追求更大模型可能只是增加了成本而未能真正改善準確性。更好的策略是理解錯誤類型,針對性地選擇解決方案——對於回憶失敗,提示工程和推理優化比擴大模型更有效。

第二,提示工程從「藝術」走向「科學」。 研究發現提問方式直接決定模型能否解鎖答案。同一事實的反向提問(例如問「主語」而非「賓語」)可能導致回憶失敗。對香港企業的 AI 使用者而言,這意味著學會從多角度提問、建立驗證性提示,可以顯著提升 AI 輸出的可靠性——而不需要任何技術上的改動。

第三,重新評估 RAG 投資回報。 如果企業正在考慮投入大量資源建立 RAG 系統,這項研究提供了一個重要的提醒:首先診斷錯誤類型,再決定解決方案。 如果模型已經知道答案而只是無法回憶,花時間優化提示詞或允許模型「多想一下」可能是成本效益高得多的方法。

第四,「多想一下」的成本效益。 僅有 10-20% 的事實需要額外推理,而思考恢復了 40-65% 的鎖住知識。這意味著作業中有策略地啟用推理——例如對高風險或事實密集型的查詢——可以提供顯著的事實準確性提升,而整體計算成本增加有限。對香港企業的技術團隊而言,這是一個強烈的信號:設計 AI 工作流程時應考慮任務的風險等級,對高風險查詢啟用推理模式,對常規查詢保持直接回答以節省成本

第五,從「模型能力」到「訪問策略」的思維轉變。 這項研究傳遞的核心信息是:模型的知識潛力與其實際表現之間存在巨大的鴻溝,而這個鴻溝可以透過聰明的訪問策略來彌合。 對於 AI 從業者,理解「知識剖析」的概念——區分編碼失敗和回憶失敗——將成為優化 AI 系統準確性的關鍵技能。

Google Research 的這項研究不僅是一份學術論文——它為困擾企業 AI 部署已久的幻覺問題提供了一個全新的視角。當模型已經知道答案時,解決方案不一定是更昂貴的模型或更複雜的檢索系統——有時只需要給它多幾秒鐘的思考時間

想學會善用最新 AI 工具?

瀏覽 AI學院實戰課程,由入門到企業轉型顧問。

瀏覽課程