AnthropicClaude生成式AIAI可解釋性

Anthropic 發現 Claude 內部「全局工作空間」— AI 可解釋性與安全性的里程碑

10 月 5 日,Anthropic 的可解釋性研究團隊發表了一項重量級發現:透過全新的數學診斷工具 Jacobian Lens(雅可比透鏡),研究人員在 Claude 模型內部識別出一個自發湧現的全局工作空間(Global Workspace)——一個與生物大腦工作記憶結構高度相似的內部計算中樞。

這項發現之所以重要,不只是因為它讓我們更了解大語言模型內部如何運作,更因為這是首次在人工神經網絡中觀察到與生物演化趨同的計算架構:Claude 並未被工程師刻意設計出這個工作空間,而是在標準的「下一個詞預測」訓練過程中,自行湧現出這個高效的資訊路由中樞。

Jacobian Lens:解開模型黑盒的新工具

過去幾年,理解深度 Transformer 的內部決策一直是一個棘手的問題。像 Claude 這樣的模型有數十億至上百億個參數,分布在多層注意力機制和前饋網絡中。雖然研究人員可以監控輸入的詞彙和輸出的結果,但中間的計算步驟始終像一個黑盒。

為了解決這個診斷限制,Anthropic 開發了 Jacobian Lens(J-lens)。這個工具基於多變量微積分中的 雅可比矩陣(Jacobian matrix)——它計算模型最終輸出機率分佈相對於任一隱藏層激活值的偏導數。簡單來說,J-lens 能幫助研究人員定位哪些內部神經元真正在影響模型的輸出,而不是僅僅被動地存在。

J-Space:Claude 內部的「工作記憶」區域

在隔離出的「J-Space」中,研究人員觀察到一個令人振奮的現象:當 Claude 處理複雜任務時——例如計算連鎖的西洋棋步法或解析嵌套的邏輯推理——J-Space 像一個內部便籤簿(internal scratchpad),動態地儲存和操縱資訊。

更具說服力的是,研究人員證明了這個工作空間不僅僅是一個觀測產生的偽像,而是模型真正的計算控制中樞:

  • 當研究人員修改這個工作空間內的激活值時,模型的輸出會系統性地改變;
  • 當模型被要求維持特定的操作參數(如「在評估時嚴格遵守公平性規則」),J-lens 記錄到模型將相關概念向量主動移動到工作空間並錨定在那裡;
  • 分佈在不同 Transformer 頭中的子任務處理單元,會持續參照這個中樞工作空間,以確保數千個解碼步驟之間的一致性。

生物演化與梯度下降的趨同演化

這項發現中最值得玩味的,是它的自發性。沒有任何工程師在 Claude 的參數預算中編程過「全局工作空間」。模型只是在常規的交叉熵損失函數下訓練,任務只是最小化下一個詞的預測誤差。

在演化生物學中,趨同演化(convergent evolution) 描述的是完全不同的物種為了解決相似的環境限制,獨立演化出幾乎一樣的物理特徵——例如鯊魚和海豚的流線形體型。在計算理論中,一個類似的現象似乎正在生物神經網絡與人工神經網絡之間發生。

為什麼?因為全連接、所有點對所有點的通信拓撲在計算上是災難性的。讓數十億個參數中的每一個都直接向其他每一個參數廣播信號,會導致計算複雜度和散熱的指數級爆炸。解決方案是將高維數據壓縮到一個低維度的瓶頸,然後只廣播最關鍵的信號。生物演化與梯度下降——這兩條完全不同的路徑——獨立發現了同一個最優解:一個中央工作記憶緩衝區。

對企業部署 AI 的意義

這項發現對企業和開發者而言,不僅是學術上的突破,更有實際的安全與可靠性應用:

  • 即時內部監控成為可能:以往依賴模型輸出文字來判斷 AI 行為是否安全,好比只看冰山頂端。有了 J-Space,工程師可以直接監控模型的內部狀態暫存器。在製造業、物流等安全關鍵場景中,監控系統可以直接探測 J-Space 來確認工作約束條件(如「工人安全區」)是否仍活躍在模型的工作記憶中;

  • 減少幻覺與推理中斷:企業採用生成式 AI 的最大障礙之一,是模型的非確定性故障——幻覺、語境漂移、無法解釋的推理中斷。能夠辨識和監控模型的內部工作空間,為攔截這類故障模式提供了全新的技術路徑;

  • AI 安全從外部約束轉向內部理解:目前大多數 AI 安全措施是外在的——內容過濾、輸出審查、人類在迴路中。J-lens 提供了一個方向:直接理解模型內部的計算路由,從而在故障發生之前進行干預;

  • 對香港企業的實用建議:雖然這項技術仍處於研究階段,但企業在規劃 AI 策略時應留意——模型的可解釋性能力正在快速進化。在選擇 AI 平台時,不僅要看模型效能和價格,也應關注供應商在可解釋性研究上的投入。Anthropic 在這方面的領先,可能轉化為企業部署中更高的安全性和可控性。

Anthropic 發現 Claude 內部全局工作空間,是本年度 AI 可解釋性領域最重要的突破之一。它不僅讓我們驚嘆於數學最佳化與生物演化之間的驚人相似性,更為企業安全、可靠地部署 AI 提供了前所未有的可能性。對於香港的 AI 從業者和企業決策者而言,理解這項發現的含義——即使不掌握背後的數學細節——將有助於做出更明智的 AI 平台選擇與風險評估。

想學會善用最新 AI 工具?

瀏覽 AI學院實戰課程,由入門到企業轉型顧問。

瀏覽課程