Meta 研究讓 80 億參數小模型匹敵 Claude Opus 4.5:AI 效率革命降低企業部署門檻
Meta AI 與伊利諾大學厄巴納-香檳分校的研究人員在 8 月 28 日發表了一項引人注目的研究成果——EvoHarness-RL 框架,成功讓僅 80 億參數 的小型 AI 模型在代理任務中達到 96.9% 的成功率,與 Claude Opus 4.5 和 GPT-5 等頂尖前沿模型旗鼓相當。這項突破對企業 AI 部署的算力成本結構具有深遠影響。
根據 VentureBeat 的獨家報導,研究團隊使用 Qwen3-8B 作為基礎模型進行訓練,然後將其與多個前沿模型進行比較。結果顯示,經過 EvoHarness-RL 訓練的 8B 模型在 ALFWorld 基準測試中達到了 96.9% 的平均成功率——相比之下,Claude Opus 4.5 的成績為 96.4%,而受訓模型在未經訓練的基礎版(ReAct 方法)中僅有 47.9%。這意味著訓練框架帶來了近 49 個百分點的提升。
EvoHarness-RL 的核心創新:讓 AI 學會「何時使用工具」
傳統上,AI 代理在執行複雜任務時,依賴開發者手寫的規則和指令來決定何時使用工具、如何管理記憶。這種方法有兩個根本問題:規則僵化且無法隨模型升級而自動調整。當模型升級時,手寫的提示詞和規則往往需要大量的人力調整。
EvoHarness-RL 引入了一個名為 BPE(Belief、Progress、Experience) 的統一框架,將 AI 代理的外部支援系統歸納為三個功能區域:
- Belief(信念):維持對當前環境的準確理解,例如即時的系統狀態和 API 連接狀況
- Progress(進度):追蹤已完成和待完成的子目標,避免重複或遺漏
- Experience(經驗):跨任務重用歷史知識,從過去的成功和失敗中學習
AI 代理通過四個簡潔的元操作(track、commit、recall、note)與這個儀表板互動——而非使用複雜、領域特定的 API。研究人員將這比喻為「給 AI 一個乾淨的工作檯面,而不是一堆說明書和工具櫃」。
強化學習的第二階段:教會 AI 何時「省錢」
EvoHarness-RL 的訓練流程分為兩個階段。第一階段是監督式微調,教會基礎模型如何從雜亂的互動日誌中提取有用資訊並結構化到 BPE 框架中。第二階段則更具創新性——通過「成本感知」強化學習,教會 AI 在何時查詢外部狀態是值得的。
研究人員觀察到一個稱為「harness annealing」的有趣現象。在訓練初期,AI 代理幾乎在每一步都頻繁查詢其經驗和進度追蹤器。隨著它逐漸掌握常規操作,它會主動減少對外部工具的依賴,將成功的模式直接嵌入模型參數中。在企業場景中,這直接轉化為更低的延遲和更少的運算成本——AI 不再浪費 token 去查詢它已經熟練掌握的標準工作流程。
同時,AI 展現了「harness evolution」的能力:面對簡單、熟悉的任務時快速繞過工具,而遇到新環境或意外障礙時則主動增加對 Belief 和 Experience 模組的使用。這種動態調適策略,使得 AI 能夠在效率和準確性之間取得最佳平衡。
對所有人的普適效益:即使不用強化學習也有幫助
值得注意的是,EvoHarness-RL 的效益不僅限於經過訓練的小模型。研究人員發現,即使將 BPE 框架作為提示使用——不經過強化學習訓練——也能顯著提升前沿模型的表現。GPT-4.1 的成功率提升了 22.1 個百分點,GPT-5 提升了 25.7 個百分點。這意味著 BPE 框架本身就是一種有效的提示工程策略,可以即插即用於現有模型中。
對於 Meta 而言,這項研究與其開源 AI 策略高度一致。如果小模型能夠在關鍵代理任務上匹敵前沿模型,企業客戶就無需為每個工作流程支付昂貴的 API 費用。這也解釋了為何 Meta 持續投資於 Llama 系列的開源模型生態。
對企業與在職人士的啟示
第一,小模型時代已經到來。 EvoHarness-RL 證明了參數規模不是決定 AI 性能的唯一因素——訓練方法和工具使用策略同樣重要。對香港企業而言,這意味著 高性能 AI 代理不再需要大規模 GPU 集群或昂貴的雲端 API 訂閱。本地部署小模型的可能性正在顯著增加。
第二,「提示工程」正在進化為「代理工程」。 傳統的提示工程側重於如何向 AI 提問。EvoHarness-RL 揭示了一個新方向:如何設計 AI 代理的「認知架構」——包括其記憶系統、工具使用策略和狀態管理機制。對 AI 從業者而言,理解代理架構設計將成為下一階段的核心競爭力。
第三,開源 AI 的生產力門檻持續降低。 當一個 8B 參數的小模型可以匹配頂尖閉源模型時,企業的 AI 部署策略將擁有更大的靈活性。香港企業可以考慮 混合 AI 部署策略:將常規任務交由本地小模型處理,僅將複雜、罕見的邊緣案例發送至雲端前沿模型——這種混合模式在顯著降低成本的同时仍能保持高品質輸出。
第四,關注 AI 代理的「自主調適」能力。 EvoHarness-RL 中觀察到的 harness annealing 現象——AI 學會在熟練後減少工具使用——展示了 AI 代理如何變得更加高效。對企業技術團隊而言,評估 AI 代理時不僅要看其基準成績,更要看其在長期運行中是否能夠自我優化。
第五,保護資料私隱的新可能。 小模型可以在本地設備上運行,無需將企業敏感資料發送至雲端。對於金融、醫療和法律行業的香港企業,EvoHarness-RL 展示的路徑——高性能小模型 + 智慧代理框架——提供了一條在保持資料私隱的同時獲得前沿 AI 能力的可行路線。
Meta 的 EvoHarness-RL 研究不僅是學術論文中的一個新基準——它為 AI 效率樹立了一個新的方向標。對於正在評估 AI 部署策略的香港企業和專業人士,這項研究傳遞了一個明確的信號:改變 AI 遊戲規則的不僅是更大、更強的模型,還有更聰明、更節省的訓練和使用方法。
想學會善用最新 AI 工具?
瀏覽 AI學院實戰課程,由入門到企業轉型顧問。