NvidiaAI代理生成式AIClaude

Nvidia 研究揭示:AI 代理的關鍵不在模型本身,而在「框架」(Harness)

Nvidia 於 8 月 21 日公佈了一項極具啟發性的最新研究,其核心結論可能改寫業界對 AI 代理(AI Agent) 的理解方式:對於需要長時間、多步驟執行的「長跨度任務」(long-horizon tasks)而言,框架(Harness)——也就是圍繞模型搭建的執行環境、記憶與工具系統——比底層模型本身更為關鍵

研究團隊使用自訂的強化框架 AVO(Agentic Variation Operators),配合一個「監督代理」元件,讓原本在 ARC-AGI-3 基準測試中僅獲 30% 的 Claude Opus 5,一舉達成 100% 滿分。這一突破為企業導入 AI 代理指明了新的方向。

從 30% 到 100%:框架的力量

ARC-AGI-3 是一套專門測試模型互動推理能力的基準,由一系列無說明文件的 2D 遊戲組成,AI 必須自行摸索規則並完成通關。OpenAI 曾因自家模型在此測試中表現慘淡(不到 10%)而備感壓力,甚至在上個月專門進行內部研究,結果發現僅僅調整框架中的兩個設定,就能讓分數翻三倍。

然而,Nvidia 的研究更進一步。透過自行打造的 AVO 框架,研究團隊不僅強化了記憶管理上下文處理能力,更引入了一個「監督代理」(supervising agent)元件——它像 CEO 一樣監控主代理的工作進度,一旦主代理偏離方向或陷入無效探索,便即時引導其回到正確路徑。

Nvidia AI 部門產品副總裁 Adel El Hallak 指出:「一般人把代理理解為模型的 API 接口,但代理其實遠遠不止於此——它包含模型、圍繞模型的框架(即它使用的工具集)、運行時環境,以及我們賦予它的技能與函式庫。」

框架決定成本與準確度

這項研究並非孤立事件。今年 7 月,Databricks 亦發表了類似結論:選擇相同的模型,但使用不同的框架,成本差距可達 2 倍。Databricks CEO Ali Ghodsi 直言:「你可能覺得某個模型很貴、另一個很便宜,但等等——你用哪個框架?框架本身就能讓成本翻倍或減半。」

對香港企業而言,這意味著在選擇 AI 工具時,不應只關注品牌或模型規格。一個設計良好的代理框架——具備完善的記憶系統、上下文管理、工具調用與監督機制——往往比換用更「高級」的模型更能帶來實際的生產力提升。

對在職人士與企業的啟示

Nvidia 這項研究向市場傳遞了一個清晰訊號:AI 代理的時代正式從「模型競賽」進入「框架競賽」。對於正在評估 AI 導入的企業與個人:

  1. 勿只比較模型評分:在選用 AI 代理工具時,應優先關注其框架設計——包括記憶管理、工具調用、工作量追蹤與監督機制。這些「看不見的基礎建設」才是長期效能的決定因素。

  2. 善用開源框架保持靈活性:Nvidia 強調開放生態的重要性,其 Nemo 品牌下提供了大量開源的框架元件。能自由調整框架參數的團隊,將比僅依賴封閉平台的用戶獲得更大的準確度優勢。

  3. 「監督代理」概念值得引入工作流程:研究中將監督代理比喻為 CEO 的概念,亦可應用於企業 AI 工作流程——設置人工審核環節自動化異常檢測,確保 AI 代理在長時間運作中不偏離目標。

掌握 Prompt Engineering、理解框架設計原則,並能靈活組合不同模型與工具,才是 2026 年下半年的核心競爭力。

想學會善用最新 AI 工具?

瀏覽 AI學院實戰課程,由入門到企業轉型顧問。

瀏覽課程