OpenAI 推出 GPT-6 Astra:號稱「AGI 時代來臨」,電腦操控能力顛覆企業 AI 部署模式
OpenAI 在 9 月 3 日正式發布 GPT-6 Astra(代號 Astra),這不僅是另一款模型升級,更是該公司迄今為止最大膽的宣示。OpenAI 聯合創辦人兼總裁 Greg Brockman 在媒體簡報會上直接表示:「歡迎來到 AGI 時代。」
根據 VentureBeat 和 TechCrunch 的報導,Astra 被定位為「世界上最強的電腦使用模型」——它不再僅僅是一個聊天機器人,而是一個能夠像人類一樣操作瀏覽器、試算表、桌面應用程式的 AI 代理。OpenAI 的宣傳材料稱,用戶(包括企業員工)從此可能「不再需要點擊滑鼠或敲擊鍵盤」就能完成工作。
Astra 的驚人基準成績
Astra 是 OpenAI 至今最大規模的訓練運行,也是第一款使用超過 100,000 DBU 在 Stargate 基礎設施上預訓練的模型。OpenAI 研究員 Aidan Clark 表示:「從 Sol 到 Astra 的能力飛躍,比從 Sol 到之前任何模型的飛躍都要大。」
基準測試成績令人矚目:
- OSWorld 2.0(電腦使用評估):Astra 得分 72.6%,平均每任務約 40 分鐘,而 GPT-5.6 Sol 為 65.7%,約 75 分鐘——完成任務時間縮短 47%
- ARC-AGI-3:Astra 達到 98.6%——被廣泛視為測量 AI 泛化能力的關鍵基準
- FrontierMath Tier 4 v2:97.6%
- DeepSWE v1.1(軟體工程):74.1%
- GPQA Diamond:96%
- ExploitBench:100%
不過,ARC-AGI-3 的 98.6% 成績引發了一個重要討論:NVIDIA 在 8 月使用 Claude Opus 5 加上其 AVO(Agentic Variation Operators) 架構同樣達到了 100% 的成績,但底層模型基準僅約 30%。這顯示分數不僅來自模型本身,還來自完整的代理系統架構——包括持久記憶、工具使用、反饋和恢復機制。
從「提示 AI」到「監督 AI」的範式轉移
Astra 的真正革命不在於基準數字,而在於它如何改變人與 AI 的互動方式。Brockman 在簡報會上解釋:「長期以來我們一直被 撰寫連接器和 API 整合 所瓶頸——人們需要逐一為每個工具建立專門的連接。」
有了足夠強大的電腦使用能力,AI 代理可以直接「穿越試算表、填寫表單、在網頁間導航」。這回到了 OpenAI 最早的願景——訓練一個使用與人類相同的輸入輸出(像素、鍵盤、滑鼠)的代理。
Astra 可以做到:
- 填寫線上表單、更新 CRM 記錄、整理行事曆
- 進行網絡研究並將結果整理成文檔或郵件
- 操控試算表、在 Python Notebook 中分析科學數據
- 操作 Power BI、創建和測試網站
- 使用 KiCad 和 FreeCAD 等工程應用程式
- 安裝和排查軟體問題
OpenAI 研究員 Mia Glaese 指出:「有了 Astra,用戶擁有了難以置信的能力,可以完成不到一年前看似遙不可及的事情。我們預期人們將把更複雜的多應用程式工作委託給 AI,人類以更高層次指導工作。」
這個轉變——從「提示 AI」到「監督 AI」——對企業的影響可能比任何基準測試的提升都更為深遠。
爭議:不透明的推理與安全的兩難
Astra 同時也是 OpenAI 最具爭議的模型之一。TechCrunch 報導,該模型使用了一種名為 opaque recurrence(不透明遞迴) 的推理技術,這種技術會遮蔽 chain-of-thought(思維鏈)——這是研究人員用來審計 AI 決策過程的關鍵機制。
OpenAI 首席科學家 Jakub Pachocki 在簡報會上表示,隨著模型能力提升,「可監控性變得越來越困難」。更強大的模型可以使用「更少的語言 token 甚至零語言 token」來完成更難的任務,這反過來降低了監控能力。
對於需要合規和審計的企業來說,這是一個需要密切關注的議題——當 AI 決策過程變得難以追蹤,如何確保其行為符合業務要求?
對企業與在職人士的啟示
第一,AI 代理正從「問答工具」進化為「自主工作者」。 Astra 的發布標誌著 AI 從被動回答問題到主動完成工作流程的根本轉變。對香港企業而言,這意味著需要重新思考工作流程設計——哪些任務可以委託給 AI 代理自主完成,哪些需要人類監督。從「如何提示 AI」到「如何監督 AI」的技能轉型,將成為未來職場的核心競爭力。
第二,「電腦使用」將改變企業軟體整合策略。 傳統的企業 AI 部署依賴於 API 整合、插件和 RAG 架構。Astra 的電腦使用能力提供了一條捷徑——AI 可以直接透過軟體已有的用戶介面進行操作,無需為每個系統建立專門的 API 連接。這對中小企業尤其有意義,因為它們可能缺乏開發和維護複雜 API 整合的資源。
第三,混合模型策略變得更重要。 Astra 的強大能力伴隨著較高的成本。企業應考慮將簡單任務交由低成本模型(如 DeepSeek-V4-Flash)處理,僅將複雜的多步驟代理任務交由 Astra 等高階模型。理解不同模型的優勢和成本結構,將成為企業 AI 策略的基礎。
第四,警惕「透明度」瓶頸。 Astra 的不透明推理引發了對 AI 可審計性的關注。對於金融、法律和醫療等監管嚴格的香港行業,在採用強大 AI 的同時,需要建立額外的監控和驗證機制,以確保 AI 決策過程的可追溯性。
第五,「AGI」的討論不再只是理論。 雖然 Brockman 承認「大家對 AGI 有不同定義」,但他個人認為「我們已經到了」。無論你同意與否,Astra 的發布清楚地表明:AI 的能力曲線仍在加速上升。對企業和個人的最佳策略不是觀望,而是積極理解、試驗和建立 AI 應用的內部能力。
OpenAI 的 GPT-6 Astra 不僅是一次模型發布——它可能代表著人機協作方式的根本轉變。從告訴 AI 做什麼,到讓 AI 自己去做然後回來報告結果——這個轉變將重新定義未來的工作方式。
想學會善用最新 AI 工具?
瀏覽 AI學院實戰課程,由入門到企業轉型顧問。