Microsoft MAI-Transcribe-2 顛覆語音辨識市場:每小時僅 10 美分,比 OpenAI 快 10 倍
Microsoft AI 於 9 月 3 日正式發布 MAI-Transcribe-2,一款在速度、準確度和價格上全面超越 OpenAI、Google 和 ElevenLabs 的語音辨識模型。它的定價令人矚目:每小時音訊僅 0.10 美元——比五個月前發布的初代版本大幅降低 72%。對於每年處理 10 萬小時通話錄音的企業(對大型銀行或電信商而言只是中等規模),帳單將從 36,000 美元降至 10,000 美元。到了這個價格點,語音轉錄不再是預算表上需要爭論的項目。
這款模型的發布不僅是技術進步,更揭示了 Microsoft 正在執行的宏大策略:逐步建立自己的前沿級模型組合,並系統性地將其替換到曾經依賴 OpenAI 技術的產品中。語音辨識正是這項計劃進展最快的領域。
MAI-Transcribe-2 的技術亮點:不只是快,是全面
MAI-Transcribe-2 的核心規格令人印象深刻:
速度碾壓競爭對手。 根據獨立測試機構 Artificial Analysis 的評估,MAI-Transcribe-2 比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比 Google 的 Gemini 3.5 Transcribe 快 5 倍。在批量轉錄場景中,速度直接轉化為成本優勢——一個能以 300 倍即時速度運行的模型所需的 GPU 時數,遠少於只能以 30 倍速度運行的模型。
準確度領先業界。 在 FLEURS 多語言基準測試中,MAI-Transcribe-2 以 5.2% 的平均字錯誤率(WER) 在 60 種語言中排名第一。在 Artificial Analysis 的字錯誤率排行榜上,它位列第二並定義了該機構的準確度-延遲 Pareto 前沿——意味著沒有競爭對手能在不減慢速度的情況下超越其準確度,也沒有對手能在不犧牲準確度的情況下超越其速度。
功能組合完整。 Microsoft 將許多競爭對手收取額外費用的功能全部打包進基礎定價:
- 說話者辨識(Speaker Diarization):自動區分多人對話中的說話者
- 逐字時間戳:為每個單詞附加精確時間標記,支援搜尋、編輯和影片對齊
- 關鍵詞偏置:開發者可提供藥品名稱、產品代碼或員工姓名,讓模型不再混淆行業術語
- 自動語言識別:無需事先聲明語言
- 可配置輸出風格:保留所有「嗯」和重複的逐字模式(適用於法律合規),以及去除填充詞的乾淨模式(適用於字幕和筆記)
- 語碼轉換(Code Switching):處理一句話中在多種語言間切換的對話——Microsoft 特別點名了 Hinglish 和 Spanglish,對應印度和美國西班牙語市場
三個模型在五個月內:Microsoft AI 的驚人迭代速度
MAI-Transcribe-2 的發布節奏本身可能就是最重要的信號:
| 版本 | 日期 | 語言數 | 價格 |
|---|---|---|---|
| MAI-Transcribe-1 | 4 月 2 日 | 25 種 | $0.36/小時 |
| MAI-Transcribe-1.5 | 6 月 2 日 | 43 種 | $0.36/小時 |
| MAI-Transcribe-2 | 9 月 3 日 | 60 種 | $0.10/小時 |
五個月內三次發布,每次語言覆蓋增長約 40%,同時增加競爭對手在 premium 層級才提供的功能。這種節奏表明團隊已經穩定在一個成熟的架構上,現在正在轉動數據和規模的曲柄——這是語音模型快速且可預測改進的階段。
Microsoft AI 執行長 Mustafa Suleyman 先前向 The Verge 透露,初代模型由一個「小而專注的 10 人團隊」開發,從「任何官僚體系中解放出來」。Meta、Amazon、Google 和 Anthropic 均實驗過類似的扁平結構——Microsoft 的語音辨識產品線是這一方法能否產生商業成果而非研究論文的最明顯測試。
Microsoft 自建模型的戰略邏輯:不再依賴 OpenAI
Microsoft 已向 OpenAI 投資超過 130 億美元,並在 Azure、Office 和 Copilot 中託管 OpenAI 的模型。那麼為什麼還要自建模型?答案始於獨立性。
2025 年 10 月,Microsoft 與 OpenAI 重組了合作關係,允許 Microsoft 「首次獨立或與第三方合作追求 AGI」。2026 年 4 月,雙方再次修訂協議,終止了 Microsoft 對 OpenAI 模型的獨家訪問權,並取消了營收分成。每一次修訂都放鬆了雙方的連結——每一次修訂之後都有更多的 MAI 模型發布。
從 margin 角度來看,邏輯同樣清晰:每一個路由到 OpenAI 模型的請求都產生成本,而每一個路由到自有模型、運行在自有 GPU 上的請求成本更低。據 Bloomberg 報導,Microsoft 已在 Word 和 Excel 中使用 MAI 模型回答部分用戶提示——這些產品此前被宣傳為由 OpenAI 和 Anthropic 驅動。
Suleyman 對此直言不諱:「這些模型是否能夠為依賴我們的數百萬企業提供產品價值?」「超級智能」這個詞用在語音 API 上或許有些誇張,但商業邏輯是樸素的:一次構建能力,部署到十幾個產品中,然後停止向一個日益成為競爭對手的合作夥伴付費。
對企業與在職人士的啟示
第一,AI 服務的價格下降曲線正在加速。 MAI-Transcribe-2 從 $0.36 降至 $0.10 只花了五個月。對於正在評估 AI 部署的企業,等待策略有其合理性——成本下降的速度可能快於預期。但同時,先行者獲得的效率提升和學習經驗也是競爭優勢。
第二,「去供應商綁定」已成為企業 AI 策略的核心考量。 Microsoft 自建模型的軌跡——從依賴 OpenAI 到獨立運行——為所有企業提供了啟示。確保 AI 工作流程的可移植性,使用抽象層在不同模型和供應商之間切換,可以降低長期鎖定風險。當供應商從合作夥伴變成競爭對手時,靈活的部署架構就是你的保險單。
第三,專用模型的商業潛力超越通用模型。 MAI-Transcribe-2 的成功表明,在特定模態上深度優化的專用模型,可以在速度、成本和準確度上全面超越通用巨型模型。對中小企業而言,評估「專用模型」方案——而不是直接投入最昂貴的通用模型——可能是更具成本效益的路徑。
第四,數據治理問題不容忽視。 MAI-Transcribe-2 的發布公告沒有說明數據駐留、保留政策以及提交的音訊是否用於未來訓練。對於處理醫療記錄、法律特權資訊和財務披露的受監管行業,這些問題需要在投入生產前釐清。
第五,語音 AI 的應用門檻已降至新低。 每小時 10 美分的價格使語音轉錄從「大型企業才負擔得起」變成了「任何規模的企業都可以採用」。香港的中小企業可以考慮將語音辨識整合到客戶服務記錄、會議自動記錄、內容本地化等工作流程中。比對不同供應商的實際準確度和合規條款,選擇最符合自身需求的方案。
MAI-Transcribe-2 告訴我們一個更大的故事:Microsoft 的目標不是建立一個打敗 GPT 或 Gemini 的單一模型,而是建立一個專業模型組合,讓 Microsoft 在不需要向任何人付費的情況下服務大部分企業工作負載——然後以其他供應商無法比的價格向所有人出售剩餘產能。花了 130 億美元學習前沿 AI 成本的公司,已經決定與其租用工廠的產出,不如擁有工廠本身——然後以低於租金的价格出售產出。
想學會善用最新 AI 工具?
瀏覽 AI學院實戰課程,由入門到企業轉型顧問。