本週,我們在 MDASH 平台上部署的 MAI-Cyber-1-Flash 模型,在 CyberGym 基準測試中拿下了 第一名——領先 Mythos 12 個百分點,且成本只有後者的一半。
這類性能與成本的優化,正是新模型部署範式中的核心。過去幾個月的主旋律始終是「代幣極致化」(Tokenmaxxing)。而整個產業的下一個重大焦點,則是 代幣效率。
要打造一家前沿公司,你必須在性能與成本之間找到最優解。選擇在這條曲線上的哪個位置落腳至關重要。透過聯合優化你的模型、平台與 RLE(強化學習環境),你可以為自己的公司選定一個最合適的曲線位置。
隨著我們加速邁向一個由前沿公司部署「永不間斷、即時運作、持續在背景執行」的 Agent 的世界,推理需求的成本將會急遽攀升。
在大多數情況下,前沿通用模型並非所有任務都必需。透過針對特定產品微調模型,你可以維持甚至超越前沿性能,同時大幅降低代幣成本,有時甚至能減少 50% 或更多。
正如 Satya 在我們第四季財報電話會議中所提到的,自上季以來,我們已在 Microsoft 產品中推出了超過十款專用 MAI 模型。這些模型 全都維持或提升了品質,同時使用的代幣數量顯著減少,在許多情況下節省了 50-90% 的 GPU 成本。
這就是爬山演算法(hill-climbing machine)的實際運作:在你自己的平台上,運用你自己的資料與工作流程,在你自己的 RLE 中訓練,並聯合優化你自己的模型。我們相信,這正是未來前沿公司的新節奏。我們正在打造一項名為 Frontier Tuning 的服務,它將幫助所有公司都能以這樣的方式運作。
這個飛輪將推動前沿生態系統蓬勃發展,並使其更具韌性,確保你能靈活切換模型、建立自有智慧財產權,並有效控制成本。
以下是本季我們出貨的部分模型及其代幣效率影響:
- MAI-Code-1-Flash 在 VS Code 中的程式碼接受率比 GPT-5.4 Mini 與 Claude Haiku 4.5 高出 10%,中位數代幣用量降低 10%,平均留存率提升 9%。
- MAI-Code-1-Flash 也是我們 Excel 模型的基礎,性能與同類模型相當,但 部署於 H100 上,而非 GB。
- MAI-Image-2.5-Flash 在 PowerPoint 中相比 GPT-Image-2 將 GPU 成本降低 高達 84%。在 OneDrive 中,相比 GPT-Image-1.5,代幣效率提升 高達 2.5 倍,P95 延遲降低 25%,用戶儲存率提升 25%。
- MAI-Voice-2-Flash 提供世界一流品質,同時 GPU 成本降低 高達 89%,速度提升 2 倍,且成本比前代降低 32%。
- MAI-Transcribe-1.5 運行速度 比競爭對手模型快 5 倍,已部署至 Dragon Copilot 產品的 58 種語言中,該產品被 17 萬名醫療專業人員使用,涵蓋近 3000 萬次患者就診。
這個夏天,我們在產業史上最振奮人心的時刻揮汗努力。團隊表現出色!未來還有更多精彩,我們才剛起步。





