優化前沿效能曲線

@mustafasuleyman
英語2 天前 · 2026年7月29日
133K
250
32
21
72

TL;DR

Mustafa Suleyman 詳細介紹了 Microsoft AI 在 Token 效率與專業化模型方面的策略,強調了顯著的成本節省以及 Frontier Tuning 服務的推出。

本週,我們在 MDASH 平台上部署的 MAI-Cyber-1-Flash 模型,在 CyberGym 基準測試中拿下了 第一名——領先 Mythos 12 個百分點,且成本只有後者的一半

這類性能與成本的優化,正是新模型部署範式中的核心。過去幾個月的主旋律始終是「代幣極致化」(Tokenmaxxing)。而整個產業的下一個重大焦點,則是 代幣效率

要打造一家前沿公司,你必須在性能與成本之間找到最優解。選擇在這條曲線上的哪個位置落腳至關重要。透過聯合優化你的模型、平台與 RLE(強化學習環境),你可以為自己的公司選定一個最合適的曲線位置。

隨著我們加速邁向一個由前沿公司部署「永不間斷、即時運作、持續在背景執行」的 Agent 的世界,推理需求的成本將會急遽攀升。

在大多數情況下,前沿通用模型並非所有任務都必需。透過針對特定產品微調模型,你可以維持甚至超越前沿性能,同時大幅降低代幣成本,有時甚至能減少 50% 或更多。

正如 Satya 在我們第四季財報電話會議中所提到的,自上季以來,我們已在 Microsoft 產品中推出了超過十款專用 MAI 模型。這些模型 全都維持或提升了品質,同時使用的代幣數量顯著減少,在許多情況下節省了 50-90% 的 GPU 成本

這就是爬山演算法(hill-climbing machine)的實際運作:在你自己的平台上,運用你自己的資料與工作流程,在你自己的 RLE 中訓練,並聯合優化你自己的模型。我們相信,這正是未來前沿公司的新節奏。我們正在打造一項名為 Frontier Tuning 的服務,它將幫助所有公司都能以這樣的方式運作。

這個飛輪將推動前沿生態系統蓬勃發展,並使其更具韌性,確保你能靈活切換模型、建立自有智慧財產權,並有效控制成本。

以下是本季我們出貨的部分模型及其代幣效率影響:

  • MAI-Code-1-Flash 在 VS Code 中的程式碼接受率比 GPT-5.4 Mini 與 Claude Haiku 4.5 高出 10%,中位數代幣用量降低 10%,平均留存率提升 9%。
  • MAI-Code-1-Flash 也是我們 Excel 模型的基礎,性能與同類模型相當,但 部署於 H100 上,而非 GB。
  • MAI-Image-2.5-Flash 在 PowerPoint 中相比 GPT-Image-2 將 GPU 成本降低 高達 84%。在 OneDrive 中,相比 GPT-Image-1.5,代幣效率提升 高達 2.5 倍,P95 延遲降低 25%,用戶儲存率提升 25%。
  • MAI-Voice-2-Flash 提供世界一流品質,同時 GPU 成本降低 高達 89%,速度提升 2 倍,且成本比前代降低 32%。
  • MAI-Transcribe-1.5 運行速度 比競爭對手模型快 5 倍,已部署至 Dragon Copilot 產品的 58 種語言中,該產品被 17 萬名醫療專業人員使用,涵蓋近 3000 萬次患者就診。

這個夏天,我們在產業史上最振奮人心的時刻揮汗努力。團隊表現出色!未來還有更多精彩,我們才剛起步。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章