本周,我们的 MAI-Cyber-1-Flash 在 MDASH 框架中,以 50% 的成本在 CyberGym 基准测试中夺得 第一名——领先 Mythos 12 个百分点。
这种性能与成本的优化,正是新模型部署范式的核心。过去几个月,Token 最大化一直是主旋律,而 Token 效率则是行业下一个重点关注方向。
要打造一家前沿公司,就必须在指标性能与成本之间找到最优解。选择在这条曲线上处于什么位置至关重要。通过协同优化模型、框架和 RLE,企业可以选择最适合自己的曲线位置。
随着我们迈向一个前沿公司部署始终在线、实时运行的后台 Agent 的世界,推理需求的成本将急剧飙升。
在大多数情况下,前沿通用模型并非每个任务都必需。通过针对特定产品调优模型,可以在保持甚至超越前沿性能的同时,大幅降低 Token 成本,有时可减少 50% 甚至更多。
正如萨提亚在我们第四季度财报电话会议上提到的,自上季度以来,我们在 Microsoft 产品中已交付了 十多个专业的 MAI 模型。所有这些模型在 保持或提升质量 的同时,使用的 Token 显著减少,在许多情况下节省了多达 50-90% 的 GPU 成本。
这就是爬山机器的实际运作——在自有框架中,使用自有数据和工作流,通过 RLE 训练来协同优化模型。我们相信这就是前沿公司的新节奏,并且正在构建一项名为 Frontier Tuning 的服务,帮助所有公司像这样运作。
这个飞轮将推动前沿生态系统繁荣发展,使其更具韧性,确保企业能够灵活切换模型、构建自有知识产权并控制成本。
以下是本季度交付的部分模型及其 Token 效率影响:
- MAI-Code-1-Flash 在 VS Code 中的代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高出 10%,中位 Token 使用量降低 10%,平均留存率提升 9%。
- MAI-Code-1-Flash 也是我们 Excel 模型的基础,该模型在性能与同类模型相当的同时,在 H100 上提供服务,而非 GB 架构。
- MAI-Image-2.5-Flash 在 PowerPoint 中相比 GPT-Image-2 将 GPU 成本降低了 高达 84%。在 OneDrive 中相比 GPT-Image-1.5 实现了 高达 2.5 倍的 Token 效率,同时将 P95 延迟降低了 25%,用户保存率提升了 25%。
- MAI-Voice-2-Flash 在提供世界一流质量的同时,将 GPU 成本降低了 高达 89%,速度是其前代的 2 倍,成本降低了 32%。
- MAI-Transcribe-1.5 的运行速度可 比竞品模型快 5 倍,已部署到 Dragon Copilot 产品的 58 种语言中,该产品被 17 万名医疗提供者用于近 3000 万次患者诊疗。
这是在我们行业历史上最激动人心的时刻,一个充满辛勤工作的夏季。团队干得漂亮!更多精彩还在后面,我们才刚刚开始。





