优化前沿性能曲线

@mustafasuleyman
英语2天前 · 2026年7月29日
202K
283
40
24
79

TL;DR

Mustafa Suleyman 详细介绍了 Microsoft AI 在 Token 效率和专用模型方面的策略,强调了显著的成本节约以及 Frontier Tuning 服务的推出。

本周,我们的 MAI-Cyber-1-Flash 在 MDASH 框架中,以 50% 的成本在 CyberGym 基准测试中夺得 第一名——领先 Mythos 12 个百分点

这种性能与成本的优化,正是新模型部署范式的核心。过去几个月,Token 最大化一直是主旋律,而 Token 效率则是行业下一个重点关注方向。

要打造一家前沿公司,就必须在指标性能与成本之间找到最优解。选择在这条曲线上处于什么位置至关重要。通过协同优化模型、框架和 RLE,企业可以选择最适合自己的曲线位置。

随着我们迈向一个前沿公司部署始终在线、实时运行的后台 Agent 的世界,推理需求的成本将急剧飙升。

在大多数情况下,前沿通用模型并非每个任务都必需。通过针对特定产品调优模型,可以在保持甚至超越前沿性能的同时,大幅降低 Token 成本,有时可减少 50% 甚至更多

正如萨提亚在我们第四季度财报电话会议上提到的,自上季度以来,我们在 Microsoft 产品中已交付了 十多个专业的 MAI 模型。所有这些模型在 保持或提升质量 的同时,使用的 Token 显著减少,在许多情况下节省了多达 50-90% 的 GPU 成本

这就是爬山机器的实际运作——在自有框架中,使用自有数据和工作流,通过 RLE 训练来协同优化模型。我们相信这就是前沿公司的新节奏,并且正在构建一项名为 Frontier Tuning 的服务,帮助所有公司像这样运作。

这个飞轮将推动前沿生态系统繁荣发展,使其更具韧性,确保企业能够灵活切换模型、构建自有知识产权并控制成本。

以下是本季度交付的部分模型及其 Token 效率影响:

  • MAI-Code-1-Flash 在 VS Code 中的代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高出 10%,中位 Token 使用量降低 10%,平均留存率提升 9%。
  • MAI-Code-1-Flash 也是我们 Excel 模型的基础,该模型在性能与同类模型相当的同时,在 H100 上提供服务,而非 GB 架构。
  • MAI-Image-2.5-Flash 在 PowerPoint 中相比 GPT-Image-2 将 GPU 成本降低了 高达 84%。在 OneDrive 中相比 GPT-Image-1.5 实现了 高达 2.5 倍的 Token 效率,同时将 P95 延迟降低了 25%,用户保存率提升了 25%。
  • MAI-Voice-2-Flash 在提供世界一流质量的同时,将 GPU 成本降低了 高达 89%,速度是其前代的 2 倍,成本降低了 32%。
  • MAI-Transcribe-1.5 的运行速度可 比竞品模型快 5 倍,已部署到 Dragon Copilot 产品的 58 种语言中,该产品被 17 万名医疗提供者用于近 3000 万次患者诊疗。

这是在我们行业历史上最激动人心的时刻,一个充满辛勤工作的夏季。团队干得漂亮!更多精彩还在后面,我们才刚刚开始。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章