今週、私たちの MDASH ハーネス内の MAI-Cyber-1-Flash が、CyberGym ベンチマークで第 1 位を獲得しました。Mythos を 12 パーセントポイント上回り、コストは 50% で実現しました。
このようなパフォーマンスとコストの最適化は、新しいモデル展開パラダイムの中心です。トークンマキシングはここ数ヶ月のトレンドでした。トークン効率が業界全体の次の大きな注目点です。
フロンティア企業を構築するには、フロンティアのパフォーマンスをコストに対して最適化する必要があります。その曲線上のどこに位置するかを選ぶことが重要です。モデル、ハーネス、RLE を共同最適化することで、自社に適した曲線上の点を選択できます。
フロンティア企業が常時稼働し、バックグラウンドで継続的に動作するリアルタイムエージェントを展開する世界へと突き進む中、推論需要のコストは急騰するでしょう。
ほとんどの場合、フロンティア汎用モデルはすべてのタスクに必要ではありません。特定の製品向けにモデルをチューニングすることで、フロンティアのパフォーマンスを維持または向上させながら、トークンコストを大幅に削減でき、場合によっては 50% 以上も削減できます。
Satya が第 4 四半期決算説明会で述べたように、前四半期以来、Microsoft 製品全体で 12 以上の専門 MAI モデルを出荷しました。これらはすべて、既存のデプロイモデルと比較して品質を維持または向上させながら、はるかに少ないトークンを使用し、多くの場合 GPU コストを 50~90% 節約しています。
これがヒルクライミングマシンの実践です。自社のモデルを、自社のハーネスで、自社のデータとワークフローを用いて共同最適化し、自社の RLE でトレーニングする。これがフロンティア企業の新しいリズムだと私たちは信じており、Frontier Tuning というサービスを構築しています。このサービスは、すべての企業がこのように機能するのを支援します。
このフライホイールこそが、フロンティアエコシステムの繁栄と回復力を高め、モデルの交換、自社 IP の構築、コスト管理を可能にします。
以下は、今四半期に出荷されたモデルとトークン効率への影響の一部です。
- MAI-Code-1-Flash は、VS Code において GPT-5.4 Mini および Claude Haiku 4.5 よりもコード受理率が 10% 高く、中央トークン使用量が 10% 低く、平均保持率が 9% 向上します。
- MAI-Code-1-Flash は、Excel モデルのベースでもあり、同等のパフォーマンスを提供しながら、H100 で運用され、GB ではなくなっています。
- MAI-Image-2.5-Flash は、PowerPoint において GPT-Image-2 と比較して GPU コストを 最大 84% 削減します。OneDrive では、2.5 倍のトークン効率を実現し、GPT-Image-1.5 と比較して P95 レイテンシを 25% 削減し、ユーザー保存率を 25% 向上させます。
- MAI-Voice-2-Flash は、ワールドクラスの品質を提供しながら、GPU コストを 最大 89% 削減し、前世代と比較して 2 倍高速で 32% 安価です。
- MAI-Transcribe-1.5 は、競合モデルよりも 最大 5 倍高速で、Dragon Copilot 製品全体で 58 言語に出荷されており、この製品は 17 万人の医療提供者によって、約 3000 万件の患者診療に使用されています。
業界史上最もエキサイティングな時期に、懸命に努力した夏でした。チームの素晴らしい仕事に感謝します!まだまだ続きます、私たちは始まったばかりです。





