Cette semaine, MAI-Cyber-1-Flash dans notre harnais MDASH a atteint la première place du benchmark CyberGym – battant Mythos de 12 points – pour 50 % du coût.
Ce type d’optimisation performance-coût est au cœur du nouveau paradigme de déploiement de modèles. Le Tokenmaxxing a été le sujet de ces derniers mois. L’efficacité des tokens est le prochain grand enjeu de l’industrie.
Pour construire une entreprise de pointe, vous devez optimiser les performances de pointe par rapport au coût. Choisir où vous voulez vous situer sur cette courbe est essentiel. En co-optimisant vos modèles, harnais et RLE, vous pouvez choisir un point de la courbe qui convient à votre entreprise.
Alors que nous courons vers un monde où les entreprises de pointe déploient des agents en temps réel, toujours actifs et fonctionnant en continu en arrière-plan, les coûts de demande d’inférence vont exploser.
Dans la plupart des cas, les modèles généralistes de pointe ne sont pas nécessaires pour chaque tâche. En ajustant les modèles pour un produit spécifique, vous pouvez maintenir, voire dépasser les performances de pointe, tout en réduisant considérablement les coûts des tokens, parfois de 50 % ou plus.
Comme Satya vient de le mentionner lors de notre appel sur les résultats du T4, nous avons livré plus d’une douzaine de modèles MAI spécialisés dans les produits Microsoft depuis le dernier trimestre. Tous maintiennent ou améliorent la qualité par rapport aux modèles déployés existants, tout en utilisant nettement moins de tokens, économisant dans de nombreux cas jusqu’à 50 à 90 % des coûts GPU.
C’est la machine de hill-climbing en action. Co-optimiser vos propres modèles, dans votre propre harnais, avec vos données et workflows, entraînés dans vos RLE. Nous croyons que c’est le nouveau rythme d’une entreprise de pointe, et nous construisons un service appelé Frontier Tuning, qui aidera toutes les entreprises à fonctionner ainsi.
Ce volant d’inertie est ce qui permettra à l’écosystème de pointe de prospérer et d’être plus résilient, assurant que vous pouvez échanger des modèles, construire votre propre propriété intellectuelle et maîtriser les coûts.
Voici une liste de certains de nos modèles livrés ce trimestre et leur impact sur l’efficacité des tokens :
- MAI-Code-1-Flash offre un taux d’acceptation de code 10 % supérieur à GPT-5.4 Mini et Claude Haiku 4.5 dans VS Code, une utilisation médiane des tokens inférieure de 10 %, et augmente la rétention de 9 % en moyenne.
- MAI-Code-1-Flash est également la base de notre modèle Excel qui offre des performances comparables à des modèles similaires, tout en étant servi sur des H100s, vs. des GBs.
- MAI-Image-2.5-Flash réduit les coûts GPU jusqu’à 84 % dans PowerPoint par rapport à GPT-Image-2. Dans OneDrive, il offre jusqu’à 2,5x d’efficacité des tokens tout en réduisant la latence P95 de 25 % par rapport à GPT-Image-1.5, et en augmentant les taux de sauvegarde des utilisateurs de 25 %.
- MAI-Voice-2-Flash offre une qualité de classe mondiale tout en réduisant les coûts GPU jusqu’à 89 %, tout en étant 2 fois plus rapide et 32 % moins cher que son prédécesseur.
- MAI-Transcribe-1.5 qui peut fonctionner jusqu’à 5 fois plus vite que les modèles concurrents, est livré dans 58 langues via le produit Dragon Copilot, utilisé par 170 000 professionnels de santé pour près de 30 millions de consultations.
Ce fut un été de travail acharné pendant la période la plus excitante de l’histoire de notre industrie. Super travail de l’équipe ! Beaucoup plus à venir, nous ne faisons que commencer.





