Bu hafta MDASH koşumumuz içindeki MAI-Cyber-1-Flash, CyberGym benchmark'ında %12 puan farkla Mythos'u geçerek 1. sıraya yerleşti - hem de maliyetin %50'si ile.
Bu tür performans-maliyet optimizasyonları, yeni model dağıtım paradigmasının merkezinde yer alıyor. Tokenmaxxing son birkaç ayın hikayesiydi. Token verimliliği ise sektörün bir sonraki büyük odağı.
Bir sınır firması kurmak için, sınır performansını maliyete karşı optimize etmeniz gerekir. Bu eğride nerede durmak istediğinizi seçmek kritiktir. Modellerinizi, koşumlarınızı ve RLE'lerinizi birlikte optimize ederek, firmanıza uygun bir nokta seçebilirsiniz.
Sürekli olarak arka planda çalışan, her zaman açık, gerçek zamanlı ajanlar kullanan sınır firmalarının olduğu bir dünyaya doğru ilerlerken, çıkarım talep maliyetleri fırlayacak.
Çoğu durumda, her görev için sınır genelci modeller gerekli değildir. Modelleri belirli bir ürüne göre ayarlayarak, sınır performansını koruyabilir veya hatta aşabilir, token maliyetlerini önemli ölçüde, bazen %50 veya daha fazla azaltabilirsiniz.
Satya'nın Q4 kazanç çağrımızda belirttiği gibi, geçen çeyrekten bu yana Microsoft ürünlerinde bir düzineden fazla uzman MAI modeli yayınladık. Bunların tümü, mevcut dağıtılmış modellere kıyasla kaliteyi korur veya iyileştirir ve aynı zamanda önemli ölçüde daha az token kullanır; çoğu durumda GPU maliyetlerinde %50-90'a varan tasarruf sağlar.
Bu, tepe tırmanma makinesinin iş başındaki halidir. Kendi modellerinizi, kendi koşumunuzda, kendi verileriniz ve iş akışlarınızla, kendi RLE'lerinizde eğiterek birlikte optimize etmek. Bunun bir sınır firmasının yeni ritmi olduğuna inanıyoruz ve tüm firmaların bu şekilde çalışmasına yardımcı olacak Frontier Tuning adlı bir hizmet geliştiriyoruz.
Bu volan, sınır ekosisteminin gelişmesini ve daha dirençli olmasını sağlayacak; modelleri değiştirebilmenizi, kendi fikri mülkiyetinizi oluşturmanızı ve maliyetleri kontrol etmenizi garanti altına alacak.
İşte bu çeyrekte yayınladığımız modellerden bazıları ve token verimliliği etkileri:
- MAI-Code-1-Flash, VS Code'da GPT-5.4 Mini ve Claude Haiku 4.5'ten %10 daha yüksek kod kabul oranı, %10 daha düşük medyan token kullanımı sunar ve kullanıcı bağlılığını ortalama %9 artırır.
- MAI-Code-1-Flash ayrıca Excel modelimizin de temelini oluşturur; benzer modellere benzer performans sunarken, GB'ler yerine H100'lerde sunulur.
- MAI-Image-2.5-Flash, PowerPoint'te GPT-Image-2'ye kıyasla GPU maliyetlerini %84'e kadar azaltır. OneDrive'da, GPT-Image-1.5'e kıyasla 2,5 kata kadar token verimliliği sağlarken P95 gecikme süresini %25 kısaltır ve kullanıcı kaydetme oranlarını %25 artırır.
- MAI-Voice-2-Flash, dünya standartlarında kalite sunarken GPU maliyetlerini %89'a kadar azaltır, selefinden 2 kat daha hızlı ve %32 daha ucuzdur.
- MAI-Transcribe-1.5, rakip modellerden 5 kata kadar daha hızlı çalışabilir, Dragon Copilot ürününde 58 dile sunulur ve 170 bin sağlık hizmeti sağlayıcısı tarafından yaklaşık 30 milyon hasta karşılaşmasında kullanılır.
Sektör tarihimizin en heyecanlı döneminde yoğun bir yaz geçirdik. Ekip harika bir iş çıkardı! Daha çok şey gelecek, daha yeni başlıyoruz.





