इस सप्ताह हमारे MDASH हार्नेस में MAI-Cyber-1-Flash ने CyberGym बेंचमार्क पर नंबर 1 स्थान प्राप्त किया - Mythos को 12 प्रतिशत अंकों से पीछे छोड़ते हुए - और लागत में 50% की बचत के साथ।
प्रदर्शन-लागत के ऐसे अनुकूलन नए मॉडल डिप्लॉयमेंट प्रतिमान के केंद्र में हैं। Tokenmaxxing पिछले कुछ महीनों की कहानी रही है। Token दक्षता अब पूरे उद्योग में अगला बड़ा फोकस है।
एक अग्रणी फर्म बनाने के लिए, आपको अग्रणी प्रदर्शन को लागत के साथ अनुकूलित करना होगा। यह तय करना कि आप उस वक्र पर कहाँ बैठना चाहते हैं, महत्वपूर्ण है। अपने मॉडलों, हार्नेस और RLE को सह-अनुकूलित करके, आप वक्र पर एक ऐसा बिंदु चुन सकते हैं जो आपकी फर्म के लिए उपयुक्त हो।
जैसे-जैसे हम एक ऐसी दुनिया की ओर बढ़ रहे हैं जहाँ अग्रणी फर्में हमेशा सक्रिय, रियल-टाइम एजेंटों को तैनात करती हैं जो लगातार पृष्ठभूमि में काम करते हैं, इन्फ्रेंस डिमांड की लागत आसमान छूने वाली है।
अधिकांश मामलों में, हर कार्य के लिए अग्रणी जनरलिस्ट मॉडल आवश्यक नहीं होते। किसी विशिष्ट उत्पाद के लिए मॉडल को ट्यून करके, आप अग्रणी प्रदर्शन को बनाए रख सकते हैं या उससे आगे भी बढ़ सकते हैं, जबकि टोकन लागतों को नाटकीय रूप से कम कर सकते हैं, कभी-कभी 50% या उससे भी अधिक।
जैसा कि सत्या ने हमारी Q4 आय कॉल पर अभी उल्लेख किया, हमने पिछली तिमाही से Microsoft उत्पादों में एक दर्जन से अधिक विशेषज्ञ MAI मॉडल शिप किए हैं। ये सभी मौजूदा तैनात मॉडलों की तुलना में गुणवत्ता बनाए रखते हैं या सुधारते हैं, जबकि काफी कम टोकन का उपयोग करते हैं, कई मामलों में GPU लागतों में 50-90% तक की बचत करते हैं।
यह हिल-क्लाइंबिंग मशीन क्रियाशील है। अपने मॉडलों को अपने हार्नेस में, अपने डेटा और वर्कफ़्लो के साथ, अपने RLE में प्रशिक्षित करके सह-अनुकूलित करना। हमारा मानना है कि यह एक अग्रणी फर्म की नई लय है, और हम Frontier Tuning नामक एक सेवा बना रहे हैं, जो सभी फर्मों को इस तरह से काम करने में मदद करेगी।
यह फ्लाईव्हील ही अग्रणी इकोसिस्टम को समृद्ध होने और अधिक लचीला बनने में सक्षम बनाएगा, यह सुनिश्चित करते हुए कि आप मॉडल बदल सकते हैं, अपनी खुद की IP बना सकते हैं और लागतों को नियंत्रित कर सकते हैं।
यहाँ इस तिमाही में शिप किए गए हमारे कुछ मॉडलों और टोकन दक्षता प्रभाव की सूची दी गई है:
- MAI-Code-1-Flash VS Code में GPT-5.4 Mini और Claude Haiku 4.5 की तुलना में 10% अधिक कोड स्वीकृति दर, 10% कम माध्यिका टोकन उपयोग प्रदान करता है, और औसतन प्रतिधारण में 9% की वृद्धि करता है।
- MAI-Code-1-Flash हमारे Excel मॉडल का आधार भी है, जो समान मॉडलों के बराबर प्रदर्शन देता है, जबकि GBs के बजाय H100s पर सर्व किया जाता है।
- MAI-Image-2.5-Flash PowerPoint में GPT-Image-2 की तुलना में GPU लागतों को 84% तक कम करता है। OneDrive में यह 2.5x टोकन दक्षता प्रदान करता है, साथ ही GPT-Image-1.5 की तुलना में P95 विलंबता में 25% की कमी लाता है और उपयोगकर्ता सेव दरों में 25% की वृद्धि करता है।
- MAI-Voice-2-Flash विश्व स्तरीय गुणवत्ता प्रदान करता है, जबकि GPU लागतों को 89% तक कम करता है, और अपने पूर्ववर्ती की तुलना में 2x तेज और 32% सस्ता है।
- MAI-Transcribe-1.5 जो प्रतिस्पर्धी मॉडलों से 5x तक तेज चल सकता है, Dragon Copilot उत्पाद में 58 भाषाओं में शिप किया गया है, जिसका उपयोग 170k चिकित्सा प्रदाताओं द्वारा लगभग 3 करोड़ रोगी मुठभेड़ों के लिए किया जाता है।
यह हमारे उद्योग के इतिहास के सबसे रोमांचक समय के दौरान कड़ी मेहनत की गर्मी रही है। टीम द्वारा शानदार काम! अभी और भी बहुत कुछ आना बाकी है, हम अभी शुरुआत कर रहे हैं।





