फ्रंटियर परफॉरमेंस कर्व को ऑप्टिमाइज़ करना

@mustafasuleyman
अंग्रेज़ी2 दिन पहले · 29 जुल॰ 2026
133K
250
32
21
72

TL;DR

मुस्तफा सुलेमान ने टोकन दक्षता और विशेष मॉडलों के लिए Microsoft AI की रणनीति का विवरण दिया है, जिसमें महत्वपूर्ण लागत बचत और Frontier Tuning सर्विस के लॉन्च पर प्रकाश डाला गया है।

इस सप्ताह हमारे MDASH हार्नेस में MAI-Cyber-1-Flash ने CyberGym बेंचमार्क पर नंबर 1 स्थान प्राप्त किया - Mythos को 12 प्रतिशत अंकों से पीछे छोड़ते हुए - और लागत में 50% की बचत के साथ

प्रदर्शन-लागत के ऐसे अनुकूलन नए मॉडल डिप्लॉयमेंट प्रतिमान के केंद्र में हैं। Tokenmaxxing पिछले कुछ महीनों की कहानी रही है। Token दक्षता अब पूरे उद्योग में अगला बड़ा फोकस है।

एक अग्रणी फर्म बनाने के लिए, आपको अग्रणी प्रदर्शन को लागत के साथ अनुकूलित करना होगा। यह तय करना कि आप उस वक्र पर कहाँ बैठना चाहते हैं, महत्वपूर्ण है। अपने मॉडलों, हार्नेस और RLE को सह-अनुकूलित करके, आप वक्र पर एक ऐसा बिंदु चुन सकते हैं जो आपकी फर्म के लिए उपयुक्त हो।

जैसे-जैसे हम एक ऐसी दुनिया की ओर बढ़ रहे हैं जहाँ अग्रणी फर्में हमेशा सक्रिय, रियल-टाइम एजेंटों को तैनात करती हैं जो लगातार पृष्ठभूमि में काम करते हैं, इन्फ्रेंस डिमांड की लागत आसमान छूने वाली है।

अधिकांश मामलों में, हर कार्य के लिए अग्रणी जनरलिस्ट मॉडल आवश्यक नहीं होते। किसी विशिष्ट उत्पाद के लिए मॉडल को ट्यून करके, आप अग्रणी प्रदर्शन को बनाए रख सकते हैं या उससे आगे भी बढ़ सकते हैं, जबकि टोकन लागतों को नाटकीय रूप से कम कर सकते हैं, कभी-कभी 50% या उससे भी अधिक

जैसा कि सत्या ने हमारी Q4 आय कॉल पर अभी उल्लेख किया, हमने पिछली तिमाही से Microsoft उत्पादों में एक दर्जन से अधिक विशेषज्ञ MAI मॉडल शिप किए हैं। ये सभी मौजूदा तैनात मॉडलों की तुलना में गुणवत्ता बनाए रखते हैं या सुधारते हैं, जबकि काफी कम टोकन का उपयोग करते हैं, कई मामलों में GPU लागतों में 50-90% तक की बचत करते हैं।

यह हिल-क्लाइंबिंग मशीन क्रियाशील है। अपने मॉडलों को अपने हार्नेस में, अपने डेटा और वर्कफ़्लो के साथ, अपने RLE में प्रशिक्षित करके सह-अनुकूलित करना। हमारा मानना है कि यह एक अग्रणी फर्म की नई लय है, और हम Frontier Tuning नामक एक सेवा बना रहे हैं, जो सभी फर्मों को इस तरह से काम करने में मदद करेगी।

यह फ्लाईव्हील ही अग्रणी इकोसिस्टम को समृद्ध होने और अधिक लचीला बनने में सक्षम बनाएगा, यह सुनिश्चित करते हुए कि आप मॉडल बदल सकते हैं, अपनी खुद की IP बना सकते हैं और लागतों को नियंत्रित कर सकते हैं।

यहाँ इस तिमाही में शिप किए गए हमारे कुछ मॉडलों और टोकन दक्षता प्रभाव की सूची दी गई है:

  • MAI-Code-1-Flash VS Code में GPT-5.4 Mini और Claude Haiku 4.5 की तुलना में 10% अधिक कोड स्वीकृति दर, 10% कम माध्यिका टोकन उपयोग प्रदान करता है, और औसतन प्रतिधारण में 9% की वृद्धि करता है।
  • MAI-Code-1-Flash हमारे Excel मॉडल का आधार भी है, जो समान मॉडलों के बराबर प्रदर्शन देता है, जबकि GBs के बजाय H100s पर सर्व किया जाता है
  • MAI-Image-2.5-Flash PowerPoint में GPT-Image-2 की तुलना में GPU लागतों को 84% तक कम करता है। OneDrive में यह 2.5x टोकन दक्षता प्रदान करता है, साथ ही GPT-Image-1.5 की तुलना में P95 विलंबता में 25% की कमी लाता है और उपयोगकर्ता सेव दरों में 25% की वृद्धि करता है।
  • MAI-Voice-2-Flash विश्व स्तरीय गुणवत्ता प्रदान करता है, जबकि GPU लागतों को 89% तक कम करता है, और अपने पूर्ववर्ती की तुलना में 2x तेज और 32% सस्ता है।
  • MAI-Transcribe-1.5 जो प्रतिस्पर्धी मॉडलों से 5x तक तेज चल सकता है, Dragon Copilot उत्पाद में 58 भाषाओं में शिप किया गया है, जिसका उपयोग 170k चिकित्सा प्रदाताओं द्वारा लगभग 3 करोड़ रोगी मुठभेड़ों के लिए किया जाता है।

यह हमारे उद्योग के इतिहास के सबसे रोमांचक समय के दौरान कड़ी मेहनत की गर्मी रही है। टीम द्वारा शानदार काम! अभी और भी बहुत कुछ आना बाकी है, हम अभी शुरुआत कर रहे हैं।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें