Kimi K3 ने AI सब्सक्रिप्शन के दौर का अंत कर दिया है

@0xDominiqq
अंग्रेज़ी3 दिन पहले · 18 जुल॰ 2026
275K
83
12
4
176

TL;DR

Moonshot AI का Kimi K3 एक 2.8 ट्रिलियन पैरामीटर वाला ओपन-वेट मॉडल पेश करता है, जिसमें दस लाख टोकन की कॉन्टेक्स्ट विंडो है। यह Mixture-of-Experts और अभिनव अटेंशन मैकेनिज्म का लाभ उठाकर लागत को कम करता है और क्लोज्ड-API के प्रभुत्व को चुनौती देता है।

मुख्य संख्या कहानी नहीं है

27 जुलाई को, Moonshot AI ने एक संशोधित MIT लाइसेंस के तहत Kimi K3 के पूर्ण वेट जारी किए। स्पेक शीट एक विशालता का प्रदर्शन करती है: 2.8 ट्रिलियन पैरामीटर, एक मिलियन टोकन का संदर्भ विंडो, और अब तक जारी किया गया सबसे बड़ा ओपन-वेट मॉडल होने का खिताब, जो DeepSeek V4 Pro से लगभग 75% बड़ा है।

लेकिन आकार प्रलोभन है। असली कहानी एक बदलाव है कि फ्रंटियर-स्तरीय बुद्धिमत्ता तक पहुंच को कौन नियंत्रित करता है। तीन वर्षों तक, सबसे अच्छे मॉडल एक API के पीछे रहते थे। आप किराया देते थे, मकान मालिक शर्तें तय करता था, और यदि विक्रेता एंडपॉइंट की कीमत बदल देता या चुपचाप मॉडल के व्यवहार में बदलाव कर देता, तो आपके उत्पाद को नुकसान उठाना पड़ता था।

ओपन वेट उस व्यवस्था को तोड़ देते हैं। एक बार फ़ाइलें सार्वजनिक हो जाने पर, कोई भी प्रयोगशाला क्षमता वापस नहीं ले सकती। यह एकमात्र तथ्य सभी के लिए अर्थव्यवस्था को बदल देता है, जिसमें वे लोग भी शामिल हैं जो कभी एक भी शार्ड डाउनलोड नहीं करेंगे।

एक नज़र में स्पेक शीट

विशिष्टता

मान

पैरामीटर

2.8 ट्रिलियन

विशेषज्ञ

कुल 896, प्रति टोकन 16 सक्रिय

संदर्भ विंडो

1,048,576 टोकन

लाइसेंस

संशोधित MIT

वेट रिलीज़

27 जुलाई

DeepSeek V4 Pro से आकार

~75% बड़ा

K2 बनाम स्केलिंग दक्षता

~2.5x

मूल्य निर्धारण

दर

इनपुट (कैश हिट)

$0.30 / 1M टोकन

इनपुट (कैश मिस)

$3.00 / 1M टोकन

आउटपुट

$15.00 / 1M टोकन

कैसे 2.8T मॉडल 2.8T बिल से बचता है

इस आकार का एक डेंस मॉडल अनुपयोगी होगा। हर टोकन पर हर पैरामीटर चलाना वह दीवार है जिससे सभी ट्रिलियन-स्केल मॉडल टकराते हैं: बहुत धीमा, बहुत महंगा, भौतिकी के आसपास कोई रास्ता नहीं।

K3 एक आक्रामक Mixture-of-Experts डिज़ाइन के साथ इससे बचता है। मॉडल के अंदर 896 विशेषज्ञ उप-नेटवर्क रहते हैं। किसी भी दिए गए टोकन पर, उनमें से केवल 16 सक्रिय होते हैं। आपको 2.8 ट्रिलियन पैरामीटर का संग्रहीत ज्ञान मिलता है जबकि आप उस आकार के एक अंश के मॉडल की अनुमानित लागत का भुगतान करते हैं।

यह स्पार्सिटी है, और K3 इस पर किसी भी पिछले ओपन मॉडल की तुलना में अधिक निर्भर करता है। K2 ने साबित किया कि दृष्टिकोण काम करता है। K3 इसे मुख्य दांव में बदल देता है।

Dominique - inline image

दो शोध पत्र जिन्होंने भारी काम किया

दो आर्किटेक्चरल परिवर्तन बाकी सब संभव बनाते हैं, और दोनों को मॉडल शिप होने से पहले ओपन रिसर्च के रूप में प्रकाशित किया गया था, जिसने Moonshot को एक भी बेंचमार्क दिखाई देने से पहले शोधकर्ताओं के साथ विश्वसनीयता अर्जित की।

पहला है Kimi Delta Attention, एक हाइब्रिड लीनियर अटेंशन मैकेनिज्म। मानक अटेंशन लागत संदर्भ लंबा होने पर चतुर्भुज रूप से बढ़ती है, यही कारण है कि मिलियन-टोकन विंडो आमतौर पर मार्केटिंग डेक में रहते हैं। KDA अलग तरह से स्केल करता है, और यह अंतर एकमात्र कारण है कि 1M विंडो उस कीमत पर मौजूद है जो कोई भी वास्तव में चुका सकता है।

दूसरा है Attention Residuals, मानक अवशिष्ट कनेक्शन का एक प्रतिस्थापन। Moonshot इसे लगातार स्केलिंग लाभ का श्रेय देता है, जिससे वे सामान्य गिरावट के बिना गहरे मॉडल बना सकते हैं। उनके अपने आंकड़ों के अनुसार, यह संयोजन K2 की तुलना में लगभग 2.5x स्केलिंग दक्षता प्रदान करता है।

एक मिलियन टोकन क्या मारता है

Dominique - inline image

प्रोडक्शन AI में अधिकांश रिट्रीवल इंफ्रास्ट्रक्चर एक कार्य-निवारण के रूप में मौजूद है। चंकिंग, एम्बेडिंग, वेक्टर डेटाबेस, RAG पाइपलाइन: यह सब उन मॉडलों की भरपाई करता है जो एक बार में कार्यशील मेमोरी में पर्याप्त नहीं रख सकते।

एक मिलियन टोकन डिफ़ॉल्ट बदल देता है। एक संपूर्ण कोडबेस एक ही प्रॉम्प्ट में चला जाता है। एक साल के आंतरिक दस्तावेज़। पचास वीडियो ट्रांसक्रिप्ट। सब कुछ एक साथ अटेंशन में बैठता है, और मॉडल पूरे कॉर्पस में तर्क करता है, बजाय पुनर्प्राप्त टुकड़ों को एक साथ जोड़ने और उम्मीद करने के कि सीम थामेंगी।

नेटिव विज़न इनपुट सतह को और चौड़ा करता है। स्क्रीनशॉट, व्हाइटबोर्ड फ़ोटो, आर्किटेक्चर डायग्राम और चार्ट उनके आसपास के कोड और टेक्स्ट के समान संदर्भ में पढ़ने योग्य हैं। यह कोई संयोग नहीं है कि K3 की सबसे मजबूत बेंचमार्क जीत फ्रंट-एंड कोडिंग में आई: मॉडल डिज़ाइन देखता है और एक संदर्भ विंडो के अंदर कार्यान्वयन लिखता है।

मूल्य निर्धारण तालिका जो बेंचमार्क से अधिक मायने रखती है

सूचीबद्ध दरें: कैश हिट पर $0.30 प्रति मिलियन इनपुट टोकन, कैश मिस पर $3.00, $15.00 प्रति मिलियन आउटपुट टोकन, 1,048,576 टोकन के संदर्भ के साथ।

कैश नंबर वह है जिस पर घूरना चाहिए। Moonshot लंबे कोडिंग सत्रों में 90% से अधिक कैश हिट दरों की रिपोर्ट करता है। सोचें कि एक एजेंट वास्तव में क्या करता है: वह घंटों तक एक ही रिपॉजिटरी को बार-बार पढ़ता है। कैशिंग के बिना, यह हर पास पर पूर्ण इनपुट मूल्य का भुगतान करता है। इसके साथ, एक लंबे सत्र की लागत लगभग 4x गिर जाती है।

लंबे-क्षितिज वाले एजेंट बिल्कुल इस गणित पर जीते या मरते हैं। K3 उन सत्रों के लिए बनाया गया है जो न्यूनतम पर्यवेक्षण के साथ घंटों तक चलते हैं, एक रिपॉजिटरी में नेविगेट करते हैं, टर्मिनल टूल्स को ऑर्केस्ट्रेट करते हैं, अपने स्वयं के काम की जांच करते हैं। मूल्य निर्धारण संरचना ही उत्पाद है।

वह पकड़ जिसे किसी को नहीं छोड़ना चाहिए

K3 में कोई इकोनॉमी मोड नहीं है। रीज़निंग स्थायी रूप से चालू है और अधिकतम पर स्थिर है। स्वतंत्र परीक्षकों ने इसे एक तुच्छ SVG अनुरोध पर 13,000 से अधिक सोच टोकन जलाते देखा, एक फालतू क्वेरी के लिए लगभग $0.25।

सबक रूटिंग है। त्वरित, सस्ते, उच्च-मात्रा वाले कॉल छोटे मॉडलों पर हैं। K3 अपनी लागत तभी कमाता है जब संदर्भ आकार और कार्य जटिलता हमेशा-चालू रीज़निंग को उचित ठहराते हैं। इसे सामान्य-उद्देश्य चैट एंडपॉइंट के रूप में उपयोग करना पैसे को आग में झोंकना है।

इसे प्लग इन करने में पांच मिनट लगते हैं

API OpenAI-संगत है। base_url और की बदलें, अपने मौजूदा कोड को रखें:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Kimi K3 का परिचय एक वाक्य में दें।"}],
12)
13print(completion.choices[0].message.content)

रीज़निंग को एक शीर्ष-स्तरीय फ़ील्ड के माध्यम से कॉन्फ़िगर किया जाता है, जो वर्तमान में केवल "max" स्वीकार करता है:

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "सिद्ध करें कि 2 का वर्गमूल अपरिमेय है।"}],
5)
6print(completion.choices[0].message.content)

स्ट्रीमिंग मानक तरीके से काम करती है, जिसमें रीज़निंग एक अलग डेल्टा फ़ील्ड में आता है ताकि आप सोच और उत्तर को स्वतंत्र रूप से प्रस्तुत कर सकें:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "समझाएं कि आसमान नीला क्यों है।"}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

विज़न इनपुट उसी संदेश में टेक्स्ट के साथ base64-एन्कोडेड छवियां लेता है। यह स्क्रीनशॉट-टू-कोड वर्कफ़्लो अपनी संपूर्णता में है:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "इस लैंडिंग पेज को HTML और Tailwind में फिर से बनाएं।"},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

यह उन लोगों तक क्यों पहुंचता है जो कभी वेट को नहीं छूते

यहाँ ईमानदार हिस्सा है: लगभग कोई भी 2.8 ट्रिलियन पैरामीटर को स्वयं होस्ट नहीं करेगा। स्पार्सिटी के बावजूद, हार्डवेयर बिल शौकिया सीमा से बहुत दूर है, और अधिकांश कंपनियों से भी परे है।

यह कभी बिंदु नहीं था। सार्वजनिक वेट बंद प्रयोगशालाओं द्वारा तुलनीय क्षमता के लिए चार्ज करने की सीमा पर एक छत रखते हैं। तृतीय-पक्ष होस्ट एक-दूसरे के साथ K3 को कमोडिटी मार्जिन पर सेवा देने की होड़ करेंगे, वही गतिशीलता जो इससे पहले हर प्रमुख ओपन रिलीज़ के साथ खेली गई थी। पूरे बाजार में कीमतें ओपन बेसलाइन की ओर बढ़ती हैं।

लाभ आप तक आपके जो भी प्रदाता पहले से उपयोग कर रहे हैं, उसके चालान के माध्यम से पहुंचता है, चाहे आप कभी कोई फ़ाइल डाउनलोड करें या नहीं।

एक व्यावहारिक खेल योजना

इसे पूरी चीजें खिलाएं। समीक्षा के लिए पूर्ण रिपॉजिटरी, पूर्ण अनुबंध फ़ोल्डर, एक संपूर्ण सामग्री लाइब्रेरी। जो अब चंकिंग की आवश्यकता नहीं है, उसे चंक करना बंद करें।

इसे लंबा चलाएं। बहु-घंटे के इंजीनियरिंग सत्रों को कतारबद्ध करें और बाद में परिणाम जांचें। कैश हर पुन: पढ़ने की लागत को खा जाता है।

एक कैमरे को समस्याओं की ओर इंगित करें। एक लैंडिंग पेज का स्क्रीनशॉट लें और पुनर्निर्माण के लिए पूछें। एक व्हाइटबोर्ड की फ़ोटो लें और कार्यान्वयन के लिए पूछें।

इस पर तुच्छ ट्रैफ़िक रखें। एक मॉडल जो हमेशा अधिकतम पर तर्क करता है, त्वरित, उच्च-मात्रा वाले कॉल के लिए गलत उपकरण है। उन्हें कहीं और रूट करें और K3 को उस काम के लिए बचाएं जो इसके लायक है।

दस दिनों की उलटी गिनती

तीन वर्षों तक फ्रंटियर कुछ ऐसा था जिसे आप किराए पर लेते थे, उन शर्तों पर जो आपने निर्धारित नहीं की थीं, उन कीमतों पर जो बिना चेतावनी के बदल सकती थीं।

27 जुलाई को यह एक फ़ाइल बन जाता है। और एक फ़ाइल, एक सब्सक्रिप्शन के विपरीत, कुछ ऐसी है जिसके आप मालिक हैं।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें