किसी काम के लिए सबसे अच्छा मॉडल लगभग कभी भी लीडरबोर्ड पर सबसे अच्छा मॉडल नहीं होता है।
AI की दुनिया में, क्रिसमस हफ्ते में लगभग एक बार आता है। एक नया मॉडल आता है, हर कोई उन्हीं गलत-सटीकता वाले बेंचमार्क चार्ट को देखता है, और हम सब मान लेते हैं कि यह तो ब्रेड के टुकड़ों के बाद से सबसे बड़ी चीज़ है, अगले हफ्ते तक, जब हम फिर से वही करते हैं।
लेकिन उनमें से कोई भी चार्ट उस एक सवाल का जवाब नहीं देता जो वास्तव में मायने रखता है। क्या मॉडल वास्तव में आपकी दैनिक ब्रीफिंग चला सकता है या किसी ग्राहक को कोटेशन भेज सकता है? Hyperagent में, हम आपको बेस्ट-इन-क्लास एजेंट के साथ इन सभी मॉडलों तक पहुँच प्रदान करते हैं। इसलिए हमने उन्हें खुद चलाया। चौदह मॉडल, बयालीस रन, उस वास्तविक नॉलेज वर्क पर जो हमारे ग्राहक हर दिन एजेंटों को सौंपते हैं। तीन चीज़ें सामने आईं।
- एक ही काम के लिए बिल में 50 गुना का अंतर था। उसी टेस्ट बैटरी की कीमत Qwen 3.7 Plus पर $1.48 और Fable 5 पर $75.16 थी।
- बेंचमार्क विजेता काम का विजेता नहीं था। GPT 5.6 Sol ने हमारे बेसलाइन टेस्ट में शीर्ष स्थान पाया, लेकिन Hyperagent के अंदर वास्तविक काम चलाने पर वह शीर्ष तीन में भी नहीं आया। Grok 4.5 बेसलाइन पर मध्य-स्तर पर था और तैयार काम, गति और लागत में पहले स्थान पर आया।
- और कोई भी मॉडल हर चीज़ में नहीं जीता। सही चुनाव काम के साथ बदलता रहा।
निष्कर्ष कोई नया पसंदीदा मॉडल नहीं है। यह एक तरीका है कि कैसे, काम-दर-काम, यह तय किया जाए कि कौन सा मॉडल अपनी लागत के लायक है।
नॉलेज वर्क के लिए AI मॉडल का नक्शा
हर वह काम जो आप किसी एजेंट को सौंपेंगे, दो सवालों पर आता है: उसे कितने निर्णय की आवश्यकता है, और वह कितनी बार चलता है? इन दो अक्षों को प्लॉट करें और नॉलेज वर्क चार क्षेत्रों में बंट जाता है, जिनमें से प्रत्येक को एक अलग तरह के मॉडल की आवश्यकता होती है।

वॉल्यूम वर्क (ऊपर बाएँ)। ट्राइएज, मॉनिटरिंग, रूटिंग, डेटा सिंक। स्पष्ट प्रक्रिया, लगातार चलता है, और गलती की भरपाई करना सस्ता है। इस काम के लिए तेज़ और सस्ता कुछ चाहिए।
दैनिक कला (ऊपर दाएँ)। ड्राफ्टिंग, रिपोर्टिंग, रिसर्च, क्लाइंट कम्युनिकेशन। आवर्ती नॉलेज वर्क जो अधिकांश सप्ताह भरता है - इसे वास्तविक संश्लेषण और एक अच्छा लेखन स्वर चाहिए, जो विश्वसनीय रूप से और अक्सर किया जाए।
उच्च दांव (नीचे दाएँ)। कॉन्ट्रैक्ट रिव्यू, प्राइसिंग कॉल्स, गहन विश्लेषण। दुर्लभ, लेकिन गलत जवाब की कीमत एक क्लाइंट, एक कॉन्ट्रैक्ट या एक तिमाही का मार्जिन हो सकता है। यह वह जगह है जहाँ नुकसान मॉडल बिल से कहीं अधिक होता है, और जहाँ सबसे महँगे मॉडल अपनी दर कमाते हैं।
ऑप्टिमाइज़ न करें (नीचे बाएँ)। कभी-कभार आने वाला, सरल अनुरोध जहाँ कोई भी सक्षम मॉडल मानक पूरा कर लेता है और कीमत का अंतर इतना छोटा होता है कि उस पर निर्णय लेना उचित नहीं है। यह नक्शे पर एकमात्र वर्ग है जिसके बारे में हम लोगों को न सोचने के लिए कहते हैं।
तीन मॉडल वर्ग
नक्शे से तीन कार्यशील वर्ग निकलते हैं। वे किसी मॉडल को अच्छा या बुरा बताने के बजाय काम के अर्थशास्त्र और निर्णय प्रोफ़ाइल का वर्णन करते हैं।
स्प्रिंटर्स वॉल्यूम वर्क के लिए बनाए गए हैं - तेज़, सस्ते, और लगातार जब प्रक्रिया स्पष्ट हो और गलती को ठीक करना आसान हो। Haiku 4.5, Gemini 3.5 Flash, और DeepSeek V4 Pro।
मिडिलवेट्स दैनिक कला चलाते हैं। वे स्रोतों का संश्लेषण करते हैं, बहु-चरणीय योजना बनाए रखते हैं, और हर रिपोर्ट के लिए शीर्ष-स्तरीय दरें वसूले बिना अच्छा लिखते हैं। Sonnet 5, GPT 5.6 Terra, Grok 4.5, और GLM 5.2 - जहाँ अधिकांश नॉलेज वर्क आता है।
हैवीवेट्स उच्च-दांव वाली कॉल्स लेते हैं, मजबूत निर्णय और अधिक तर्क समय लाते हैं उस काम के लिए जहाँ गलत जवाब की कीमत मॉडल बिल से कहीं अधिक होती है। Opus 4.8, GPT 5.6 Sol, और Fable 5।
ज़्यादातर लोगों की प्रवृत्ति ऊपर से शुरू करके नीचे आने की होती है - सब कुछ Fable 5 या Opus 4.8 पर चलाएँ, मनचाहा आउटपुट लें, फिर सस्ते मॉडल आज़माएँ जब तक गुणवत्ता कम न हो जाए। यह काम करता है, लेकिन हमने पाया है कि अधिकांश कामों को इसकी ज़रूरत नहीं होती। एक बार जब आप काम का नाम बता सकते हैं और उसे नक्शे पर रख सकते हैं, तो आप आमतौर पर शुरू से ही सही वर्ग से शुरू कर सकते हैं। दैनिक कला के लिए, जो कि आपका अधिकांश काम है, इसका मतलब है एक ठोस मिडिलवेट जैसे Sonnet 5 से शुरू करना। आप केवल तभी ऊपर-नीचे की खोज के लिए पहुँचते हैं जब कोई काम वास्तव में उच्च-दांव वाले सिरे पर हो।
क्षेत्र Claude, GPT और Gemini से कहीं अधिक व्यापक है
अधिकांश टीमें उन मुट्ठी भर मॉडल नामों का उपयोग करती हैं जिन्हें वे पहले से जानती हैं। यह शुरुआत करने के लिए एक उचित जगह है, लेकिन यह रोस्टर के एक बड़े हिस्से को अछूता छोड़ देता है - और Hyperagent में सबसे उपयोगी काम करने वाले कुछ मॉडल घरेलू नाम नहीं हैं। ये बैटरी और दैनिक उपयोग के साथ-साथ हमारे द्वारा देखे गए ग्राहकों के काम से हमारे परिचालन अनुभव हैं।
Grok 4.5 तेज़, रीयल-टाइम रिसर्च है। यह टूल-भारी रिसर्च में तेज़ी से आगे बढ़ता है और Hyperagent की मूल Exa Search के साथ जोड़े जाने पर विशेष रूप से अच्छा प्रदर्शन करता है। इसकी X तक एक मूल लाइन भी है, इसलिए लाइव सेंटीमेंट के बारे में एक प्रश्न उत्तर के पीछे वास्तविक पोस्ट के साथ वापस आ सकता है। इसने पूरे रन के लिए $9.71 पर हमारा फिनिश्ड-वर्क स्कोर अर्जित किया।
Muse Spark 1.1 साफ लिखता है और खुद की जाँच करता है। यह हार्नेस में दूसरे स्थान पर रहा, और हमारा शुरुआती आकलन संक्षिप्त, सुव्यवस्थित गद्य है जिसमें अपने काम को वापस सौंपने से पहले ऑडिट करने की उपयोगी आदत है। यह अभी भी नया है, इसलिए हम इसे लंबे, बिना निगरानी वाले कामों से पहले पर्यवेक्षित दैनिक कार्यों पर शुरू करेंगे।
Kimi K2.6 एक ओपन-मॉडल की कीमत पर गहन शोध है। यह समानांतर में खोज चलाता है और फ्लैगशिप दरें वसूले बिना सबूतों को एक ही उत्तर में वापस खींचता है, जो इसे एक मजबूत रिसर्च विशेषज्ञ बनाता है। इसकी एकमात्र वास्तविक सीमा दस्तावेज़ का आकार है, जिसका कॉन्टेक्स्ट विंडो अधिकतम 256,000 टोकन है।
GLM 5.2 वैल्यू पिक है। यह नियमित रिसर्च, ड्राफ्टिंग और लंबे-दस्तावेज़ के काम पर बंद मिडिलवेट्स के आश्चर्यजनक रूप से करीब आया, जो लगभग एक तिहाई कीमत पर था, और इसका गद्य Sonnet और Opus के बाहर सबसे मजबूत है। यह Hyperagent टीम के कई लोगों के लिए दैनिक ड्राइवर बन गया है।
Qwen 3.7 Plus स्क्रीन वर्कर है। यह रेंडर किए गए पेजों पर बटन, फ़ील्ड और मेनू खोजने में विशेष रूप से अच्छा है, और संरचित निष्कर्षण के लिए सस्ता है - इसने हमारी बैटरी में सबसे कम लागत वाला पूर्ण रन तैयार किया। जब काम किसी इंटरफ़ेस के साथ काम करना या डेटा स्थानांतरित करना हो, तब इसका उपयोग करें, न कि जब स्वर मायने रखता हो।
DeepSeek V4 Pro बहुत कम लागत पर संरचित विश्लेषण है। यह समाधान, डेटा क्लीनअप, शेड्यूल्ड नंबर वर्क और इसी तरह के संरचित कार्यों में सबसे मजबूत है। इसका लेखन शाब्दिक और संक्षिप्त है, जो आंतरिक स्पष्टीकरण के लिए अच्छा है और क्लाइंट-फेसिंग गद्य के लिए खराब है। एक विशेषज्ञ, और बहुत किफायती।
अपने हमेशा-चालू एजेंटों को सही कीमत पर स्टाफ करना
स्टीव जुबा एक छह-व्यक्ति वाली ट्रैवल कंपनी चलाते हैं। उन्होंने आठ लाइव डेटा स्रोतों से जुड़ा एक ब्रीफिंग एजेंट बनाया जो दिन में कई बार चलता है, और इसने उनके सुबह के संदर्भ-संग्रह के समय को आठ टैब में तीन घंटे से अधिक से घटाकर पंद्रह मिनट कर दिया।
इस तरह का एक एजेंट लिखने से कहीं अधिक पढ़ता है और साल में सैकड़ों बार एक ही काम करता है, इसलिए प्रति-रन कीमत में एक छोटा सा अंतर भी एक गोलाकार त्रुटि नहीं रह जाता बल्कि एक वास्तविक बजट लाइन बन जाता है। एक ऐसी ब्रीफिंग पर विचार करें जो हर दिन 100,000 टोकन पढ़ती है और 2,000 लिखती है। जुलाई 2026 की सूची मूल्य पर, इस आकार का काम मोटे तौर पर चलेगा:
- Qwen 3.7 Plus (स्प्रिंटर) पर प्रति वर्ष $16
- Kimi K2.6 (मिडिलवेट) पर प्रति वर्ष $38
- Haiku 4.5 (स्प्रिंटर) पर प्रति वर्ष $40
- Sonnet 5 (मिडिलवेट) पर प्रति वर्ष $80

ओपन-वेट विकल्प इस तरह के रीड-हैवी काम के लिए गणित को बदल देते हैं। Kimi K2.6 इस काम पर $38 में मिडिलवेट-गुणवत्ता वाला रिसर्च और संश्लेषण करता है - जो Sonnet 5 के आधे से भी कम है, और लगभग Haiku स्प्रिंटर चलाने के बराबर है। आप निर्णय के लिए लागत का व्यापार नहीं कर रहे हैं; आप स्प्रिंटर पैसे पर मिडिलवेट का काम प्राप्त कर रहे हैं। यदि काम बिना किसी निर्णय के शुद्ध निष्कर्षण होता, तो Qwen इसे $16 में चलाता - लेकिन जैसे ही इसे वास्तविक संश्लेषण की आवश्यकता होती है, Kimi आपको वह लगभग उसी कीमत पर देता है।
मॉडल बदलें, एजेंट रखें
इनमें से कुछ भी मायने नहीं रखता अगर मॉडल बदलने का मतलब एजेंट को फिर से बनाना है। Hyperagent के अंदर ऐसा नहीं है, क्योंकि मॉडल सिर्फ एक सेटिंग है और भूमिका उसके ऊपर होती है। मॉडल बदलें और एजेंट वह सब कुछ बनाए रखता है जो इसे उपयोगी बनाता है:
- इसके निर्देश और दायरा
- इसके कौशल, स्क्रिप्ट और कार्य प्रक्रियाएँ
- सुधारों की इसकी स्मृति
- इसकी संदर्भ फ़ाइलें और कंपनी संदर्भ
- उन प्रणालियों से इसके कनेक्शन जहाँ काम रहता है
- गुणवत्ता के मूल्यांकन के लिए इसके रूब्रिक

यह मॉडल चुनाव को एक प्रवासन के बजाय एक परीक्षण में बदल देता है। वही एजेंट बिना पुनर्निर्माण के दो मॉडलों पर एक ही काम चला सकता है, ताकि आप अनुमान लगाने के बजाय सबसे सस्ता मॉडल ढूँढ सकें जो आपके मानक को पूरा करता है।
यह एक कठिन वर्कफ़्लो के महंगे हिस्से को एक बार में अपने लिए भुगतान करने की भी अनुमति देता है। जब किसी काम को वास्तव में इसकी आवश्यकता होती है, तो वर्कफ़्लो को डिज़ाइन और डीबग करने के लिए एक भारी मॉडल का उपयोग करें - फिर प्रक्रिया को एक कौशल के रूप में संहिताबद्ध करें ताकि एक मिडिलवेट या स्प्रिंटर इसे लागत के एक अंश पर हर दिन चला सके।
हालाँकि, देखने के लिए एक छिपी हुई लागत है। कम बिल वाला एक सस्ता मॉडल सस्ता नहीं है अगर हर आउटपुट को सुधारने की आवश्यकता है - मानव समीक्षा समय और गलती की लागत वास्तविक कीमत का हिस्सा हैं। इसे समीक्षा कर कहें। यह इस बात की निचली सीमा निर्धारित करता है कि आप कितना हल्का जा सकते हैं। Hyperagent में जो अलग है वह यह है कि समीक्षा का भुगतान ही नहीं होता, बल्कि यह संयोजित होता है: जैसे-जैसे एजेंट आपके सुधारों से स्मृति के माध्यम से सीखता है, वह समीक्षा प्रयास हार्नेस द्वारा कैप्चर किया जाता है और अगले रन पर एक बेहतर एजेंट का उत्पादन करता है।
ग्राहक पहले से ही इस तरह से एजेंटों को स्टाफ करते हैं। अंकित दास ने एक मार्केटिंग ऑपरेशन बनाया जिसमें Sonnet 5 पर एक ग्रोथ ऑर्केस्ट्रेटर निर्णय लेने वाली कॉल्स करता था और GLM 5.2 पर आठ चैनल विशेषज्ञ आवर्ती चैनल कार्य का उत्पादन करते थे, ब्रांड अनुपालन और लेखन गुणवत्ता की जाँच के लिए अलग QA एजेंटों के साथ - सब कुछ एक ही थ्रेड से शुरू होता था। एली वीस अपने विभाजन को अधिक सरलता से बताते हैं: अपने कौशल और दिनचर्या में लगभग 85% Sonnet और 15% Opus। अधिकांश काम दैनिक ड्राइवर पर चलता है; Opus को कामों का छोटा सेट मिलता है जहाँ अतिरिक्त निर्णय अपनी लागत कमाता है।
Hyperagent के अंदर मॉडल चुनाव का यही व्यावहारिक मूल्य है। काम के अनुसार जानबूझकर खर्च करें, और अतिरिक्त डॉलर उन कामों के लिए बचाकर रखें जहाँ अतिरिक्त निर्णय परिणाम को बदल देता है।
काम चुनने के बाद मॉडल चुनें
इस अनुक्रम का उपयोग उस एजेंट पर करें जिसे आप पहले से चला रहे हैं:
- काम का नाम बताएँ। "सोमवार की क्लाइंट रिपोर्ट तैयार करना" "रिपोर्टिंग में मदद करना" से अधिक उपयोगी है।
- इसे नक्शे पर रखें। तय करें कि इसे कितने निर्णय की आवश्यकता है और यह कितनी बार चलेगा।
- वहाँ से शुरू करें जहाँ नक्शा इसे रखता है। अधिकांश कामों के लिए यह एक सक्षम मिडिलवेट है - इसका उपयोग तब तक करें जब तक आप काम के एज केस को न समझ लें और प्रक्रिया को कौशल में संहिताबद्ध न कर लें।
- पाँच वास्तविक रनों के लिए एक क्लास हल्का परीक्षण करें। निर्देश, कौशल, स्मृति, स्रोत और रूब्रिक को अपरिवर्तित रखें।
- पूरी लागत की तुलना करें। तैयार गुणवत्ता, स्थिरता, समय, तथ्यात्मक चूक, मॉडल बिल और मानव समीक्षा समय को ट्रैक करें।
- जानबूझकर एस्केलेट करें। एक हैवीवेट लाएँ जब समीक्षा का बोझ या गलत जवाब की लागत मॉडल प्रीमियम से अधिक हो।
- महत्वपूर्ण काम की समीक्षा करने के लिए एक अलग मॉडल का उपयोग करें। जिस मॉडल ने गलती की है, वह अक्सर उसे देखने की सबसे कम संभावना रखता है।
सबसे सस्ता मॉडल रखें जो आपके मानक को विश्वसनीय रूप से पूरा करता हो। फिर अंतर को उन कॉल्स पर खर्च करें जो इसके लायक हैं।





