Claude Code ने अपने सिस्टम प्रॉम्प्ट को 80% कम किया। क्या यह छोटे मॉडल्स के लिए भी काम करता है?

@antigma_labs
अंग्रेज़ी2 दिन पहले · 26 जुल॰ 2026
230K
15
2
0
2

TL;DR

DeepSeek V4 Flash पर प्रॉम्प्ट रिडक्शन का परीक्षण यह दर्शाता है कि छोटे मॉडल्स को हमेशा बहुत अधिक मार्गदर्शन की आवश्यकता नहीं होती है, और वे बहुत छोटे प्रॉम्प्ट्स के साथ भी समान प्रदर्शन प्राप्त कर सकते हैं।

Anthropic ने हाल ही में अपने नवीनतम मॉडलों के लिए Claude Code के सिस्टम प्रॉम्प्ट का लगभग 80% हटा दिया

तर्क सहज है: जैसे-जैसे मॉडल स्मार्ट होते जाते हैं, उन्हें कम दिशा-निर्देश, कम बाधाओं और कम उदाहरणों की आवश्यकता होती है। एक निश्चित क्षमता स्तर के बाद, उदाहरण मदद करना बंद कर देते हैं और मॉडल को सीमित करने लगते हैं।

हमारा मानना है कि Anthropic का निर्णय डेटा द्वारा समर्थित है—लेकिन यह सबूत केवल इसके नवीनतम मॉडलों पर लागू होता है।

स्पष्ट अगला प्रश्न यह है: क्या यह Deep Seek v4 जैसे सामान्य, लोकप्रिय वर्कहॉर्स मॉडल पर काम करता है?

छोटे, तेज़, सस्ते मॉडल बिल्कुल वही हैं जिनसे आप विस्तृत मार्गदर्शन पर निर्भर रहने की उम्मीद करेंगे। उनके प्रॉम्प्ट को आधा कर दें, और पारंपरिक ज्ञान कहता है कि वे बेकार हो जाएंगे।

हमने प्रयोग किया ताकि आपको न करना पड़े।

सेटअप

हमारे कोडिंग एजेंट, Ante, में --short-prompt मोड शामिल है।

यह सिस्टम प्रॉम्प्ट को लगभग 5,000 से घटाकर 2,300 वर्ण कर देता है और टूल विवरण को छोटा कर देता है। साथ में, ये परिवर्तन प्रति-अनुरोध पूर्ण प्रॉम्प्ट को लगभग 34,000 से घटाकर 18,000 वर्ण कर देते हैं।

हमने दो संस्करणों का A/B परीक्षण किया:

  • कार्य: Terminal-Bench 2.1 पूर्ण 89-कार्य सूट
  • मॉडल: DeepSeek V4 Flash
  • प्रयास: प्रति कार्य एक
  • परिवर्तनीय चर: एक CLI फ़्लैग

बाकी सब कुछ स्थिर रहा: वही एजेंट बिल्ड, पिन किया गया डेटासेट डाइजेस्ट, सैंडबॉक्स पूल, प्रयास स्तर, और रनटाइम फ़्लैग।

परिणाम

Antigma - inline image

प्रदर्शन: समानता। शॉर्ट प्रॉम्प्ट ने वास्तव में +2.3 अंक अधिक स्कोर किए, लेकिन प्रति कार्य एक प्रयास के साथ, यह शोर सीमा के भीतर है।

इनपुट टोकन: समान-परिणाम उपसमूह में 32% कम।

बीस कार्यों ने रनों के बीच पास/फेल परिणाम बदल दिया, जिसने यह भी बदल दिया कि उन एजेंटों ने कितने समय तक काम किया और उनकी टोकन गणना को तुलना के लिए अनुपयुक्त बना दिया। हम उन 20 कार्यों को बाहर करते हैं, जिनके परिणाम समान रहे 69 कार्यों को छोड़ते हैं, फिर दो स्वतंत्र माध्यिकाओं की तुलना करते हैं: लंबे प्रॉम्प्ट के साथ 509,498 इनपुट टोकन बनाम शॉर्ट प्रॉम्प्ट के साथ 346,409 इनपुट टोकन। यह 32% कम है। यह एक जानबूझकर चुना गया उपसमूह है, पूरे सूट की लागत का अनुमान नहीं।

Antigma - inline image

सभी 89 कार्यों में कुल इनपुट टोकन योग लगभग समान हैं, और इसके बारे में ईमानदार होना उचित है: वार्तालाप इतिहास इनपुट उपयोग पर हावी है, और कुछ कार्य जहां शॉर्ट-प्रॉम्प्ट रन ने लंबा समाधान पथ अपनाया, वे योग में प्रति-अनुरोध बचत को कम कर देते हैं। रन लागत भी केवल मामूली रूप से बदली,4.25से4.25से4.18 तक।

हमने क्या देखा और क्या नहीं पाया: एक क्षमता की चट्टान। बीस कार्यों ने रनों के बीच परिणाम बदल दिए — 11 नए पास, 9 नए फेल — लेकिन यह उथल-पुथल इस बेंचमार्क पर एकल-प्रयास भिन्नता की विशेषता है, कोई पैटर्न नहीं। किसी कार्य श्रेणी का पतन नहीं हुआ।

यह प्रयोग क्या साबित नहीं करता

यह था:

  • एक मॉडल
  • एक बेंचमार्क
  • प्रति कार्य एक प्रयास

32% टोकन परिणाम एक चयनित समान-परिणाम उपसमूह से आता है। रनों के बीच कार्य उथल-पुथल की मात्रा भी यह दर्शाती है कि बहु-प्रयास सत्यापन क्यों मायने रखता है।

लगभग ±5 प्रतिशत अंकों की अनुमानित शोर सीमा के साथ, इन परिणामों में एक छोटी सी गिरावट अभी भी छिपी हो सकती है। हम सभी के लिए डिफ़ॉल्ट बदलने से पहले एक बहु-प्रयास मूल्यांकन चलाएंगे।

निष्कर्ष

इस मॉडल के लिए, इस बेंचमार्क पर, हमने प्रॉम्प्ट को लगभग आधा काट दिया और इससे बुरा कुछ नहीं मापा।

जिन 69 कार्यों का परिणाम समान रहा, उनमें शॉर्ट-प्रॉम्प्ट रन की माध्यिका इनपुट-टोकन गणना लगभग एक-तिहाई कम थी।

परिणाम उस दिशा से मेल खाता है जो Anthropic ने एक स्तर ऊपर देखा:

जब एक नई मॉडल पीढ़ी आती है, तो आपका पहला कदम प्रॉम्प्ट में जोड़ना नहीं होना चाहिए। यह हटाना होना चाहिए।

आपका कितना सिस्टम प्रॉम्प्ट अभी भी इसलिए मौजूद है क्योंकि दो पीढ़ी पहले के एक मॉडल को इसकी आवश्यकता थी?

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें