Anthropic ने हाल ही में अपने नवीनतम मॉडलों के लिए Claude Code के सिस्टम प्रॉम्प्ट का लगभग 80% हटा दिया।
तर्क सहज है: जैसे-जैसे मॉडल स्मार्ट होते जाते हैं, उन्हें कम दिशा-निर्देश, कम बाधाओं और कम उदाहरणों की आवश्यकता होती है। एक निश्चित क्षमता स्तर के बाद, उदाहरण मदद करना बंद कर देते हैं और मॉडल को सीमित करने लगते हैं।
हमारा मानना है कि Anthropic का निर्णय डेटा द्वारा समर्थित है—लेकिन यह सबूत केवल इसके नवीनतम मॉडलों पर लागू होता है।
स्पष्ट अगला प्रश्न यह है: क्या यह Deep Seek v4 जैसे सामान्य, लोकप्रिय वर्कहॉर्स मॉडल पर काम करता है?
छोटे, तेज़, सस्ते मॉडल बिल्कुल वही हैं जिनसे आप विस्तृत मार्गदर्शन पर निर्भर रहने की उम्मीद करेंगे। उनके प्रॉम्प्ट को आधा कर दें, और पारंपरिक ज्ञान कहता है कि वे बेकार हो जाएंगे।
हमने प्रयोग किया ताकि आपको न करना पड़े।
सेटअप
हमारे कोडिंग एजेंट, Ante, में --short-prompt मोड शामिल है।
यह सिस्टम प्रॉम्प्ट को लगभग 5,000 से घटाकर 2,300 वर्ण कर देता है और टूल विवरण को छोटा कर देता है। साथ में, ये परिवर्तन प्रति-अनुरोध पूर्ण प्रॉम्प्ट को लगभग 34,000 से घटाकर 18,000 वर्ण कर देते हैं।
हमने दो संस्करणों का A/B परीक्षण किया:
- कार्य: Terminal-Bench 2.1 पूर्ण 89-कार्य सूट
- मॉडल: DeepSeek V4 Flash
- प्रयास: प्रति कार्य एक
- परिवर्तनीय चर: एक CLI फ़्लैग
बाकी सब कुछ स्थिर रहा: वही एजेंट बिल्ड, पिन किया गया डेटासेट डाइजेस्ट, सैंडबॉक्स पूल, प्रयास स्तर, और रनटाइम फ़्लैग।
परिणाम

प्रदर्शन: समानता। शॉर्ट प्रॉम्प्ट ने वास्तव में +2.3 अंक अधिक स्कोर किए, लेकिन प्रति कार्य एक प्रयास के साथ, यह शोर सीमा के भीतर है।
इनपुट टोकन: समान-परिणाम उपसमूह में 32% कम।
बीस कार्यों ने रनों के बीच पास/फेल परिणाम बदल दिया, जिसने यह भी बदल दिया कि उन एजेंटों ने कितने समय तक काम किया और उनकी टोकन गणना को तुलना के लिए अनुपयुक्त बना दिया। हम उन 20 कार्यों को बाहर करते हैं, जिनके परिणाम समान रहे 69 कार्यों को छोड़ते हैं, फिर दो स्वतंत्र माध्यिकाओं की तुलना करते हैं: लंबे प्रॉम्प्ट के साथ 509,498 इनपुट टोकन बनाम शॉर्ट प्रॉम्प्ट के साथ 346,409 इनपुट टोकन। यह 32% कम है। यह एक जानबूझकर चुना गया उपसमूह है, पूरे सूट की लागत का अनुमान नहीं।

सभी 89 कार्यों में कुल इनपुट टोकन योग लगभग समान हैं, और इसके बारे में ईमानदार होना उचित है: वार्तालाप इतिहास इनपुट उपयोग पर हावी है, और कुछ कार्य जहां शॉर्ट-प्रॉम्प्ट रन ने लंबा समाधान पथ अपनाया, वे योग में प्रति-अनुरोध बचत को कम कर देते हैं। रन लागत भी केवल मामूली रूप से बदली,4.25से4.25से4.18 तक।
हमने क्या देखा और क्या नहीं पाया: एक क्षमता की चट्टान। बीस कार्यों ने रनों के बीच परिणाम बदल दिए — 11 नए पास, 9 नए फेल — लेकिन यह उथल-पुथल इस बेंचमार्क पर एकल-प्रयास भिन्नता की विशेषता है, कोई पैटर्न नहीं। किसी कार्य श्रेणी का पतन नहीं हुआ।
यह प्रयोग क्या साबित नहीं करता
यह था:
- एक मॉडल
- एक बेंचमार्क
- प्रति कार्य एक प्रयास
32% टोकन परिणाम एक चयनित समान-परिणाम उपसमूह से आता है। रनों के बीच कार्य उथल-पुथल की मात्रा भी यह दर्शाती है कि बहु-प्रयास सत्यापन क्यों मायने रखता है।
लगभग ±5 प्रतिशत अंकों की अनुमानित शोर सीमा के साथ, इन परिणामों में एक छोटी सी गिरावट अभी भी छिपी हो सकती है। हम सभी के लिए डिफ़ॉल्ट बदलने से पहले एक बहु-प्रयास मूल्यांकन चलाएंगे।
निष्कर्ष
इस मॉडल के लिए, इस बेंचमार्क पर, हमने प्रॉम्प्ट को लगभग आधा काट दिया और इससे बुरा कुछ नहीं मापा।
जिन 69 कार्यों का परिणाम समान रहा, उनमें शॉर्ट-प्रॉम्प्ट रन की माध्यिका इनपुट-टोकन गणना लगभग एक-तिहाई कम थी।
परिणाम उस दिशा से मेल खाता है जो Anthropic ने एक स्तर ऊपर देखा:
जब एक नई मॉडल पीढ़ी आती है, तो आपका पहला कदम प्रॉम्प्ट में जोड़ना नहीं होना चाहिए। यह हटाना होना चाहिए।
आपका कितना सिस्टम प्रॉम्प्ट अभी भी इसलिए मौजूद है क्योंकि दो पीढ़ी पहले के एक मॉडल को इसकी आवश्यकता थी?





