कहीं न कहीं अभी इस समय कोई डेवलपर AI के लिए $200 प्रति माह खर्च कर रहा है और उसने कभी हिसाब नहीं लगाया है। ChatGPT Plus। Claude Pro। Cursor। API की लागतें जो हर महीने चुपचाप बढ़ती रहती हैं। यह हमेशा के लिए नवीनीकृत होता रहता है, और हमेशा एक ऐसी चीज़ को किराए पर लेने का लंबा समय है जिसे आप खरीद सकते हैं।
इसके बारे में सोचने का एक और तरीका है। एक बॉक्स जो आपके घर में रहता है, AI को स्थानीय रूप से चलाता है, बिजली पर कुछ डॉलर प्रति माह खर्च करता है, आपका डेटा आपकी अपनी मशीन पर रखता है, और कभी भी किसी और के सर्वर पर एक भी बाइट नहीं भेजता है।
2026 में स्थानीय AI वह दयनीय समझौता नहीं है जो दो साल पहले था। बेहतर क्वांटाइज़ेशन, अधिक कुशल मॉडल आर्किटेक्चर, और यूनिफाइड-मेमोरी चिप्स का मतलब है कि आपकी मेज पर एक मशीन अब शायद 80% दैनिक AI काम संभाल लेती है: लेखन, कोडिंग सहायता, दस्तावेज़ विश्लेषण, सारांशीकरण, वर्गीकरण, ऑटोमेशन, आपकी अपनी फ़ाइलों पर सवालों के जवाब देना। शेष 20%, उन्नत तर्क और अत्याधुनिक कोडिंग, अभी भी क्लाउड का है। लेकिन वह 20% $200 के बिल को उचित नहीं ठहराता है जब एक बार का बॉक्स बाकी सब कवर करता है।
यह सीढ़ी है। दस पायदान, उस मशीन से जो आपके पास पहले से है, एक डेस्कटॉप सुपरकंप्यूटर तक, और प्रत्येक चरण पर ईमानदार ट्रेड-ऑफ।
एक विचार जो सब कुछ बदल देता है
आप गति नहीं खरीद रहे हैं। आप मेमोरी खरीद रहे हैं।
हर "यह नहीं चलेगा" कहानी उसी दीवार पर वापस जाती है: एक मॉडल जो बॉक्स की मेमोरी में फिट नहीं हुआ। एक मॉडल या तो लोड होता है या नहीं होता है। गति केवल यह तय करती है कि चलने पर यह कैसा लगता है; मेमोरी तय करती है कि यह बिल्कुल चलता है या नहीं।
तो पूरी सीढ़ी वास्तव में एक मेमोरी सीढ़ी है। 8GB एक 7B मॉडल चलाता है। 24GB एक 32B मॉडल को आराम से चलाता है। 128GB एक 70B मॉडल चलाता है और वास्तव में बड़े मॉडलों के साथ प्रयोग करना शुरू करता है। नीचे दिए गए प्रत्येक पायदान को इसी नज़रिए से पढ़ें, और पैटर्न पर ध्यान दें: जो बॉक्स सबसे दूर तक फैलते हैं वे यूनिफाइड मेमोरी वाले होते हैं, जहां CPU और GPU एक बड़े पूल को साझा करते हैं, न कि VRAM के एक छोटे से अलग किए गए हिस्से के लिए लड़ते हैं।
स्पेक्स से पहले एक चेतावनी, जो पूरी सूची पर लागू होती है: वैश्विक DRAM की कमी 2026 तक मेमोरी की कीमतों को नीचे नहीं, बल्कि ऊपर धकेल रही है। यहां हर संख्या अनुमानित है और ऊपर की ओर बढ़ रही है, जो उस बॉक्स को खरीदने का तर्क है जिसका आप वास्तव में उपयोग करेंगे, न कि उस गिरावट की प्रतीक्षा करने का जो शायद न आए।
सीढ़ी
पायदान 1. वह मशीन जो आपके पास पहले से है ($0)
कुछ भी खर्च करने से पहले, अपनी मेज पर पहले से मौजूद चीज़ पर कार्यप्रवाह साबित करें। 8GB RAM वाला कोई भी लैपटॉप Ollama के माध्यम से एक 7B मॉडल चलाता है। यह तेज़ नहीं होगा, लेकिन यह केवल उसी सवाल का जवाब देता है जो मायने रखता है: क्या स्थानीय AI आप जो वास्तव में करते हैं उसके लिए पर्याप्त है? कहीं और एक डॉलर खर्च करने से पहले यहां एक सप्ताहांत बिताएं।

पायदान 2. Raspberry Pi 5, 16GB (लगभग $120)
शौकिया का पायदान। 16GB वाला Pi 5 Ollama के माध्यम से 1B से 3B मॉडल चलाएगा, धीरे-धीरे। यह एक दैनिक उपयोग की मशीन नहीं है, यह एक अवधारणा का प्रमाण है जिसे आप एक दराज में चालू छोड़ सकते हैं: एक छोटा हमेशा-चालू सहायक, एक होम-ऑटोमेशन मस्तिष्क, एक सप्ताहांत परियोजना। सीखने के लिए खरीदें, काम करने के लिए नहीं।

पायदान 3. NVIDIA Jetson Orin Nano Super ($249)
सबसे सस्ता गंभीर प्रवेश बिंदु। एक बटुए से छोटे बॉक्स में एक वास्तविक NVIDIA GPU।
1AI प्रदर्शन: 67 TOPS2GPU: 1024-कोर Ampere3RAM: 8GB LPDDR5 (साझा)4शक्ति: 7-25W5अच्छी तरह चलता है: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B
67 TOPS एक 7B मॉडल को निजी रूप से और हमेशा के लिए चलाता है। 7B वर्ग इतना तेज़ है कि तत्काल लगता है और अधिकांश दैनिक कार्यों के लिए पर्याप्त है। यह 7B से ऊपर कुछ भी या कोई लंबा संदर्भ नहीं छूएगा जो 8GB को ओवररन करता है, लेकिन प्रति माह $100 की सदस्यता पर यह दस सप्ताह में अपने लिए भुगतान करता है।

पायदान 4. Apple Mac mini M4 ($599 से)
डिफ़ॉल्ट शांत होम AI सर्वर, यूनिफाइड मेमोरी के कारण। एक सामान्य PC पर GPU का VRAM एक कठोर दीवार है। Apple CPU और GPU के बीच मेमोरी साझा करता है, इसलिए Mac mini अपने स्पेक शीट से बड़ा चलता है, लगभग शांत रहता है, और बहुत कम बिजली की खपत करता है।
1चिप: Apple M42यूनिफाइड मेमोरी: 16-32GB (साझा CPU + GPU)3शक्ति: 10-30W लोड के तहत424/7 बिजली लागत: लगभग $3-8/माह5अच्छी तरह चलता है: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium
यह वह सब कुछ करता है जो Jetson करता है साथ ही बड़े मॉडल, लंबा संदर्भ, और एक साथ कई सेवाएं। यह वह बॉक्स है जिसे लोग अपने ऑटोमेशन के बैकएंड के रूप में चौबीसों घंटे चालू छोड़ते हैं। $599 आधार है, हालांकि, और Apple मेमोरी के लिए कठोरता से शुल्क लेता है। स्थानीय AI के लिए मेमोरी ही मुख्य बिंदु है, इसलिए उस कॉन्फ़िगरेशन की कीमत लगाएं जिसकी आपको वास्तव में आवश्यकता है, न कि स्टीकर की कीमत।

पायदान 5. प्रयुक्त RTX 3090, 24GB (कार्ड के लिए लगभग $700)
वह मूल्य किंवदंती जो मरने से इनकार करती है। छह साल पुराना और अभी भी उपभोक्ता बाजार पर सबसे अच्छा VRAM-प्रति-डॉलर। एक प्रयुक्त 3090 आपको लगभग $700 में 24GB तेज़ मेमोरी देता है, जो वास्तविक थ्रूपुट के साथ 24B से 32B मॉडल चलाने के लिए पर्याप्त है, पूर्ण CUDA समर्थन के साथ ताकि हर उपकरण तुरंत काम करे।
1VRAM: 24GB GDDR6X2बैंडविड्थ: ~936 GB/s3प्रयुक्त मूल्य: ~$600-800 (केवल कार्ड)4अच्छी तरह चलता है: Qwen 32B, Llama 3.1 8B-70B (क्वांटाइज़्ड), अधिकांश 32B-वर्ग
ईमानदार तारांकन: एक GPU एक कंप्यूटर नहीं है। आपको इसके चारों ओर एक होस्ट PC की आवश्यकता है, इसलिए बाकी मशीन के लिए अतिरिक्त $400 से $600 का बजट रखें। लेकिन अगर आपके पास पहले से एक डेस्कटॉप है जिसमें एक अतिरिक्त स्लॉट और पर्याप्त बड़ी बिजली आपूर्ति है, तो इस सीढ़ी पर और कुछ भी आपको इतना सस्ता 24GB नहीं देता है।

पायदान 6. AMD Radeon RX 7900 XTX, 24GB (कार्ड के लिए लगभग $900)
3090 के समान 24GB, नया, वारंटी के साथ, और AMD का सॉफ़्टवेयर आखिरकार पकड़ में आ गया है। ROCm 7.x पर 7900 XTX Llama 3.1 8B को लगभग 96 टोकन प्रति सेकंड पर चलाता है, जो RTX 4090 के लगभग तीन-चौथाई है, इसकी कीमत के एक अंश पर। नए हार्डवेयर पर शुद्ध VRAM-प्रति-डॉलर के लिए, उपभोक्ता स्तर पर NVIDIA का कुछ भी इसके पास नहीं आता है।
1VRAM: 24GB GDDR62सॉफ़्टवेयर: ROCm 7.x (प्रथम श्रेणी समर्थन)3नया मूल्य: ~$899-1,400 (केवल कार्ड)4अच्छी तरह चलता है: Llama 3.1 8B (~96 tok/s), 32B-वर्ग क्वांटाइज़्ड
पकड़ वही है जो AMD का हर जगह पीछा करती है: ROCm ने CUDA के साथ अधिकांश अंतर को बंद कर दिया है, लेकिन कुछ उपकरण अभी भी डिफ़ॉल्ट रूप से NVIDIA मानते हैं। Ollama और Open WebUI के लिए यह आज अच्छी तरह से काम करता है। विदेशी फ़ाइन-ट्यूनिंग स्टैक के लिए, कुछ और मैन्युअल चरणों की अपेक्षा करें।

पायदान 7. AMD Ryzen AI Max+ 395 "Strix Halo," 128GB (लगभग $1,999)
2026 का स्वीट स्पॉट, और वह बॉक्स जिसे इनमें से अधिकांश सूचियाँ भूल जाती हैं। AMD का Strix Halo चिप एक 16-कोर Zen 5 CPU को एक बड़े RDNA 3.5 iGPU और एक छोटे बॉक्स में 128GB तक यूनिफाइड मेमोरी के साथ जोड़ता है, लगभग उस कीमत पर जो एक NVIDIA डेस्कटॉप की है जिसमें एक चौथाई मेमोरी है।
1चिप: Ryzen AI Max+ 395 (16-कोर Zen 5)2GPU: Radeon 8060S (40-कोर RDNA 3.5)3NPU: XDNA 2, 50 TOPS (~126 TOPS सिस्टम-व्यापी)4यूनिफाइड मेमोरी: 128GB LPDDR5X तक (~96GB VRAM के रूप में उपयोग करने योग्य)5मूल्य: ~$1,999 128GB / 2TB के लिए6अच्छी तरह चलता है: Llama 3.3 70B, Mixtral, अधिकांश 70B-वर्ग मॉडल
आप इसे दो तरह से खरीदते हैं। GMKtec EVO-X2 लगभग $1,999 में एक तैयार 128GB मिनी PC है। Framework Desktop एक मरम्मत योग्य, उन्नयन योग्य चेसिस में वही चिप है, जो बोर्ड के लिए $1,999 से शुरू होता है और पूरी तरह से निर्मित होने पर लगभग $2,850 है। किसी भी तरह से आप एक 70B मॉडल को संवादी गति पर लोड करते हैं, जो इस पायदान से नीचे कुछ भी नहीं कर सकता है। ROCm परिपक्वता ट्रेड-ऑफ है, पायदान 6 के समान।

पायदान 8. NVIDIA RTX 5090, 32GB (कार्ड के लिए लगभग $3,000)
एक सामान्य व्यक्ति एक सामान्य टॉवर में सबसे तेज़ चीज़ रख सकता है। 32GB सबसे तेज़ उपभोक्ता मेमोरी से बना, और कच्ची गति जो इसके नीचे की हर चीज़ को पीछे छोड़ देती है। यह उन लोगों के लिए पायदान है जो फ्रंटियर-क्लास स्थानीय अनुमान और कभी-कभी प्रशिक्षण चाहते हैं, और जो डॉलर प्रति गीगाबाइट से अधिक टोकन प्रति सेकंड की परवाह करते हैं।
1VRAM: 32GB GDDR72नया मूल्य: ~$3,000+ (केवल कार्ड)3अच्छी तरह चलता है: 32B गति से, 70B क्वांटाइज़्ड, छवि और वीडियो मॉडल
हालांकि, गणित क्रूर है। इसकी कीमत एक प्रयुक्त 3090 से तीन से चार गुना अधिक है, केवल 8GB अधिक मेमोरी के लिए, साथ ही शीर्ष पर एक होस्ट PC। इसे खरीदें क्योंकि आपको गति और अतिरिक्त हेडरूम की आवश्यकता है, इसलिए नहीं कि यह कुशल है। यह नहीं है।

पायदान 9. Apple Mac Studio M3 Ultra, 96GB ($3,999 से)
बड़ा, शांत, यूनिफाइड-मेमोरी वर्कस्टेशन। Mac Studio 96GB तक CPU और GPU में Metal त्वरण के साथ पूल करता है, बड़े मॉडलों को लगभग चुपचाप चलाता है, और इसे एक बॉक्स में करता है जो एक मेज पर जेट-इंजन पंखे के वक्र के बिना फिट बैठता है।
1चिप: M3 Ultra (32-कोर CPU / 80-कोर GPU तक)2यूनिफाइड मेमोरी: 96GB तक3मूल्य: $3,999 से4अच्छी तरह चलता है: 70B-वर्ग मॉडल, लंबा संदर्भ, कई सेवाएं
ईमानदारी से जानने लायक: Apple ने 2026 की शुरुआत में 512GB कॉन्फ़िगरेशन को वापस ले लिया क्योंकि DRAM की कमी ने काट लिया, इसलिए 96GB अब छत है जहां यह पहले बहुत अधिक तक पहुंचता था। फिर भी, एक शांत पूरे दिन की मशीन के लिए जो बड़े मॉडल चलाती है और आपके वास्तविक कंप्यूटर के रूप में दोगुनी है, कुछ चीजें इसके साथ रहने में उतनी ही सुखद हैं।

पायदान 10. NVIDIA DGX Spark, 128GB ($3,999 से $4,699)
डेस्कटॉप जो सोचता है कि यह एक डेटासेंटर है। ओपन मॉडल को फ़ाइन-ट्यून करने, 70B-प्लस सहायकों की मेजबानी करने, और अनुमान पाइपलाइनों को चलाने के लिए जिन्हें वास्तविक थ्रूपुट की आवश्यकता है।
1चिप: GB10 Grace Blackwell2AI थ्रूपुट: 1 PFLOP3यूनिफाइड मेमोरी: 128GB LPDDR5x4स्टोरेज: 4TB Gen5 NVMe5शक्ति: 150-240W लोड के तहत6सबसे अच्छा: 70B-200B मॉडल, फ़ाइन-ट्यूनिंग, प्रोडक्शन इन्फ़रेंस
128GB यूनिफाइड मेमोरी ऐसे मॉडल लोड करती है जिन्हें एक उपभोक्ता GPU खोल भी नहीं सकता, और दो इकाइयां जुड़ी हुई 400B क्षेत्र में पहुंचती हैं। मूल्य ईमानदारी: यह अक्टूबर 2025 में $3,999 पर लॉन्च हुआ और तब से मेमोरी की कमी के कारण लगभग $4,699 तक बढ़ा दिया गया है (Tom's Hardware)। पायदान 7 पर Strix Halo बॉक्स के बगल में, समान 128GB के लिए इसकी कीमत लगभग दोगुनी है। आप CUDA परिपक्वता और थ्रूपुट के लिए भुगतान कर रहे हैं, अधिक मेमोरी के लिए नहीं।

ईमानदार गणित
1विशिष्ट मासिक AI खर्च:2ChatGPT Plus $203Claude Pro $204Cursor Pro $205API लागतें $50-2006कुल $110-260 / माह78स्थानीय AI मासिक:9हार्डवेयर $0 (पहले से खरीदा हुआ)10बिजली $2-1511API $012कुल $2-15 / माह
प्रति माह $100 की सदस्यता पर, एक $249 का Jetson दस सप्ताह में अपने लिए भुगतान करता है, एक $599 का Mac mini छह महीने में, एक प्रयुक्त 3090 बिल्ड एक वर्ष से भी कम में, एक $2,000 का Strix Halo बॉक्स लगभग अठारह महीनों में, और $4,000-प्लस पायदान केवल तभी यदि आप पहले से ही क्लाउड-GPU किराये पर चार अंकों की राशि प्रति माह जला रहे थे।
अब वह हिस्सा जिसे प्रचार हमेशा छोड़ देता है। बॉक्स एक डूबी हुई लागत है, और यह केवल "भुगतान करता है" यदि आप वास्तव में सदस्यता का भुगतान करते रहते। $20 प्रति माह बचाने के लिए $2,000 की मशीन खरीदना सदस्यता की तुलना में एक बुरा सौदा है, बेहतर नहीं। सही पायदान वह है जो आपके वास्तविक उपयोग से मेल खाता है, न कि इसके काल्पनिक संस्करण से।
आपका पायदान कौन सा है
हल्का दैनिक उपयोग और जिज्ञासा: पायदान 1 से शुरू करें, फिर Jetson खरीदें। एक घर या छोटे व्यवसाय के लिए एक शांत हमेशा-चालू सहायक: Mac mini। वास्तविक 24GB और 32B मॉडल का सबसे सस्ता रास्ता: एक प्रयुक्त 3090, या RX 7900 XTX यदि आप नया वारंटी के साथ चाहते हैं और ROCm से कोई आपत्ति नहीं है। डेटासेंटर पैसे के बिना सबसे अच्छा 70B अनुभव: Strix Halo बॉक्स। अधिकतम उपभोक्ता गति: RTX 5090। एक शांत बड़ी-मेमोरी वर्कस्टेशन जिसमें आप भी रहते हैं: Mac Studio। फ़ाइन-ट्यूनिंग और प्रोडक्शन पाइपलाइन: DGX Spark।
वह सेटअप जो एक दोपहर लेता है
प्रक्रिया हर पायदान पर समान है।
1. Ollama स्थापित करें। ओपन सोर्स, किसी भी मॉडल को एक स्थानीय API में बदल देता है जो OpenAI की भाषा बोलता है।
1curl -fsSL https://ollama.com/install.sh | sh
2. एक मॉडल खींचें जो आपके बॉक्स की मेमोरी के आकार का हो।
1# 8GB Jetson या 16GB Mac mini:2ollama pull llama3.234# 24GB 3090 / 7900 XTX:5ollama pull qwen2.5:32b67# 128GB Strix Halo / DGX Spark:8ollama pull llama3.3:70b
3. एक पंक्ति बदलें अपने पहले से मौजूद कोड में।
1# पहले, प्रति अनुरोध भुगतान:2client = OpenAI(api_key="sk-...")34# बाद में, स्थानीय और मुफ़्त:5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
आपका कोड वही चलता है। कुछ भी मशीन नहीं छोड़ता, कुछ भी प्रति अनुरोध पैसे नहीं खर्च करता है।
4. (वैकल्पिक) Open WebUI के साथ एक ब्राउज़र इंटरफ़ेस जोड़ें, और आपके पास localhost:3000 पर एक निजी ChatGPT है।
1docker run -d -p 3000:8080 \2 --add-host=host.docker.internal:host-gateway \3 -v open-webui:/app/backend/data \4 ghcr.io/open-webui/open-webui:main
इस पर वास्तव में क्या चलाएं
हार्डवेयर निर्णय का आधा हिस्सा है। मॉडल दूसरा आधा है। 2026 के लिए एक मोटा नक्शा:
छोटा और तेज़ (8-16GB में फिट बैठता है): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B। ड्राफ्टिंग, वर्गीकरण और आपके अपने नोट्स पर Q&A के लिए बढ़िया। कार्यशील घोड़ा स्तर (24GB में फिट बैठता है): Qwen 2.5 32B और क्वांटाइज़्ड Llama, वास्तविक कोडिंग सहायता और दस्तावेज़ कार्य के लिए काफी मजबूत। भारी स्तर (64-128GB की आवश्यकता है): Llama 3.3 70B और बड़े Qwen और Mixtral वेरिएंट, जहां स्थानीय आउटपुट रोजमर्रा के कार्यों के लिए क्लाउड मॉडल के करीब महसूस करने लगता है।
क्वांटाइज़ेशन इस सब के नीचे शांत लीवर है। 4-बिट क्वांट पर एक 70B मॉडल वहां फिट बैठता है जहां पूर्ण-सटीकता संस्करण कभी नहीं होगा, एक छोटी और आमतौर पर स्वीकार्य गुणवत्ता लागत पर। अधिकांश लोगों के लिए Q4 से Q6 उचित सीमा है। इससे नीचे, गुणवत्ता मेमोरी बचत के लायक होने से अधिक तेज़ी से गिरती है।
चलने के बाद आप क्या बनाते हैं
व्यक्तिगत उपयोग के लिए यह कुछ डॉलर प्रति माह में दैनिक चीजों को कवर करता है। दिलचस्प हिस्सा व्यावसायिक ऑटोमेशन है, जहां आप स्थानीय मॉडल को n8n से जोड़ते हैं, ओपन-सोर्स उपकरण जो इसे Telegram, ईमेल, कैलेंडर, CRM और सैकड़ों सेवाओं से जोड़ता है। इनमें से प्रत्येक आपकी इमारत से कुछ भी बाहर नहीं जाने और कोई प्रति-टोकन लागत नहीं होने के साथ चलता है:
1AI रिसेप्शनिस्ट:2क्लाइंट संदेश Telegram पर -> n8n प्राप्त करता है -> स्थानीय मॉडल इरादा पढ़ता है3-> कैलेंडर उपलब्धता की जाँच करता है -> बुकिंग की पुष्टि45दस्तावेज़ विश्लेषण:650 PDF ड्रॉप करें -> स्थानीय मॉडल उन सभी को पढ़ता है -> मुख्य तथ्य निकालता है7-> एक संरचित रिपोर्ट लिखता है89दैनिक ब्रीफ:10सुबह 7 बजे ट्रिगर -> मॉडल आपके नोट्स और कार्यों को पढ़ता है -> जो मायने रखता है उसका सारांश देता है11-> इसे आपके फ़ोन पर भेजता है1213लीड एनरिचमेंट:14शीट में नई पंक्ति -> मॉडल कंपनी पर रिसर्च करता है -> एक अनुकूलित परिचय तैयार करता है15-> इसे आपकी समीक्षा के लिए कतारबद्ध करता है1617सामग्री पुनर्उपयोग:18एक लंबी रिकॉर्डिंग -> मॉडल ट्रांसक्राइब करता है और इसे काटता है -> पोस्ट लिखता है19-> आपके अनुमोदन के लिए ड्राफ्ट सहेजता है2021इनबॉक्स ट्राइएज:22नया ईमेल -> मॉडल छाँटता है, लेबल करता है, और उत्तर का ड्राफ्ट तैयार करता है -> आप भेजें या संपादित करें दबाते हैं
गोपनीयता-संवेदनशील कार्य के लिए यह एक लागत निर्णय होना बंद कर देता है और एकमात्र निर्णय बन जाता है। कानूनी दस्तावेज़, चिकित्सा रिकॉर्ड, वित्तीय डेटा, NDA के तहत किसी भी चीज़ का किसी तीसरे पक्ष के API पर कोई काम नहीं है। स्थानीय AI इसे आपकी मशीन पर संसाधित करता है और यह कभी नहीं छोड़ता है।
वास्तव में क्या गलत होता है
20% वास्तविक है। फ्रंटियर मॉडल अभी भी कठिन तर्क, अत्याधुनिक कोडिंग और अनुसंधान पर जीतते हैं जहां एक सबसे अच्छा उत्तर मायने रखता है। स्थानीय AI अन्य 80% के लिए विश्वसनीय, निजी, हमेशा-चालू वर्कहॉर्स है, हर चीज़ का प्रतिस्थापन नहीं। कठिन 20% के लिए एक क्लाउड सब्सक्रिप्शन रखें और बाकी घर पर चलाएं, और आपके पास दोनों हैं।
मेमोरी छत है, TOPS नहीं। उस मॉडल आकार के लिए खरीदें जिसे आप चलाना चाहते हैं, और याद रखें कि यूनिफाइड-मेमोरी बॉक्स अलग VRAM वाले स्पेक-मैच PC की तुलना में आगे तक फैलते हैं।
एक GPU एक कंप्यूटर नहीं है। 3090, 7900 XTX, और 5090 पायदान सभी को उनके चारों ओर एक होस्ट मशीन की आवश्यकता होती है। कार्ड की कीमत सिस्टम की कीमत नहीं है, इसलिए एक तैयार मिनी PC के खिलाफ तुलना करने से पहले $400 से $600 जोड़ें।
कीमतें बढ़ रही हैं। DRAM की कमी ने पहले ही DGX Spark को 18% ऊपर धकेल दिया है और Apple को अपना 512GB Mac Studio वापस लेने के लिए मजबूर किया है। आज का अच्छा सौदा अगली तिमाही में अधिक खर्च कर सकता है।
AMD पैसे बचाता है और समय खर्च करता है। Strix Halo और 7900 XTX आपको प्रति डॉलर सबसे अधिक मेमोरी देते हैं, लेकिन ROCm टर्नकी टूलिंग पर CUDA से पीछे है। आज Ollama के लिए ठीक है, भारी प्रशिक्षण के लिए अधिक धैर्य की आवश्यकता है।
गर्मी, शोर और क्वांटाइज़ेशन छोटे प्रिंट हैं। बड़े GPU बिल्ड जोर से और गर्म होते हैं। आक्रामक क्वांटाइज़ेशन मेमोरी बचाता है लेकिन गुणवत्ता खाता है यदि आप इसे बहुत दूर धकेलते हैं। कोई भी डील-ब्रेकर नहीं है, लेकिन सेल्स पिच में कोई उनका उल्लेख नहीं करता है।
अब करने के लिए दो काम
पहले मुफ़्त में प्रयास करें। अपने पास पहले से मौजूद कंप्यूटर पर Ollama स्थापित करें और इस सप्ताहांत एक 7B मॉडल चलाएं। कोई भी 8GB मशीन यह करती है। हार्डवेयर पर एक पैसा खर्च करने से पहले कार्यप्रवाह साबित करें।
फिर अपनी वास्तविक ज़रूरतों से एक पायदान ऊपर खरीदें, पांच नहीं। जिन लोगों ने 2025 में चुपचाप स्थानीय AI स्थापित किया, वे 2027 तक वक्र से बहुत आगे दिखेंगे क्योंकि क्लाउड की कीमतें बढ़ती रहेंगी और स्थानीय हार्डवेयर बेहतर होता रहेगा। अधिकांश लोग आदत से बाहर $200 प्रति माह का भुगतान करते रहेंगे। कुछ इस सप्ताह एक दोपहर बिताएंगे और कभी किसी और के सर्वर पर एक और बाइट नहीं भेजेंगे।
मैं नियमित रूप से AI टूल्स और उनसे होने वाले पैसे को इस तरह से तोड़ता हूं। अगले के लिए फॉलो करें, और मेरे Telegram से जुड़ें: https://t.me/+lzSPoQ0svRU1ZWZi





