अभी कोई भी एक AI सिस्टम बना सकता है जो 18% बेहतर सटीकता और 85% कम लागत पर सामान्य RAG की तुलना में जटिल सवालों के जवाब देता है। न PhD चाहिए, न करोड़ों का बजट, न रिसर्चर्स की टीम।
आपको और उस रिजल्ट के बीच में सिर्फ एक कॉन्सेप्ट है जिसे Microsoft, Stanford और Anthropic ने स्वतंत्र रूप से खोजा है - और जिसे अभी भी ज़्यादातर डेवलपर्स नहीं समझ पाए हैं।
सामान्य RAG टेक्स्ट ढूंढता है। Graph Engineering रिलेशनशिप ढूंढता है। यह रहा इसके पीछे का पूरा सिस्टम।
इसे बुकमार्क करें और फॉलो करें
- मैं Sprytix हूँ, एक डेवलपर जो AI सिस्टम और ऑटोमेशन पाइपलाइन बनाता है जो टेक्नोलॉजी को असली कमाई में बदलती हैं। DMs खुले हैं।
सामान्य RAG की सीमा क्यों है
सामान्य RAG इस तरह काम करता है:
1सवाल2↓3मैचिंग टेक्स्ट के लिए डॉक्यूमेंट सर्च करें4↓5सबसे प्रासंगिक हिस्से वापस लाएं6↓7मॉडल हिस्सों से जवाब जनरेट करता है
यह सरल सवालों के लिए अच्छा काम करता है। जटिल सवालों पर यह पूरी तरह से फेल हो जाता है।
"मार्च में हमारे प्रोडक्ट की बिक्री क्यों गिर गई?" पूछें और RAG "सेल्स" और "मार्च" शब्दों वाले डॉक्यूमेंट ढूंढता है। यह टुकड़े ढूंढता है। यह कारण की श्रृंखला नहीं ढूंढता।
1RAG जवाब:2यहाँ 5 डॉक्यूमेंट हैं जिनमें मार्च में सेल्स का जिक्र है।34Graph Engineering जवाब:5बिक्री गिरी क्योंकि रिलीज़ में देरी हुई6जो एक सप्लायर डिपेंडेंसी की वजह से हुई7जो एक वेयरहाउस समस्या से ट्रिगर हुई8जिसने नेगेटिव रिव्यू जनरेट किए9जिसने कन्वर्ज़न को 23% तक कम कर दिया।
एक ही मॉडल। एक ही डेटा। पूरी तरह से अलग परिणाम - क्योंकि एक सिस्टम टेक्स्ट सर्च करता है और दूसरा रियलिटी सर्च करता है।
यह वही है जो Microsoft, Stanford और Anthropic ने स्वतंत्र रूप से खोजा। और यही कारण है कि तीनों ही Graph Engineering की ओर बढ़ गए।
डॉक्यूमेंट 1 - Microsoft GraphRAG

Microsoft ने GraphRAG बनाया और इसे ओपन-सोर्स कर दिया। उनकी रिसर्च के नतीजे सबसे ठोस आंकड़े हैं जो बताते हैं कि Graph Engineering सामान्य RAG की तुलना में वास्तव में क्या देता है।
यह आर्किटेक्चर अनस्ट्रक्चर्ड टेक्स्ट को पूरे नॉलेज ग्राफ में बदल देता है:
1डॉक्यूमेंट लोड करें2↓3डॉक्यूमेंट को चंक करें4↓5एंटिटी और रिलेशन निकालें6↓7ग्राफ बनाएं8↓9कम्युनिटी का पता लगाएं10↓11कम्युनिटी रिपोर्ट जनरेट करें12↓13एंटिटी और रिपोर्ट को एम्बेड करें14↓15लोकल सर्च / ग्लोबल सर्च
Microsoft ने मुख्य बात दस्तावेजित की: सामान्य RAG लोकल सवालों का अच्छा जवाब देता है - मुझे इस विशिष्ट एंटिटी के बारे में जानकारी ढूंढो। यह ग्लोबल सवालों पर फेल हो जाता है - इस पूरे डेटासेट में मुख्य थीम क्या हैं, इन 10,000 डॉक्यूमेंट को कौन से पैटर्न जोड़ते हैं।
Graph Engineering दोनों का जवाब देता है।
1लोकल सर्च | मार्च में सप्लायर X के साथ क्या हुआ2 | विशिष्ट नोड और उसके कनेक्शन ढूंढता है34ग्लोबल सर्च | हमारे सभी सप्लायर रिलेशनशिप में5 | मुख्य जोखिम पैटर्न क्या हैं6 | पूरे ग्राफ में पैटर्न ढूंढता है
Microsoft के GraphRAG रिसर्च से व्यावहारिक परिणाम:
1सटीकता में सुधार | रॉ डॉक्यूमेंट अप्रोच से 18% अधिक2टोकन लागत में कमी | स्ट्रक्चर्ड फाइलों को सीधे लोड करने से 85% कम3प्रति कार्य लागत | परीक्षण किए गए कॉन्फ़िगरेशन में लगभग $0.004

ये आंकड़े ChatP&ID पेपर से आए हैं - GraphRAG को इंडस्ट्रियल इंजीनियरिंग डायग्राम पर लागू किया गया। यही सिद्धांत सभी डोमेन पर लागू होते हैं।
डॉक्यूमेंट 2 - Stanford DSPy और ग्राफ कनेक्शन
Stanford के DSPy पेपर ने स्थापित किया कि मॉडल एक ग्राफ में एक नोड है - ब्रह्मांड का केंद्र नहीं। यह सैद्धांतिक आधार है जो सीधे Graph Engineering से जुड़ता है।
DSPy AI पाइपलाइन को मॉड्यूल के ग्राफ के रूप में मानता है:
1सवाल2↓3रिट्रीवर - प्रासंगिक जानकारी ढूंढता है4↓5रीज़निंग - प्रोसेस करता है और जोड़ता है6↓7वेरिफायर - परिणाम की जांच करता है8↓9जवाब
Graph Engineering से सीधा कनेक्शन है: DSPy पाइपलाइन ग्राफ को ऑप्टिमाइज़ करता है, GraphRAG नॉलेज ग्राफ को ऑप्टिमाइज़ करता है। दोनों मॉडल को पूरे समाधान के बजाय एक बड़ी संरचना में एक घटक के रूप में मानते हैं।
Stanford का STORM पेपर और आगे जाता है:
STORM एक शब्द लिखने से पहले रिसर्च चरणों के स्ट्रक्चर्ड ग्राफ के माध्यम से खरोंच से ज्ञान बनाता है। रिसर्च, सोर्स कलेक्शन, आउटलाइन, राइटिंग, वेरिफिकेशन, रिवीज़न - प्रत्येक चरण पिछले चरण में खोजे गए रिलेशनशिप से सूचित होता है।
सभी Stanford रिसर्च में साझा अंतर्दृष्टि: जटिल कार्यों के लिए जुड़े हुए चरणों की एक प्रणाली की आवश्यकता होती है, न कि एकल मॉडल कॉल की। ग्राफ ही सिस्टम है।
डॉक्यूमेंट 3 - नॉलेज ग्राफ के लिए Stanford स्केलिंग लॉज़
इस पेपर ने नॉलेज ग्राफ इंजीनियरिंग कार्यों पर 26 ओपन-सोर्स मॉडल की तुलना की। निष्कर्ष क्षेत्र में सबसे महत्वपूर्ण में से एक है:
1बड़ा मॉडल + खराब ग्राफ | बदतर परिणाम2छोटा मॉडल + अच्छा ग्राफ | बेहतर परिणाम
सही ग्राफ बड़े मॉडल को हरा देता है। हर बार।
यह वही निष्कर्ष है जिस पर Microsoft GraphRAG के साथ और Anthropic Claude Code के साथ पहुंचे - मॉडल के आसपास का सिस्टम मॉडल से अधिक आउटपुट निर्धारित करता है। Graph Engineering उस सिद्धांत का सबसे ठोस कार्यान्वयन है।
डॉक्यूमेंट 4 - MIT Press रिसर्च ऑन रिलेशनल मेमोरी
direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476
Transactions of the Association for Computational Linguistics में प्रकाशित।
रिसर्च दिखाता है कि जब आप लैंग्वेज मॉडल को रिलेशनल मेमोरी से जोड़ते हैं तो क्या होता है - टेक्स्ट चंक के बजाय रिलेशनशिप का एक नॉलेज ग्राफ।
1टेक्स्ट कॉन्टेक्स्ट2↓3ग्राफ से प्रासंगिक रिलेशन प्राप्त करें4↓5रिलेशनल मेमोरी6↓7लैंग्वेज मॉडल8↓9अधिक सुसंगत, अधिक सटीक जनरेशन
मुख्य खोज: स्पष्ट रिलेशनशिप स्ट्रक्चर तक पहुंच वाले मॉडल अकेले टेक्स्ट से काम करने वाले मॉडलों की तुलना में अधिक सुसंगत टेक्स्ट बनाते हैं और कम तार्किक गलतियाँ करते हैं।
यह वैज्ञानिक व्याख्या है कि Graph Engineering क्यों काम करता है। मॉडल को टेक्स्ट से रिलेशनशिप का अनुमान नहीं लगाना पड़ता। रिलेशनशिप ग्राफ में स्पष्ट होते हैं। मॉडल उन्हें सीधे उपयोग करता है।
डॉक्यूमेंट 5 - KEPLER
KEPLER लैंग्वेज मॉडल ट्रेनिंग को नॉलेज ग्राफ एम्बेडिंग के साथ जोड़ता है। भाषा समझ और तथ्यात्मक ज्ञान को अलग-अलग समस्याओं के रूप में मानने के बजाय - KEPLER दोनों को एक साथ ऑप्टिमाइज़ करता है।
1लैंग्वेज मॉडल2+3नॉलेज एम्बेडिंग4+5नॉलेज ग्राफ6=7मॉडल जो भाषा और तथ्य दोनों को समझता है
व्यावहारिक निहितार्थ: एक मॉडल जिसके पास ठीक से स्ट्रक्चर्ड नॉलेज ग्राफ तक पहुंच है, उसे एंटिटी के बीच संबंधों का अनुमान नहीं लगाना पड़ता। वह उन्हें देख लेता है। तथ्यात्मक सवालों पर सटीकता का अंतर महत्वपूर्ण है।
डॉक्यूमेंट 6 - Anthropic और ग्राफ में Claude
- www.anthropic.com/customers/graph
- github.com/anthropics/anthropic-cookbook
- github.com/modelcontextprotocol
Anthropic के पास "Graph Engineering" नाम का कोई प्रोडक्ट नहीं है। उनके पास तीन लेयर हैं जहाँ Claude सीधे ग्राफ आर्किटेक्चर में इंटीग्रेट होता है।
लेयर 1 - Claude टेक्स्ट से ग्राफ निकालता है
1डॉक्यूमेंट2↓3Claude एंटिटी और रिलेशनशिप निकालता है4↓5JSON ट्रिपल:6{7 "subject": "Anthropic",8 "relation": "बनाया",9 "object": "Claude"10}11↓12नॉलेज ग्राफ
Claude एंटिटी एक्सट्रैक्शन, रिलेशन एक्सट्रैक्शन, डिडुप्लिकेशन, नॉर्मलाइज़ेशन और ऑन्टोलॉजी ड्राफ्टिंग को संभालता है। जिन कार्यों के लिए पहले विशेष NLP पाइपलाइन की आवश्यकता होती थी, वे अब एक API कॉल के माध्यम से चलते हैं।
लेयर 2 - Claude ग्राफ को क्वेरी करता है
1यूज़र का सवाल2↓3Claude4↓5Cypher / SPARQL क्वेरी6↓7नॉलेज ग्राफ8↓9परिणाम10↓11Claude का सादी भाषा में स्पष्टीकरण
Claude प्राकृतिक भाषा को ग्राफ क्वेरी में बदलता है, उन्हें Neo4j या किसी भी ग्राफ डेटाबेस के खिलाफ चलाता है और परिणामों की व्याख्या करता है। यूज़र को क्वेरी भाषा के ज्ञान की आवश्यकता नहीं है।
लेयर 3 - MCP Claude को ग्राफ से जोड़ता है
github.com/modelcontextprotocol
1Claude2↓3MCP प्रोटोकॉल4↓5ग्राफ डेटाबेस6↓7एंटिटी + रिलेशनशिप8↓9पूरे ग्राफ कॉन्टेक्स्ट के साथ Claude
MCP ट्रांसपोर्ट लेयर है जो Claude को हर सत्र के लिए कनेक्शन को फिर से बनाए बिना किसी भी नॉलेज ग्राफ तक स्थायी पहुंच देता है।
LaunchNotes केस - वास्तविक प्रोडक्शन आंकड़े
www.anthropic.com/customers/graph

LaunchNotes ने Graph नाम का एक प्रोडक्ट बनाया जो GitHub, Jira और Linear को जोड़ता है। Claude तीनों सिस्टम में इंजीनियरिंग कार्य के बीच संबंधों का विश्लेषण करता है।
1GitHub कमिट2+3Jira टिकट4+5Linear कार्य6↓7इंजीनियरिंग कार्य का ग्राफ8↓9Claude10↓11इंसीडेंट डिटेक्शन + प्रोजेक्ट इनसाइट्स
Anthropic केस स्टडी के परिणाम:
1इंसीडेंट डिटेक्शन | 5x तक तेज़2मीटिंग का समय | लगभग 50% कमी3रिलीज़ नोट्स | सेकंड में स्वचालित रूप से जनरेट
ये आंकड़े स्ट्रक्चर्ड रिलेशनशिप डेटा को जोड़ने से आए हैं - न कि केवल डॉक्यूमेंट सर्च करने से।
नॉलेज ग्राफ वास्तव में क्या है
इसे बनाने से पहले - मूल अवधारणा।
एक नॉलेज ग्राफ जानकारी को ट्रिपल के रूप में संग्रहीत करता है:
1सब्जेक्ट → रिलेशन → ऑब्जेक्ट
उदाहरण:
1Anthropic → बनाया → Claude2Claude → सपोर्ट करता है → MCP3MCP → कनेक्ट करता है → बाहरी टूल4Microsoft → बनाया → GraphRAG5GraphRAG → टोकन लागत कम करता है → 85%
जानकारी का हर टुकड़ा दो एंटिटी के बीच एक स्पष्ट संबंध है। टेक्स्ट का एक पैराग्राफ नहीं जिसमें यह जानकारी हो सकती है - एक स्पष्ट, स्ट्रक्चर्ड, क्वेरी करने योग्य तथ्य।
1सामान्य डेटाबेस:2कंपनियों की तालिका3प्रोडक्ट की तालिका4उनके बीच कोई स्पष्ट संबंध नहीं56नॉलेज ग्राफ:7कंपनी → बनाया → प्रोडक्ट8प्रोडक्ट → प्रतिस्पर्धा करता है → अन्य प्रोडक्ट9अन्य प्रोडक्ट → स्वामित्व → अन्य कंपनी10कंपनी → निवेश किया → अन्य कंपनी
ग्राफ सिर्फ तथ्यों को स्टोर नहीं करता। यह स्टोर करता है कि तथ्य एक-दूसरे से कैसे जुड़ते हैं। यही वह चीज़ है जो जटिल तर्क को संभव बनाती है।
पूरी Graph Engineering पाइपलाइन
1स्टेप 1 | रॉ डॉक्यूमेंट इकट्ठा करें2 | PDF, ईमेल, रिपोर्ट, डेटाबेस एक्सपोर्ट34स्टेप 2 | एंटिटी निकालें5 | लोग, कंपनियाँ, प्रोडक्ट, घटनाएँ, अवधारणाएँ67स्टेप 3 | रिलेशनशिप निकालें8 | किसने किसके साथ क्या किया, कब, क्यों, कैसे910स्टेप 4 | स्कीमा बनाएं11 | एंटिटी प्रकार और रिलेशनशिप प्रकार परिभाषित करें1213स्टेप 5 | डिडुप्लिकेट और नॉर्मलाइज़ करें14 | "Microsoft Corp" और "MSFT" एक ही एंटिटी हैं1516स्टेप 6 | ग्राफ डेटाबेस में स्टोर करें17 | Neo4j, Amazon Neptune, ग्राफ एक्सटेंशन वाला PostgreSQL1819स्टेप 7 | रिट्रीवल लेयर बनाएं20 | विशिष्ट एंटिटी के लिए लोकल सर्च21 | पूरे ग्राफ में पैटर्न के लिए ग्लोबल सर्च2223स्टेप 8 | मॉडल को कनेक्ट करें24 | Claude MCP या डायरेक्ट API के माध्यम से ग्राफ को क्वेरी करता है2526स्टेप 9 | लगातार अपडेट करें27 | नए डॉक्यूमेंट ग्राफ का विस्तार करते हैं28 | विरोधाभास समीक्षा के लिए फ्लैग किए जाते हैं
LLM-असिस्टेड नॉलेज ग्राफ इंजीनियरिंग पेपर arxiv.org/abs/2307.06917 पर बेंचमार्क करता है कि लैंग्वेज मॉडल इनमें से प्रत्येक चरण को कितनी अच्छी तरह से संभालते हैं। ईमानदार खोज: LLM एक्सट्रैक्शन और नॉर्मलाइज़ेशन के लिए उत्कृष्ट सहायक हैं, लेकिन ज़ीरो-शॉट ग्राफ जनरेशन स्कीमा और डिडुप्लिकेशन चरणों पर मानव समीक्षा के बिना प्रोडक्शन के लिए अभी तक पर्याप्त विश्वसनीय नहीं है।
पाँच प्रॉम्प्ट जो पूरी पाइपलाइन चलाते हैं
Graph Engineering प्रॉम्प्ट को खत्म नहीं करता। यह ग्राफ पाइपलाइन के प्रत्येक विशिष्ट चरण में उनका उपयोग करता है।
प्रॉम्प्ट 1 - एक्सट्रैक्शन
1सभी संगठन, लोग, प्रोडक्ट और घटनाएँ निकालें।23प्रत्येक एंटिटी के लिए लौटाएं:4- canonical_name5- type6- description7- source89प्रत्येक रिलेशनशिप के लिए लौटाएं:10- source_entity11- relation_type12- target_entity13- evidence14- confidence_score
प्रॉम्प्ट 2 - नॉर्मलाइज़ेशन
1निम्नलिखित एंटिटी की तुलना करें।2निर्धारित करें कि वे संदर्भित करते हैं:3- एक ही एंटिटी4- संबंधित लेकिन अलग-अलग एंटिटी5- असंबंधित एंटिटी67कैनोनिकल नाम और स्पष्टीकरण लौटाएं।8स्पष्ट सबूत के बिना एंटिटी को मर्ज न करें।
प्रॉम्प्ट 3 - ग्राफ क्वेरी
1यूज़र के सवाल को Cypher क्वेरी में अनुवाद करें।2स्कीमा में मौजूद केवल रिलेशनशिप का उपयोग करें।3लेबल या प्रॉपर्टी का आविष्कार न करें।4क्वेरी और लॉजिक की एक छोटी व्याख्या लौटाएं।
प्रॉम्प्ट 4 - ग्राउंडेड जवाब
1केवल प्राप्त ग्राफ पथों का उपयोग करके जवाब दें।2प्रत्येक निष्कर्ष के लिए:3- सहायक नोड की पहचान करें4- रिलेशनशिप पथ की पहचान करें5- अनिश्चितता को स्पष्ट रूप से बताएं6- सहसंबंध से कारण का अनुमान न लगाएं
प्रॉम्प्ट 5 - ग्राफ मेंटेनेंस
1नए तथ्यों की मौजूदा ग्राफ से तुलना करें।2प्रत्येक तथ्य को वर्गीकृत करें:3- नया4- डुप्लिकेट5- विरोधाभास6- अपडेट7- अनिश्चित89सबूत के बिना मौजूदा तथ्यों को ओवरराइट न करें।
जैसा कि Microsoft का GraphRAG दस्तावेज़ीकरण दिखाता है - प्रॉम्प्ट आंतरिक रूप से एक्सट्रैक्शन, रिलेशनशिप आइडेंटिफिकेशन, सारांशीकरण और कम्युनिटी रिपोर्ट जनरेशन को संभालते हैं। प्रॉम्प्ट इंजीनियरिंग ग्राफ इंजीनियरिंग के अंदर का तंत्र है, इसका प्रतियोगी नहीं।
पाँच व्यवसाय जो आप नॉलेज ग्राफ पर बना सकते हैं
1 - ड्यू डिलिजेंस प्लेटफॉर्म
1कॉर्पोरेट रिपोर्ट + फाउंडर + निवेशक2+ कानूनी मामले + सहायक कंपनियाँ + लेन-देन3↓4नॉलेज ग्राफ5↓6Claude7↓8जोखिम विश्लेषण + छिपे हुए कनेक्शन + हितों का टकराव का पता लगाना
ग्राहक: निवेश फंड, लॉ फर्म, बैंक, M&A सलाहकार। मासिक रिटेनर $2,000-10,000 प्रति क्लाइंट।
2 - सेल्स इंटेलिजेंस
1संपर्क + कंपनियाँ + भूमिकाएँ2+ पिछले ईमेल + कंपनी की समस्याएँ + प्रोडक्ट3↓4नॉलेज ग्राफ5↓6निर्णय को कौन प्रभावित करता है7कौन सी आपत्तियाँ दोहराई जाती हैं8इस विशिष्ट क्लाइंट को कौन सा केस स्टडी दिखाना है9डील कहाँ अटकी है
3 - इंजीनियरिंग इंटेलिजेंस
1GitHub कमिट + Jira टिकट + Linear कार्य2↓3इंजीनियरिंग कार्य का ग्राफ4↓55x तेज़ इंसीडेंट डिटेक्शन650% कम मीटिंग का समय7स्वचालित रिलीज़ नोट्स
LaunchNotes पहले से ही इसे बेचता है। बाज़ार हर इंजीनियरिंग टीम है जो एक से अधिक प्रोजेक्ट मैनेजमेंट टूल का उपयोग करती है।
4 - रिसर्च इंटेलिजेंस
1पेपर + लेखक + संस्थान2+ विधियाँ + डेटासेट + परिणाम + विरोधाभास3↓4नॉलेज ग्राफ5↓6कौन सी GraphRAG विधियाँ कम्युनिटी डिटेक्शन का उपयोग करती हैं7किन डेटासेट पर उनका परीक्षण किया गया8कौन से पेपर एक-दूसरे का खंडन करते हैं
5 - पर्सनल नॉलेज OS
1Obsidian नोट्स + ईमेल + कैलेंडर2+ PDF + संपर्क + कार्य3↓4पर्सनल नॉलेज ग्राफ5↓6मैंने इस आइडिया पर किसके साथ चर्चा की थी7कौन से कार्य एक व्यक्ति के जवाब पर निर्भर हैं8कौन से निर्णय पिछले समझौतों का खंडन करते हैं9मैंने इस महीने क्या करने का वादा किया था
वह बदलाव जो Microsoft, Stanford और Anthropic को जोड़ता है
1प्रॉम्प्ट इंजीनियरिंग | सही सवाल कैसे पूछें2RAG | कौन सा डॉक्यूमेंट ढूंढना है3Graph Engineering | कौन सी एंटिटी मौजूद हैं4 | वे कैसे जुड़ती हैं5 | कौन सा पथ जवाब तक ले जाता है6 | अगर एक नोड बदलता है तो क्या बदलता है
LLM शब्द जानता है। नॉलेज ग्राफ रिलेशनशिप जानता है। सबसे शक्तिशाली AI सिस्टम तब प्रकट होते हैं जब दोनों एक साथ काम करते हैं।
Microsoft ने इसे प्रोडक्शन में GraphRAG के साथ साबित किया - 18% बेहतर सटीकता, 85% कम लागत। Stanford ने इसे रिसर्च में DSPy, STORM और स्केलिंग लॉज़ पेपर के साथ साबित किया। Anthropic ने इसे LaunchNotes केस में साबित किया - 5x तेज़ इंसीडेंट डिटेक्शन, 50% कम मीटिंग का समय।
तीन संगठन। तीन स्वतंत्र रास्ते। एक निष्कर्ष।
मॉडल टेक्स्ट ढूंढता है। ग्राफ रियलिटी ढूंढता है। ग्राफ बनाएं।
ज़्यादातर डेवलपर अपने प्रॉम्प्ट को बेहतर बनाते रहेंगे और सोचते रहेंगे कि जटिल सवालों पर अब भी खराब जवाब क्यों आते हैं। कुछ लोग एक वीकेंड में अपना पहला नॉलेज ग्राफ बनाने में बिताएंगे और फिर कभी डॉक्यूमेंट सर्च करने पर वापस नहीं जाएंगे।
/ अगर यह उपयोगी था - फॉलो करें, अगला पोस्ट पहले यहीं आएगा।





