हमने चुपचाप दुनिया का सबसे तेज़ सर्च इंजन बनाया है

@KZouAPT
अंग्रेज़ी8 घंटे पहले · 21 जुल॰ 2026
399K
351
82
146
138

TL;DR

Octen ने हाई-कॉन्करेंसी एजेंट्स के लिए डिज़ाइन किया गया एक AI-नेटिव सर्च API पेश किया है, जिसमें 62ms लेटेंसी और $1 प्रति 1,000 कॉल्स की किफायती कीमत शामिल है। सर्च विशेषज्ञों द्वारा निर्मित, इसका उद्देश्य मानव-केंद्रित सर्च स्टैक्स को बदलना है।

खोज मनुष्यों के लिए बनाई गई थी। आप एक क्वेरी टाइप करते हैं, परिणामों को स्कैन करते हैं, परिष्कृत करते हैं, और फिर से प्रयास करते हैं।

तीस वर्षों का बुनियादी ढांचा उस लूप के आसपास डिज़ाइन किया गया है।

AI एजेंट उस तरह से काम नहीं करते। एक एजेंट एक साथ कई कोणों से एक प्रश्न पूछना चाहता है और सब कुछ एक साथ वापस प्राप्त करना चाहता है।

लेकिन आज एजेंटों को फीड करने वाले सर्च API वही मानव लूप हैं जो एक एंडपॉइंट में लपेटे गए हैं।

एक क्वेरी अंदर, एक प्रतिक्रिया बाहर, प्रत्येक में सैकड़ों मिलीसेकंड।

हमने पिछले वर्ष खोज को वास्तव में खोज करने वाली चीज़ के लिए पुनर्निर्माण करने में बिताया। हमने इसके बारे में ज्यादा पोस्ट नहीं किया।

ईमानदारी से, हम तैयार नहीं थे। इस साल की शुरुआत में मुझे लगा कि हम शायद अपनी अपेक्षाओं के 70% पर थे, और मैं 70% के बारे में शोर नहीं करना चाहता था।

अब हम तैयार हैं।

आंकड़े

Octen का वेब सर्च API SealQA Hard पर मापा गया 62ms (P50) में परिणाम लौटाता है, जिसमें P90 68ms है।

यह Exa, Parallel और समान सेवाओं से कई गुना तेज़ है।

सबसे तेज़ विकल्प लगभग 244ms मापता है। सबसे धीमा, 2.6 सेकंड से ऊपर।

Kuan Zou - inline image

इस चार्ट में एक विवरण शीर्षक से अधिक मायने रखता है: हमारे P50 और P90 के बीच का अंतर 6ms है। कुछ सेवाओं के लिए यह एक सेकंड से अधिक है।

यदि आपका एजेंट यह अनुमान नहीं लगा सकता कि खोज में कितना समय लगेगा, तो वह इसके आसपास योजना नहीं बना सकता।

मूल्य निर्धारण $1 प्रति 1,000 कॉल है। इस श्रेणी की अधिकांश सेवाएं $4 से $9 चार्ज करती हैं।

गुणवत्ता पर: Octen Embedding RTEB पर #1 है, और हमारा VL एम्बेडिंग मॉडल MMEB-v2 पर #1 है।

हमने टेक्स्ट एम्बेडिंग मॉडल को ओपन-सोर्स किया और उन्हें पांच महीनों में 500,000 से अधिक बार डाउनलोड किया गया।

DeepResearch Bench पर हम OpenAI Deep Research, Gemini और Grok से 10 से 17 अंक अधिक स्कोर करते हैं।

FreshQA Strict और SimpleQA पर हम उन सभी विक्रेताओं से आगे हैं जिनके खिलाफ हम परीक्षण करते हैं।

Kuan Zou - inline image

नोट: सभी बेंचमार्क प्रकाशित और पुनरुत्पादनीय हैं। लिंक अंत में हैं।

मैंने यह क्यों शुरू किया

मेरा नाम Kuan Zou है। Octen से पहले, मैं Alibaba Cloud में AI सर्च का प्रोडक्ट लीड था पाँच वर्षों तक, सिस्टम चला रहा था जो सैकड़ों लाखों उपयोगकर्ताओं की सेवा करते थे।

उससे पहले, मैंने Baidu का एंटरप्राइज़ सर्च प्लेटफॉर्म शुरू से बनाया।

Alibaba में हर साल, मेरा काम Black Friday से बचना था। एक दिन में अरबों क्वेरी, और विफलता के लिए कोई सहनशीलता नहीं।

तो जब मैंने AI एजेंटों को दिए जा रहे सर्च API को देखा, तो मैं वास्तव में आश्चर्यचकित था। उनमें से अधिकांश तब टूटने लगते हैं जब क्वेरी प्रति सेकंड दहाई तक पहुँच जाती हैं।

एक एजेंट जो वास्तविक काम कर रहा है, वह एक साथ 20, 50, 100 खोजों को ट्रिगर करेगा। एजेंट जिस बुनियादी ढांचे पर सबसे अधिक निर्भर करते हैं, वह वह हिस्सा है जो पहले विफल होता है।

हमने Square Peg द्वारा नेतृत्वित $10M का सीड जुटाया, Alibaba, Baidu, Meta, Google, TikTok, DeepSeek और Xiaohongshu से एक टीम को एक साथ लाया, और काम पर लग गए।

रैखिक से समवर्ती तक

Octen को एक प्रश्न दें और यह इसे दर्जनों उप-क्वेरी में विघटित करता है, उन सभी को एक साथ फायर करता है, और जो कुछ भी वापस आता है उसे एक उत्तर में इकट्ठा करता है।

एक बार में एक क्वेरी नहीं। सभी एक साथ।

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

यह वही है जो यह गहन शोध के लिए करता है: 3 मिनट से कम समय में एक पूर्ण स्रोत-समर्थित रिपोर्ट। वे सिस्टम जो समान कार्य पर एक घंटे से अधिक लेते हैं, वे DeepResearch Bench पर हमसे नीचे स्कोर करते हैं।

Kuan Zou - inline image

62ms पर, खोज एक बाहरी उपकरण की तरह व्यवहार करना बंद कर देती है और मेमोरी की तरह व्यवहार करना शुरू कर देती है।

आपका एजेंट लाइव वेब पर लगभग उसी गति से तर्क करता है जिस गति से वह अपने स्वयं के संदर्भ पर तर्क करता है।

यह उन अनुप्रयोगों को खोलता है जो पहले व्यावहारिक नहीं थे। रीयल-टाइम ट्रेडिंग एजेंट। लाइव स्पोर्ट्स और मार्केट डेटा। वॉयस एजेंट जो अजीब विराम के बिना उत्तर देते हैं।

Kuan Zou - inline image

विश्वसनीयता के लिए निर्मित

एक एकल Octen खाता प्रति सेकंड 1,000,000 से अधिक क्वेरी का समर्थन करता है। नई सामग्री प्रकाशन के 5 मिनट के भीतर अनुक्रमित की जाती है।

हम SLA के साथ गारंटीकृत QPS भी प्रदान करते हैं।

जहाँ तक मुझे पता है, हम इस श्रेणी में एकमात्र हैं जो इसका वादा कर सकते हैं, क्योंकि यह तभी संभव है जब आप इंडेक्स को एंड-टू-एंड स्वामित्व में रखते हैं। हम करते हैं।

Kuan Zou - inline image

पाठ के अलावा, हम इमेज सर्च और वीडियो सर्च चलाते हैं, और हम लाइव वेब से वास्तविक संदर्भों के साथ इमेज और वीडियो जनरेशन को ग्राउंड करते हैं।

यह परत अब प्रारंभिक पहुंच में है।

Kuan Zou - inline image

यह 5x सस्ता कैसे है

कोई चाल नहीं है।

अधिकांश "AI के लिए खोज" उत्पाद ओपन-सोर्स सर्च स्टैक पर बनाए गए हैं जो मनुष्यों के लिए डिज़ाइन किए गए थे। उन्होंने क्वेरी बॉक्स के पीछे के इंजन को लिया और इसे एक API के पीछे ले गए।

प्रौद्योगिकी नहीं बदली। केवल इंटरफ़ेस बदला। उसे "AI के लिए खोज" कहना कोई मतलब नहीं रखता।

हमने सब कुछ पुनर्निर्माण किया। सर्च इंजन, रैंकिंग, सर्विंग लेयर, सब कुछ मशीन उपभोग के लिए शुरू से लिखा गया। हमारे स्टैक में कुछ भी किसी व्यक्ति के परिणामों को स्क्रॉल करने के लिए डिज़ाइन नहीं किया गया था।

यही कारण है कि कीमत संभव है। एक पूरी तरह से AI-नेटिव इंजन तीस वर्षों के मानव-खोज ओवरहेड को विरासत में नहीं लेता है। व्यवसाय $1 प्रति 1,000 कॉल पर स्वस्थ है। यह कोई सब्सिडी नहीं है जो समाप्त होने की प्रतीक्षा कर रही है।

कीमत आर्किटेक्चर का सबसे ईमानदार प्रमाण है। कोई भी दावा कर सकता है कि उनकी खोज AI के लिए बनाई गई है। लागत संरचना दिखाती है कि यह सच है या नहीं।

इस श्रेणी की कुछ कंपनियां पहले से ही अपने API के खिलाफ हमारे API को प्रतिदिन चलाती हैं।

मैं इसे एक तारीफ के रूप में लेता हूँ।

मैं सब कुछ क्यों साझा कर रहा हूँ

हम जो करते हैं उसे जानना और इसे बनाने में सक्षम होना अलग-अलग समस्याएं हैं।

हमारी खाई एक टीम है जिसने दुनिया के कुछ सबसे कठिन सर्च ट्रैफ़िक को संभालने में एक दशक बिताया है।

पहले चलने वालों ने बाजार को शिक्षित किया, और मैं इसके लिए आभारी हूँ।

लेकिन डेवलपर्स हमेशा संख्याओं की जांच करते हैं, और वे जो भी सबसे अच्छा प्रदर्शन करता है और सबसे कम लागत पर रूट करते हैं।

मुझे लगता है कि यह दुनिया का सबसे ईमानदार बाजार है।

मौजूदा खिलाड़ियों ने पिछले दो साल मार्केटिंग पर बिताए। हमने उन्हें इंजीनियरिंग पर बिताया।

अब इंजीनियरिंग सार्वजनिक है।

भौतिक युग

AI की अगली पीढ़ी स्क्रीन पर नहीं रहती।

चश्मा, रोबोटिक्स, वर्ल्ड मॉडल। उस दुनिया में, खोज आँखें बन जाती है: लाइव वेब की रीयल-टाइम धारणा।

एक रोबोट उत्तर के लिए 3 सेकंड इंतजार नहीं कर सकता।

जब खोज दसियों मिलीसेकंड में लौटती है, तो भौतिक AI के लिए रीयल-टाइम इंटरैक्शन अंततः उस बाधा को तोड़ देता है जिसने इसे रोक रखा था।

उस युग में, मुझे विश्वास नहीं है कि 100ms से अधिक विलंबता वाला कुछ भी बचेगा। आज हम उस बार के नीचे एकमात्र हैं।

एजेंट स्टैक तीन टुकड़ों में बस रहा है: फाउंडेशन मॉडल, GPU और लाइव सर्च।

पहले दो स्पष्ट विजेताओं के साथ हल की गई समस्याएं हैं। तीसरा अभी भी तय किया जा रहा है। यह वह दौड़ है जिसे हम जीतने का इरादा रखते हैं।

इसे स्वयं आज़माएं

बेंचमार्क सार्वजनिक हैं और API खुला है।

$1 प्रति 1,000 कॉल, $5 मुफ्त क्रेडिट के साथ। API, Skills, MCP के माध्यम से और CLI से उपलब्ध है। यह Claude Code, Cursor, VS Code और किसी भी MCP क्लाइंट में काम करता है।

हमें आज आप जो कुछ भी उपयोग कर रहे हैं उसके खिलाफ चलाएं।

समान क्वेरी, साथ-साथ। आप जो पाते हैं उसे पोस्ट करें।

इस श्रेणी की कंपनियां पहले से ही हमें दैनिक रूप से बेंचमार्क करती हैं, और आपको भी करना चाहिए।

डॉक्स: docs.octen.ai

नोट: विलंबता और सटीकता के आंकड़े SealQA Hard, FreshQA Strict और SimpleQA पर मापे गए। परीक्षण की तारीख और क्षेत्र प्रत्येक चार्ट पर अंकित हैं। बेंचमार्क को पुन: उत्पन्न करें: https://github.com/Octen-Team/search-eval

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें