खोज मनुष्यों के लिए बनाई गई थी। आप एक क्वेरी टाइप करते हैं, परिणामों को स्कैन करते हैं, परिष्कृत करते हैं, और फिर से प्रयास करते हैं।
तीस वर्षों का बुनियादी ढांचा उस लूप के आसपास डिज़ाइन किया गया है।
AI एजेंट उस तरह से काम नहीं करते। एक एजेंट एक साथ कई कोणों से एक प्रश्न पूछना चाहता है और सब कुछ एक साथ वापस प्राप्त करना चाहता है।
लेकिन आज एजेंटों को फीड करने वाले सर्च API वही मानव लूप हैं जो एक एंडपॉइंट में लपेटे गए हैं।
एक क्वेरी अंदर, एक प्रतिक्रिया बाहर, प्रत्येक में सैकड़ों मिलीसेकंड।
हमने पिछले वर्ष खोज को वास्तव में खोज करने वाली चीज़ के लिए पुनर्निर्माण करने में बिताया। हमने इसके बारे में ज्यादा पोस्ट नहीं किया।
ईमानदारी से, हम तैयार नहीं थे। इस साल की शुरुआत में मुझे लगा कि हम शायद अपनी अपेक्षाओं के 70% पर थे, और मैं 70% के बारे में शोर नहीं करना चाहता था।
अब हम तैयार हैं।
आंकड़े
Octen का वेब सर्च API SealQA Hard पर मापा गया 62ms (P50) में परिणाम लौटाता है, जिसमें P90 68ms है।
यह Exa, Parallel और समान सेवाओं से कई गुना तेज़ है।
सबसे तेज़ विकल्प लगभग 244ms मापता है। सबसे धीमा, 2.6 सेकंड से ऊपर।

इस चार्ट में एक विवरण शीर्षक से अधिक मायने रखता है: हमारे P50 और P90 के बीच का अंतर 6ms है। कुछ सेवाओं के लिए यह एक सेकंड से अधिक है।
यदि आपका एजेंट यह अनुमान नहीं लगा सकता कि खोज में कितना समय लगेगा, तो वह इसके आसपास योजना नहीं बना सकता।
मूल्य निर्धारण $1 प्रति 1,000 कॉल है। इस श्रेणी की अधिकांश सेवाएं $4 से $9 चार्ज करती हैं।
गुणवत्ता पर: Octen Embedding RTEB पर #1 है, और हमारा VL एम्बेडिंग मॉडल MMEB-v2 पर #1 है।
हमने टेक्स्ट एम्बेडिंग मॉडल को ओपन-सोर्स किया और उन्हें पांच महीनों में 500,000 से अधिक बार डाउनलोड किया गया।
DeepResearch Bench पर हम OpenAI Deep Research, Gemini और Grok से 10 से 17 अंक अधिक स्कोर करते हैं।
FreshQA Strict और SimpleQA पर हम उन सभी विक्रेताओं से आगे हैं जिनके खिलाफ हम परीक्षण करते हैं।

नोट: सभी बेंचमार्क प्रकाशित और पुनरुत्पादनीय हैं। लिंक अंत में हैं।
मैंने यह क्यों शुरू किया
मेरा नाम Kuan Zou है। Octen से पहले, मैं Alibaba Cloud में AI सर्च का प्रोडक्ट लीड था पाँच वर्षों तक, सिस्टम चला रहा था जो सैकड़ों लाखों उपयोगकर्ताओं की सेवा करते थे।
उससे पहले, मैंने Baidu का एंटरप्राइज़ सर्च प्लेटफॉर्म शुरू से बनाया।
Alibaba में हर साल, मेरा काम Black Friday से बचना था। एक दिन में अरबों क्वेरी, और विफलता के लिए कोई सहनशीलता नहीं।
तो जब मैंने AI एजेंटों को दिए जा रहे सर्च API को देखा, तो मैं वास्तव में आश्चर्यचकित था। उनमें से अधिकांश तब टूटने लगते हैं जब क्वेरी प्रति सेकंड दहाई तक पहुँच जाती हैं।
एक एजेंट जो वास्तविक काम कर रहा है, वह एक साथ 20, 50, 100 खोजों को ट्रिगर करेगा। एजेंट जिस बुनियादी ढांचे पर सबसे अधिक निर्भर करते हैं, वह वह हिस्सा है जो पहले विफल होता है।
हमने Square Peg द्वारा नेतृत्वित $10M का सीड जुटाया, Alibaba, Baidu, Meta, Google, TikTok, DeepSeek और Xiaohongshu से एक टीम को एक साथ लाया, और काम पर लग गए।
रैखिक से समवर्ती तक
Octen को एक प्रश्न दें और यह इसे दर्जनों उप-क्वेरी में विघटित करता है, उन सभी को एक साथ फायर करता है, और जो कुछ भी वापस आता है उसे एक उत्तर में इकट्ठा करता है।
एक बार में एक क्वेरी नहीं। सभी एक साथ।



यह वही है जो यह गहन शोध के लिए करता है: 3 मिनट से कम समय में एक पूर्ण स्रोत-समर्थित रिपोर्ट। वे सिस्टम जो समान कार्य पर एक घंटे से अधिक लेते हैं, वे DeepResearch Bench पर हमसे नीचे स्कोर करते हैं।

62ms पर, खोज एक बाहरी उपकरण की तरह व्यवहार करना बंद कर देती है और मेमोरी की तरह व्यवहार करना शुरू कर देती है।
आपका एजेंट लाइव वेब पर लगभग उसी गति से तर्क करता है जिस गति से वह अपने स्वयं के संदर्भ पर तर्क करता है।
यह उन अनुप्रयोगों को खोलता है जो पहले व्यावहारिक नहीं थे। रीयल-टाइम ट्रेडिंग एजेंट। लाइव स्पोर्ट्स और मार्केट डेटा। वॉयस एजेंट जो अजीब विराम के बिना उत्तर देते हैं।

विश्वसनीयता के लिए निर्मित
एक एकल Octen खाता प्रति सेकंड 1,000,000 से अधिक क्वेरी का समर्थन करता है। नई सामग्री प्रकाशन के 5 मिनट के भीतर अनुक्रमित की जाती है।
हम SLA के साथ गारंटीकृत QPS भी प्रदान करते हैं।
जहाँ तक मुझे पता है, हम इस श्रेणी में एकमात्र हैं जो इसका वादा कर सकते हैं, क्योंकि यह तभी संभव है जब आप इंडेक्स को एंड-टू-एंड स्वामित्व में रखते हैं। हम करते हैं।

पाठ के अलावा, हम इमेज सर्च और वीडियो सर्च चलाते हैं, और हम लाइव वेब से वास्तविक संदर्भों के साथ इमेज और वीडियो जनरेशन को ग्राउंड करते हैं।
यह परत अब प्रारंभिक पहुंच में है।

यह 5x सस्ता कैसे है
कोई चाल नहीं है।
अधिकांश "AI के लिए खोज" उत्पाद ओपन-सोर्स सर्च स्टैक पर बनाए गए हैं जो मनुष्यों के लिए डिज़ाइन किए गए थे। उन्होंने क्वेरी बॉक्स के पीछे के इंजन को लिया और इसे एक API के पीछे ले गए।
प्रौद्योगिकी नहीं बदली। केवल इंटरफ़ेस बदला। उसे "AI के लिए खोज" कहना कोई मतलब नहीं रखता।
हमने सब कुछ पुनर्निर्माण किया। सर्च इंजन, रैंकिंग, सर्विंग लेयर, सब कुछ मशीन उपभोग के लिए शुरू से लिखा गया। हमारे स्टैक में कुछ भी किसी व्यक्ति के परिणामों को स्क्रॉल करने के लिए डिज़ाइन नहीं किया गया था।
यही कारण है कि कीमत संभव है। एक पूरी तरह से AI-नेटिव इंजन तीस वर्षों के मानव-खोज ओवरहेड को विरासत में नहीं लेता है। व्यवसाय $1 प्रति 1,000 कॉल पर स्वस्थ है। यह कोई सब्सिडी नहीं है जो समाप्त होने की प्रतीक्षा कर रही है।
कीमत आर्किटेक्चर का सबसे ईमानदार प्रमाण है। कोई भी दावा कर सकता है कि उनकी खोज AI के लिए बनाई गई है। लागत संरचना दिखाती है कि यह सच है या नहीं।
इस श्रेणी की कुछ कंपनियां पहले से ही अपने API के खिलाफ हमारे API को प्रतिदिन चलाती हैं।
मैं इसे एक तारीफ के रूप में लेता हूँ।
मैं सब कुछ क्यों साझा कर रहा हूँ
हम जो करते हैं उसे जानना और इसे बनाने में सक्षम होना अलग-अलग समस्याएं हैं।
हमारी खाई एक टीम है जिसने दुनिया के कुछ सबसे कठिन सर्च ट्रैफ़िक को संभालने में एक दशक बिताया है।
पहले चलने वालों ने बाजार को शिक्षित किया, और मैं इसके लिए आभारी हूँ।
लेकिन डेवलपर्स हमेशा संख्याओं की जांच करते हैं, और वे जो भी सबसे अच्छा प्रदर्शन करता है और सबसे कम लागत पर रूट करते हैं।
मुझे लगता है कि यह दुनिया का सबसे ईमानदार बाजार है।
मौजूदा खिलाड़ियों ने पिछले दो साल मार्केटिंग पर बिताए। हमने उन्हें इंजीनियरिंग पर बिताया।
अब इंजीनियरिंग सार्वजनिक है।
भौतिक युग
AI की अगली पीढ़ी स्क्रीन पर नहीं रहती।
चश्मा, रोबोटिक्स, वर्ल्ड मॉडल। उस दुनिया में, खोज आँखें बन जाती है: लाइव वेब की रीयल-टाइम धारणा।
एक रोबोट उत्तर के लिए 3 सेकंड इंतजार नहीं कर सकता।
जब खोज दसियों मिलीसेकंड में लौटती है, तो भौतिक AI के लिए रीयल-टाइम इंटरैक्शन अंततः उस बाधा को तोड़ देता है जिसने इसे रोक रखा था।
उस युग में, मुझे विश्वास नहीं है कि 100ms से अधिक विलंबता वाला कुछ भी बचेगा। आज हम उस बार के नीचे एकमात्र हैं।
एजेंट स्टैक तीन टुकड़ों में बस रहा है: फाउंडेशन मॉडल, GPU और लाइव सर्च।
पहले दो स्पष्ट विजेताओं के साथ हल की गई समस्याएं हैं। तीसरा अभी भी तय किया जा रहा है। यह वह दौड़ है जिसे हम जीतने का इरादा रखते हैं।
इसे स्वयं आज़माएं
बेंचमार्क सार्वजनिक हैं और API खुला है।
$1 प्रति 1,000 कॉल, $5 मुफ्त क्रेडिट के साथ। API, Skills, MCP के माध्यम से और CLI से उपलब्ध है। यह Claude Code, Cursor, VS Code और किसी भी MCP क्लाइंट में काम करता है।
हमें आज आप जो कुछ भी उपयोग कर रहे हैं उसके खिलाफ चलाएं।
समान क्वेरी, साथ-साथ। आप जो पाते हैं उसे पोस्ट करें।
इस श्रेणी की कंपनियां पहले से ही हमें दैनिक रूप से बेंचमार्क करती हैं, और आपको भी करना चाहिए।
डॉक्स: docs.octen.ai
नोट: विलंबता और सटीकता के आंकड़े SealQA Hard, FreshQA Strict और SimpleQA पर मापे गए। परीक्षण की तारीख और क्षेत्र प्रत्येक चार्ट पर अंकित हैं। बेंचमार्क को पुन: उत्पन्न करें: https://github.com/Octen-Team/search-eval




![[क्षमा और आभार] AI युग में कार्यालय के महत्व को फिर से परिभाषित करना](https://youmind.club/__ym/cms-assets/media/1784654487214_c56a6p_HNr6-znbwAAQJbv.jpg)
