Nous avons travaillé dans l'ombre pour créer le moteur de recherche le PLUS RAPIDE au monde

@KZouAPT
ANGLAISil y a 9 heures · 21 juil. 2026
399K
351
82
146
138

TL;DR

Octen présente une API de recherche native pour l'IA, pensée pour les agents à haute concurrence, offrant une latence de 62 ms et un tarif disruptif de 1 $ pour 1 000 appels. Développée par des experts de la recherche, elle ambitionne de remplacer les architectures de recherche centrées sur l'humain.

La recherche a été conçue pour les humains. Vous tapez une requête, parcourez les résultats, affinez et réessayez.

Trente ans d'infrastructure ont été conçus autour de cette boucle.

Les agents d'IA ne fonctionnent PAS de cette façon. Un agent veut poser une question sous plusieurs angles à la fois et tout récupérer en même temps.

Mais les API de recherche qui alimentent les agents aujourd'hui sont la même boucle humaine encapsulée dans un endpoint.

Une requête entrante, une réponse sortante, des centaines de millisecondes chacune.

Nous avons passé l'année dernière à reconstruire la recherche pour ce qui effectue réellement la recherche. Nous n'en avons pas beaucoup parlé.

Honnêtement, nous n'étions pas prêts. Plus tôt cette année, j'avais l'impression que nous étions à peut-être 70 % de nos propres attentes, et je ne voulais pas faire de bruit pour 70 %.

Nous sommes prêts maintenant.

Les chiffres

L'API de recherche web d'Octen renvoie des résultats en 62 ms (P50) avec un P90 de 68 ms, mesuré sur SealQA Hard.

C'est plusieurs fois plus rapide qu'Exa, Parallel et des services similaires.

L'alternative la plus rapide mesure environ 244 ms. La plus lente, au-dessus de 2,6 secondes.

Kuan Zou - inline image

Un détail de ce graphique compte plus que le titre : l'écart entre notre P50 et notre P90 est de 6 ms. Pour certains services, il dépasse une seconde.

Si votre agent ne peut pas prédire combien de temps prend une recherche, il ne peut pas s'organiser en conséquence.

Le prix est de 1 $ pour 1 000 appels. La plupart des services de cette catégorie facturent entre 4 $ et 9 $.

En termes de qualité : Octen Embedding est n°1 sur RTEB, et notre modèle d'embedding VL est n°1 sur MMEB-v2.

Nous avons open-sourcé des modèles d'embedding de texte et ils ont été téléchargés plus de 500 000 fois en cinq mois.

Sur DeepResearch Bench, nous obtenons un score supérieur de 10 à 17 points à OpenAI Deep Research, Gemini et Grok.

Sur FreshQA Strict et SimpleQA, nous devançons tous les fournisseurs que nous testons.

Kuan Zou - inline image

Note : Tous les benchmarks sont publiés et reproductibles. Les liens en fin d'article.

Pourquoi j'ai lancé ce projet

Je m'appelle Kuan Zou. Avant Octen, j'étais responsable produit de la recherche IA chez Alibaba Cloud pendant cinq ans, gérant des systèmes qui servaient des centaines de millions d'utilisateurs.

Avant cela, j'ai construit la plateforme de recherche entreprise de Baidu à partir de zéro.

Chaque année chez Alibaba, mon travail consistait à survivre au Black Friday. Des milliards de requêtes en une journée, et aucune tolérance pour l'échec.

Alors quand j'ai regardé les API de recherche fournies aux agents d'IA, j'ai été sincèrement surpris. La plupart commencent à planter lorsque les requêtes par seconde atteignent la dizaine.

Un agent effectuant un travail réel déclenchera 20, 50, 100 recherches ensemble. L'infrastructure dont les agents dépendent le plus est la partie qui tombe en panne en premier.

Nous avons levé un seed de 10M$ mené par Square Peg, réuni une équipe d'Alibaba, Baidu, Meta, Google, TikTok, DeepSeek et Xiaohongshu, et nous nous sommes mis au travail.

Du linéaire au concurrent

Donnez une question à Octen et il la décompose en dizaines de sous-requêtes, les déclenche toutes simultanément, et assemble tout ce qui revient en une seule réponse.

Pas une requête à la fois. Toutes en même temps.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Voici ce qu'il fait pour la recherche approfondie : un rapport complet sourcé en moins de 3 minutes. Les systèmes qui mettent plus d'une heure sur la même tâche obtiennent un score inférieur au nôtre sur DeepResearch Bench.

Kuan Zou - inline image

À 62 ms, la recherche cesse de se comporter comme un outil externe et commence à se comporter comme une mémoire.

Votre agent raisonne sur le web en direct presque à la vitesse à laquelle il raisonne sur son propre contexte.

Cela ouvre des applications qui n'étaient pas pratiques auparavant. Agents de trading en temps réel. Données sportives et de marché en direct. Agents vocaux qui répondent sans la pause gênante.

Kuan Zou - inline image

Conçu pour la fiabilité

Un seul compte Octen prend en charge plus de 1 000 000 de requêtes par seconde. Le nouveau contenu est indexé dans les 5 minutes suivant sa publication.

Nous offrons également un QPS garanti avec un SLA.

Pour autant que je sache, nous sommes les seuls dans cette catégorie à pouvoir promettre cela, car ce n'est possible que lorsque l'on possède l'index de bout en bout. C'est notre cas.

Kuan Zou - inline image

Au-delà du texte, nous proposons la recherche d'images et de vidéos, et nous ancrons la génération d'images et de vidéos avec des références réelles issues du web en direct.

Cette couche est actuellement en accès anticipé.

Kuan Zou - inline image

Comment c'est aussi 5 fois moins cher

Il n'y a pas d'astuce.

La plupart des produits de « recherche pour l'IA » sont construits sur des piles de recherche open source conçues pour les humains. Ils ont pris le moteur derrière une boîte de requête et l'ont déplacé derrière une API.

La technologie n'a pas changé. Seule l'interface a changé. Appeler cela « recherche pour l'IA » n'a aucun sens.

Nous avons tout reconstruit. Le moteur de recherche, le classement, la couche de service, tout a été écrit de zéro pour une consommation machine. Rien dans notre pile n'a été conçu pour une personne faisant défiler les résultats.

C'est pourquoi le prix est possible. Un moteur entièrement natif IA n'hérite pas de trente ans de frais généraux de la recherche humaine. L'activité est saine à 1 $ pour 1 000 appels. Ce n'est pas une subvention qui va expirer.

Le prix est la preuve la plus honnête de l'architecture. N'importe qui peut prétendre que sa recherche est conçue pour l'IA. La structure de coûts montre si c'est vrai.

Certaines entreprises de cette catégorie exécutent déjà notre API contre la leur chaque jour.

Je le prends comme un compliment.

Pourquoi je partage tout

Savoir ce que nous faisons et être capable de le construire sont des problèmes différents.

Notre avantage concurrentiel est une équipe qui a passé une décennie à gérer certains des trafics de recherche les plus difficiles au monde.

Les premiers entrants ont éduqué le marché, et je leur en suis reconnaissant.

Mais les développeurs vérifient toujours les chiffres, et ils se dirigent vers ce qui offre les meilleures performances au moindre coût.

Je pense que c'est le marché le plus honnête du monde.

Les acteurs établis ont passé les deux dernières années à faire du marketing. Nous les avons passées à faire de l'ingénierie.

Maintenant, l'ingénierie est publique.

L'ère physique

La prochaine génération d'IA ne vit pas sur un écran.

Lunettes, robotique, modèles du monde. Dans ce monde, la recherche devient les yeux : perception en temps réel du web en direct.

Un robot ne peut pas attendre 3 secondes pour une réponse.

Lorsque la recherche renvoie des résultats en dizaines de millisecondes, l'interaction en temps réel pour l'IA physique franchit enfin le goulot d'étranglement qui la retenait.

Dans cette ère, je ne crois pas que quoi que ce soit au-dessus de 100 ms de latence survive. Aujourd'hui, nous sommes les seuls en dessous de cette barre.

La pile d'agents se stabilise en trois éléments : les modèles de fondation, les GPU et la recherche en direct.

Les deux premiers sont des problèmes résolus avec des gagnants clairs. Le troisième est encore en cours de décision. C'est la course que nous entendons gagner.

Essayez par vous-même

Les benchmarks sont publics et l'API est ouverte.

1 $ pour 1 000 appels, avec 5 $ de crédit gratuit. Disponible en tant qu'API, en tant que Skills, via MCP et depuis la CLI. Cela fonctionne dans Claude Code, Cursor, VS Code et tout client MCP.

Testez-nous contre ce que vous utilisez actuellement.

Mêmes requêtes, côte à côte. Publiez ce que vous trouvez.

Les entreprises de cette catégorie nous benchmarkent déjà quotidiennement, et vous devriez aussi.

Docs : docs.octen.ai

Note : Les chiffres de latence et de précision mesurés sur SealQA Hard, FreshQA Strict et SimpleQA. La date et la région du test sont indiquées sur chaque graphique. Reproduisez le benchmark : https://github.com/Octen-Team/search-eval

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux