Search vốn được xây dựng cho con người. Bạn gõ một truy vấn, quét kết quả, tinh chỉnh và thử lại.
Ba mươi năm hạ tầng được thiết kế xoay quanh vòng lặp đó.
Các AI agent KHÔNG hoạt động theo cách đó. Một agent muốn đặt câu hỏi từ nhiều góc độ cùng một lúc và nhận lại tất cả mọi thứ cùng nhau.
Nhưng các API tìm kiếm cung cấp dữ liệu cho agent ngày nay vẫn là cùng một vòng lặp của con người được đóng gói trong một endpoint.
Một truy vấn vào, một phản hồi ra, mỗi lần mất hàng trăm mili giây.
Chúng tôi đã dành năm ngoái để xây dựng lại search cho thứ thực sự đang thực hiện việc tìm kiếm. Chúng tôi không đăng nhiều về nó.
Thành thật mà nói, chúng tôi chưa sẵn sàng. Đầu năm nay, tôi cảm thấy chúng tôi chỉ đạt khoảng 70% kỳ vọng của chính mình, và tôi không muốn gây ồn ào về 70%.
Bây giờ chúng tôi đã sẵn sàng.
Các con số
API tìm kiếm web của Octen trả về kết quả trong 62ms (P50) với P90 là 68ms, được đo trên SealQA Hard.
Nhanh hơn gấp nhiều lần so với Exa, Parallel và các dịch vụ tương tự.
Giải pháp thay thế nhanh nhất đo được khoảng 244ms. Chậm nhất, trên 2,6 giây.

Một chi tiết trong biểu đồ này quan trọng hơn tiêu đề: khoảng cách giữa P50 và P90 của chúng tôi là 6ms. Đối với một số dịch vụ, nó lên tới hơn một giây.
Nếu agent của bạn không thể dự đoán một lần tìm kiếm mất bao lâu, nó không thể lên kế hoạch xoay quanh nó.
Giá: $1 cho 1.000 cuộc gọi. Hầu hết các dịch vụ trong danh mục này tính phí $4 đến $9.
Về chất lượng: Octen Embedding đứng số 1 trên RTEB, và mô hình embedding VL của chúng tôi đứng số 1 trên MMEB-v2.
Chúng tôi đã mã nguồn mở các mô hình embedding văn bản và chúng đã được tải xuống hơn 500.000 lần trong năm tháng.
Trên DeepResearch Bench, chúng tôi đạt điểm cao hơn OpenAI Deep Research, Gemini và Grok từ 10 đến 17 điểm.
Trên FreshQA Strict và SimpleQA, chúng tôi dẫn đầu mọi nhà cung cấp mà chúng tôi kiểm tra.

Lưu ý: Tất cả các điểm chuẩn đều được công bố và có thể tái tạo. Liên kết ở cuối.
Tại sao tôi bắt đầu điều này
Tên tôi là Kuan Zou. Trước Octen, tôi là trưởng nhóm sản phẩm tìm kiếm AI tại Alibaba Cloud trong năm năm, vận hành các hệ thống phục vụ hàng trăm triệu người dùng.
Trước đó, tôi đã xây dựng nền tảng tìm kiếm doanh nghiệp của Baidu từ đầu.
Mỗi năm tại Alibaba, công việc của tôi là sống sót qua Black Friday. Hàng tỷ truy vấn trong một ngày, và không có chỗ cho thất bại.
Vì vậy, khi tôi nhìn vào các API tìm kiếm được cung cấp cho các AI agent, tôi thực sự ngạc nhiên. Hầu hết chúng bắt đầu hỏng khi số truy vấn mỗi giây lên tới hàng chục.
Một agent thực hiện công việc thực tế sẽ kích hoạt 20, 50, 100 lượt tìm kiếm cùng nhau. Hạ tầng mà các agent phụ thuộc nhiều nhất lại là phần hỏng đầu tiên.
Chúng tôi đã huy động được [vòng seed $10M do Square Peg dẫn đầu](https://www.squarepeg.vc/blog/investment-notes-octen-us-10m-seed), tập hợp một đội ngũ từ Alibaba, Baidu, Meta, Google, TikTok, DeepSeek và Xiaohongshu, và bắt tay vào làm việc.
Từ tuyến tính đến đồng thời
Đưa cho Octen một câu hỏi, nó sẽ phân rã nó thành hàng chục truy vấn con, bắn tất cả cùng lúc, và tập hợp mọi thứ quay lại thành một câu trả lời.
Không phải từng truy vấn một. Tất cả cùng một lúc.



Đây là những gì nó làm với deep research: một báo cáo đầy đủ nguồn trong vòng chưa đầy 3 phút. Các hệ thống mất hơn một giờ cho cùng một nhiệm vụ đạt điểm dưới chúng tôi trên DeepResearch Bench.

Ở mức 62ms, tìm kiếm không còn hoạt động như một công cụ bên ngoài mà bắt đầu hoạt động như bộ nhớ.
Agent của bạn suy luận trên web trực tiếp với tốc độ gần bằng tốc độ nó suy luận trên ngữ cảnh của chính nó.
Điều đó mở ra các ứng dụng trước đây không khả thi. Các agent giao dịch thời gian thực. Dữ liệu thể thao và thị trường trực tiếp. Các agent giọng nói trả lời mà không có khoảng dừng khó xử.

Được xây dựng cho độ tin cậy
Một tài khoản Octen duy nhất hỗ trợ hơn 1.000.000 truy vấn mỗi giây. Nội dung mới được lập chỉ mục trong vòng 5 phút sau khi xuất bản.
Chúng tôi cũng cung cấp QPS đảm bảo với SLA.
Theo tôi biết, chúng tôi là những người duy nhất trong danh mục này có thể hứa hẹn điều này, bởi vì nó chỉ khả thi khi bạn sở hữu chỉ mục từ đầu đến cuối. Chúng tôi làm được.

Ngoài văn bản, chúng tôi chạy tìm kiếm hình ảnh và tìm kiếm video, và chúng tôi căn cứ việc tạo hình ảnh và video với các tham chiếu thực tế từ web trực tiếp.
Lớp này hiện đang trong giai đoạn truy cập sớm.

Làm thế nào nó cũng rẻ hơn 5 lần
Không có mẹo nào cả.
Hầu hết các sản phẩm "tìm kiếm cho AI" được xây dựng trên các ngăn xếp tìm kiếm mã nguồn mở vốn được thiết kế cho con người. Họ lấy công cụ đằng sau một hộp truy vấn và chuyển nó ra sau một API.
Công nghệ không thay đổi. Chỉ có giao diện thay đổi. Gọi đó là "tìm kiếm cho AI" thật vô lý.
Chúng tôi đã xây dựng lại mọi thứ. Công cụ tìm kiếm, xếp hạng, lớp phục vụ, tất cả được viết từ đầu cho máy móc tiêu thụ. Không có gì trong ngăn xếp của chúng tôi được thiết kế cho một người cuộn kết quả.
Đó là lý do tại sao mức giá có thể. Một công cụ tìm kiếm hoàn toàn AI-native không kế thừa ba mươi năm chi phí tìm kiếm của con người. Doanh nghiệp lành mạnh ở mức $1 cho 1.000 cuộc gọi. Đây không phải là một khoản trợ cấp chờ hết hạn.
Giá là bằng chứng trung thực nhất về kiến trúc. Bất cứ ai cũng có thể tuyên bố rằng tìm kiếm của họ được xây dựng cho AI. Cấu trúc chi phí cho thấy liệu điều đó có đúng hay không.
Một số công ty trong danh mục này đã chạy API của chúng tôi song song với API của họ mỗi ngày.
Tôi coi đó là một lời khen.
Tại sao tôi chia sẻ mọi thứ
Biết những gì chúng tôi làm và có thể xây dựng nó là những vấn đề khác nhau.
Hào của chúng tôi là một đội ngũ đã dành một thập kỷ xử lý một số lưu lượng tìm kiếm khó khăn nhất thế giới.
Những người tiên phong đã giáo dục thị trường, và tôi biết ơn vì điều đó.
Nhưng các nhà phát triển luôn kiểm tra các con số, và họ định tuyến đến bất cứ thứ gì hoạt động tốt nhất và chi phí thấp nhất.
Tôi nghĩ đó là thị trường trung thực nhất thế giới.
Các đối thủ cũ đã dành hai năm qua cho tiếp thị. Chúng tôi dành chúng cho kỹ thuật.
Bây giờ kỹ thuật đã được công khai.
Kỷ nguyên vật lý
Thế hệ AI tiếp theo không sống trên màn hình.
Kính mắt, robot, mô hình thế giới. Trong thế giới đó, tìm kiếm trở thành đôi mắt: nhận thức thời gian thực về web trực tiếp.
Một robot không thể đợi 3 giây cho một câu trả lời.
Khi tìm kiếm trả về trong hàng chục mili giây, tương tác thời gian thực cho AI vật lý cuối cùng đã phá vỡ nút thắt cổ chai đã kìm hãm nó.
Trong kỷ nguyên đó, tôi không tin bất cứ thứ gì trên 100ms độ trễ tồn tại. Hôm nay, chúng tôi là những người duy nhất dưới mức đó.
Ngăn xếp agent đang ổn định thành ba phần: mô hình nền tảng, GPU và tìm kiếm trực tiếp.
Hai vấn đề đầu tiên đã được giải quyết với những người chiến thắng rõ ràng. Vấn đề thứ ba vẫn đang được quyết định. Đó là cuộc đua chúng tôi dự định giành chiến thắng.
Hãy tự mình thử
Các điểm chuẩn đã công khai và API mở.
$1 cho 1.000 cuộc gọi, với $5 tín dụng miễn phí. Có sẵn dưới dạng API, dưới dạng Skills, qua MCP và từ CLI. Nó hoạt động trong Claude Code, Cursor, VS Code và bất kỳ client MCP nào.
Chạy chúng tôi so với bất cứ thứ gì bạn đang sử dụng hôm nay.
Cùng một truy vấn, song song. Đăng những gì bạn tìm thấy.
Các công ty trong danh mục này đã đo điểm chuẩn chúng tôi hàng ngày, và bạn cũng nên làm vậy.
Tài liệu: docs.octen.ai
Lưu ý: Số liệu độ trễ và độ chính xác được đo trên SealQA Hard, FreshQA Strict và SimpleQA. Ngày và khu vực kiểm tra được đóng dấu trên mỗi biểu đồ. Tái tạo điểm chuẩn: https://github.com/Octen-Team/search-eval





