우리는 침묵 속에서 지구상에서 가장 빠른 검색 엔진을 구축했습니다

@KZouAPT
영어9시간 전 · 2026년 7월 21일
399K
351
82
146
138

TL;DR

Octen은 고동시성 에이전트를 위해 설계된 AI 네이티브 검색 API를 선보입니다. 62ms의 지연 시간과 1,000회 호출당 1달러라는 파격적인 가격을 제공하며, 검색 분야 베테랑들이 구축하여 인간 중심의 기존 검색 스택을 대체하는 것을 목표로 합니다.

검색은 사람을 위해 만들어졌습니다. 하나의 질문을 입력하고, 결과를 살펴보고, 수정한 후 다시 시도합니다.

30년 동안 쌓인 인프라는 그 순환 구조에 맞춰 설계되었습니다.

하지만 AI 에이전트는 그렇게 작동하지 않습니다. 에이전트는 여러 각도에서 동시에 질문을 던지고 모든 결과를 한 번에 받아오길 원합니다.

그런데 현재 에이전트에 데이터를 공급하는 검색 API는 사람의 검색 루프를 그대로 엔드포인트로 감싼 것에 불과합니다.

하나의 질문을 보내면 하나의 응답이 돌아오고, 각각 수백 밀리초가 소요됩니다.

우리는 지난 1년 동안 실제로 검색을 수행하는 주체를 위해 검색을 처음부터 다시 구축했습니다. 이에 대해 많은 이야기를 하지 않았습니다.

솔직히 말해, 준비가 되지 않았습니다. 올해 초에는 우리의 기대치에 약 70% 정도 도달했다고 느꼈고, 70% 상태에서 떠들고 싶지 않았습니다.

이제 준비가 되었습니다.

수치

Octen의 웹 검색 API는 SealQA Hard 기준으로 P50 62ms, P90 68ms의 결과를 반환합니다.

이는 Exa, Parallel 및 유사 서비스보다 몇 배 더 빠른 속도입니다.

가장 빠른 대안은 약 244ms입니다. 가장 느린 경우는 2.6초 이상입니다.

Kuan Zou - inline image

이 차트에서 헤드라인보다 더 중요한 세부 사항이 하나 있습니다. 바로 P50과 P90 사이의 차이가 6ms에 불과하다는 점입니다. 일부 서비스의 경우 이 차이가 1초가 넘습니다.

에이전트가 검색에 소요되는 시간을 예측할 수 없다면, 그에 맞춰 계획을 세울 수 없습니다.

가격은 1,000회 호출당 1달러입니다. 이 카테고리의 대부분 서비스는 4~9달러를 청구합니다.

품질 측면에서 Octen Embedding은 RTEB에서 1위, VL 임베딩 모델은 MMEB-v2에서 1위를 기록했습니다.

텍스트 임베딩 모델을 오픈소스로 공개했으며, 5개월 만에 50만 회 이상 다운로드되었습니다.

DeepResearch Bench에서는 OpenAI Deep Research, Gemini, Grok보다 10~17포인트 높은 점수를 기록했습니다.

FreshQA Strict 및 SimpleQA에서는 테스트한 모든 벤더보다 앞서 있습니다.

Kuan Zou - inline image

참고: 모든 벤치마크는 공개되어 있으며 재현 가능합니다. 링크는 마지막에 있습니다.

시작하게 된 이유

저는 Kuan Zou입니다. Octen 이전에는 알리바바 클라우드에서 AI 검색 제품 리더로 5년간 재직하며 수억 명의 사용자를 대상으로 하는 시스템을 운영했습니다.

그 전에는 바이두의 엔터프라이즈 검색 플랫폼을 처음부터 구축했습니다.

알리바바에서 매년 제 임무는 블랙 프라이데이를 버티는 것이었습니다. 하루에 수십억 건의 쿼리를 처리해야 했고, 실패는 용납되지 않았습니다.

따라서 AI 에이전트에 제공되는 검색 API를 보았을 때, 저는 정말 놀랐습니다. 대부분은 초당 쿼리 수가 수십 개만 되어도 작동이 멈추기 시작했습니다.

실제 작업을 수행하는 에이전트는 20개, 50개, 100개의 검색을 동시에 트리거합니다. 에이전트가 가장 의존하는 인프라가 가장 먼저 실패하는 부분입니다.

우리는 Square Peg가 주도하는 1,000만 달러 시드 투자를 유치하고, 알리바바, 바이두, 메타, 구글, TikTok, DeepSeek, 샤오홍슈 출신 팀을 모아 작업에 착수했습니다.

선형에서 동시성으로

Octen에 질문을 주면, 수십 개의 하위 질문으로 분해하고, 이를 모두 동시에 실행하며, 돌아오는 모든 결과를 하나의 답변으로 조합합니다.

한 번에 하나의 질문이 아닙니다. 모든 질문을 동시에 처리합니다.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

이것이 딥 리서치에 적용되는 방식입니다. 3분 이내에 전체 출처가 포함된 보고서를 생성합니다. 동일한 작업에 한 시간 이상 소요되는 시스템은 DeepResearch Bench에서 우리보다 낮은 점수를 기록합니다.

Kuan Zou - inline image

62ms에서 검색은 더 이상 외부 도구처럼 작동하지 않고 메모리처럼 작동하기 시작합니다.

에이전트는 실시간 웹을 마치 자체 컨텍스트를 추론하는 속도에 가깝게 추론합니다.

이를 통해 이전에는 실용적이지 않았던 애플리케이션이 가능해집니다. 실시간 트레이딩 에이전트. 라이브 스포츠 및 시장 데이터. 어색한 멈춤 없이 응답하는 음성 에이전트.

Kuan Zou - inline image

신뢰성을 위해 구축됨

단일 Octen 계정은 초당 1,000,000개 이상의 쿼리를 지원합니다. 새 콘텐츠는 게시 후 5분 이내에 인덱싱됩니다.

또한 SLA와 함께 보장된 QPS를 제공합니다.

제가 알기로는, 이 카테고리에서 이를 약속할 수 있는 유일한 업체입니다. 인덱스를 처음부터 끝까지 자체적으로 소유할 때만 가능하기 때문입니다. 우리는 그렇게 하고 있습니다.

Kuan Zou - inline image

텍스트 외에도 이미지 검색과 비디오 검색을 실행하며, 실시간 웹의 실제 참조를 사용하여 이미지 및 비디오 생성을 근거로 제공합니다.

이 레이어는 현재 얼리 액세스 중입니다.

Kuan Zou - inline image

5배 더 저렴한 이유

비결은 없습니다.

대부분의 "AI용 검색" 제품은 사람을 위해 설계된 오픈소스 검색 스택을 기반으로 구축되었습니다. 쿼리 박스 뒤에 있던 엔진을 가져와 API 뒤에 배치한 것입니다.

기술은 변하지 않았습니다. 인터페이스만 바뀌었을 뿐입니다. 이것을 "AI용 검색"이라고 부르는 것은 이치에 맞지 않습니다.

우리는 모든 것을 다시 구축했습니다. 검색 엔진, 랭킹, 서빙 레이어까지 모두 머신 소비를 위해 처음부터 새로 작성했습니다. 우리 스택에는 사람이 결과를 스크롤하도록 설계된 것이 하나도 없습니다.

그렇기 때문에 가격이 가능합니다. 완전히 AI 네이티브인 엔진은 30년간의 인간 검색 오버헤드를 물려받지 않습니다. 비즈니스는 1,000회 호출당 1달러로 건전합니다. 이것은 곧 만료될 보조금이 아닙니다.

가격은 아키텍처에 대한 가장 정직한 증거입니다. 누구나 자신의 검색이 AI용으로 구축되었다고 주장할 수 있습니다. 비용 구조는 그것이 진실인지 여부를 보여줍니다.

이 카테고리의 일부 회사는 이미 매일 자사 API와 우리 API를 비교 테스트하고 있습니다.

저는 이를 칭찬으로 받아들입니다.

모든 것을 공유하는 이유

우리가 하는 일을 아는 것과 그것을 구축할 수 있는 것은 다른 문제입니다.

우리의 해자는 세계에서 가장 까다로운 검색 트래픽을 10년 동안 처리해 온 팀입니다.

퍼스트 무버들은 시장을 교육했으며, 이에 감사드립니다.

하지만 개발자들은 항상 수치를 확인하고, 가장 성능이 좋고 비용이 적게 드는 곳으로 라우팅합니다.

저는 그것이 가장 정직한 시장이라고 생각합니다.

기존 업체들은 지난 2년을 마케팅에 보냈습니다. 우리는 엔지니어링에 보냈습니다.

이제 엔지니어링이 공개되었습니다.

물리적 시대

AI의 다음 세대는 화면 위에 존재하지 않습니다.

안경, 로보틱스, 월드 모델. 그 세계에서 검색은 눈이 됩니다: 실시간 웹에 대한 실시간 인식입니다.

로봇은 3초 동안 답변을 기다릴 수 없습니다.

검색이 수십 밀리초 단위로 반환될 때, 물리적 AI를 위한 실시간 상호작용은 마침내 이를 가로막고 있던 병목 현상을 돌파합니다.

그 시대에는 100ms 이상의 지연 시간을 가진 것은 살아남지 못할 것이라고 믿습니다. 오늘날 우리는 그 기준 이하에 있는 유일한 업체입니다.

에이전트 스택은 세 가지 부분으로 정착되고 있습니다: 기초 모델, GPU, 그리고 실시간 검색입니다.

처음 두 가지는 명확한 승자가 있는 해결된 문제입니다. 세 번째는 아직 결정 중입니다. 그것이 우리가 이기려는 경쟁입니다.

직접 사용해보세요

벤치마크는 공개되어 있고 API는 열려 있습니다.

1,000회 호출당 1달러, 5달러의 무료 크레딧이 제공됩니다. API, Skills, MCP, CLI를 통해 사용할 수 있습니다. Claude Code, Cursor, VS Code 및 모든 MCP 클라이언트에서 작동합니다.

현재 사용 중인 어떤 솔루션이든 저희와 비교해보세요.

동일한 쿼리로, 나란히 테스트해보세요. 결과를 게시해주세요.

이 카테고리의 회사들은 이미 매일 우리를 벤치마킹하고 있으며, 여러분도 그래야 합니다.

문서: docs.octen.ai

참고: 지연 시간 및 정확도 수치는 SealQA Hard, FreshQA Strict 및 SimpleQA에서 측정되었습니다. 테스트 날짜와 지역은 각 차트에 표시되어 있습니다. 벤치마크 재현: https://github.com/Octen-Team/search-eval

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기