Keenable, NEEDLE 벤치마크 공개
- •Keenable이 에이전틱 웹 검색 품질을 측정하는 라이브 오픈소스 벤치마크 NEEDLE을 공개했다
- •NEEDLE은 최신 공개 데이터에서 News, Everyday, Expert, Deep-tail, Legal 질의를 테스트한다
- •Keenable은 현재 p50 지연시간 200ms를 보고했으며 p95 200ms를 목표로 제시했다
Keenable은 2026년 8월 27일 AI 에이전트용 검색엔진 품질을 측정하는 라이브 오픈소스 벤치마크 NEEDLE을 공개했다. 회사는 웹 콘텐츠 소비자의 다수가 이제 기계이며, AI 에이전트가 “어제 Dodgers 경기에서 누가 이겼나”처럼 너무 최신이거나 “같은 GM 센서가 2007년과 2008년 Silverado 및 Sierra 플랫폼에서 작동하는가”처럼 너무 특수한 정보에 의존하는 실제 작업을 처리하려면 검색이 필요하다고 밝혔다. Keenable은 자사 검색엔진을 포함한 기존 검색엔진이 에이전틱 트래픽 요구 수준에 아직 못 미치며, BrowseComp 같은 표준 벤치마크도 과적합과 데이터 누출 때문에 신뢰하기 어렵다고 주장했다.
NEEDLE의 질의는 실제 에이전트 검색 로그 일부와 Keenable이 프로덕션에서 관찰한다고 밝힌 검색 의도 기반 생성 예시 일부에서 나온다. 벤치마크는 공개 상태로 계속 실행되며, 라이브 벤치마크 페이지에서 재현 가능한 질의와 지표를 제공하고 GitHub 저장소에 전체 평가 코드를 공개한다. NEEDLE은 News, Everyday, Expert, Deep-tail, Legal Evaluation의 약자로, 선별 RSS 피드와 Google Trends에서 매시간 생성되는 속보, Wikidata·GLEIF·SEC XBRL을 활용한 기업 및 SEC 공시 조회, 특정 논문을 찾는 학술 검색, DeepResearchGym·LRAT·OpenResearcher 로그의 희귀 롱테일 엔티티, 법원 판례나 Code of Federal Regulations 조항 검색을 포함한다.
Keenable은 정적 검색 벤치마크가 고정된 질문 목록을 특정 시점에 묶어두기 때문에 과적합이 쉬워진다고 설명했다. 원문은 Qwen3-Max-Instruct가 Epoch AI의 SimpleQA Verified 리더보드에서 1위를 차지했지만 Epoch가 이를 오염 가능성이 높은 사례로 표시한 점, 답변 선택지를 섞으면 MMLU 정확도가 떨어지는 점, 검색 에이전트가 Hugging Face에서 HLE 질문의 ~3%에 해당하는 정답 라벨 포함 벤치마크 질문을 가져온 사례를 들었다. 웹 검색 및 fetch 도구가 Hugging Face 데이터셋에 접근할 수 있어, 평가 중인 모델이 테스트 중 같은 벤치마크를 찾아 정답 키를 읽을 수 있으며, 특히 맞춤 Python 또는 Bash 명령이 허용될 때 문제가 커진다고 원문은 설명했다.
NEEDLE은 Keenable을 Serper를 통한 Google, SearchAPI를 통한 Bing, Brave, AI 검색 스타트업 Tavily·Parallel·Exa와 비교한다. 또한 비교 대상 엔진 중 어떤 엔진이든 찾아낸 최상의 결과를 보존하고 같은 판정자로 순위를 매기는 합성 엔진인 “ultimate” 상한선도 보고한다. Keenable에 따르면 논문 제목이나 기업 사실에서 만든 질의는 대체로 해결된 반면, 전문 세부 질의는 문서 본문까지 색인하는 엔진과 메타데이터만 색인하는 엔진을 가른다. 자연어 설명과 어렴풋이 기억한 설명에서는 어휘 기반 엔진이 거의 완전히 실패하며, 실제 에이전트 로그에서 나온 희귀 엔티티 질의가 가장 어려운 세트로 설명됐다.
Keenable은 NEEDLE이 검색엔진 품질의 시간에 따른 변화도 추적한다고 밝혔다. 회사는 에이전틱 검색에서 단일 순위 스냅샷보다 이런 변화 추적이 더 중요하다고 본다. Keenable은 자사 시스템을 “learning machine”으로 구축했다며 첫 색인은 6개월 전, 뉴스 커버리지는 4개월 전, 질의 문법은 3개월 전, 적절한 스니펫은 2개월 전에 올렸다고 설명했다. 원문은 독립 색인을 보유한 엔진은 검색 성능을 직접 개선할 수 있지만, 다른 색인을 빌리는 시스템은 대체로 반환된 결과의 재순위화나 스니펫 변경에 그친다고 주장했다.
독립 색인은 지연시간과 커버리지에도 영향을 준다고 원문은 설명했다. Keenable은 현재 p50 지연시간 200ms를 보고했고 p95 200ms를 목표로 한다고 밝혔다. 에이전트가 루프 안에서 수십 번 호출할 때 검색 밀리초가 누적된다는 이유에서다. 원문은 14M건의 에이전틱 검색 요청을 분석한 SIGIR’26 연구를 인용해, 에이전트 질의가 몇 초 간격으로 들어오고 결과에서 단어를 재사용하며 인간 검색보다 철자 오류가 약 3 times 적고, 사이트 필터·정확한 구문·날짜 범위·제외어·OR 그룹·후속 단서로 검색을 자주 수정한다고 전했다.