Exa, RL 검색 품질 실험
- •Exa로 학습한 Qwen3-4B 에이전트가 6개 pass@1 QA 벤치마크에서 SERP 학습 에이전트를 앞섰다
- •학습은 검색 백엔드만 다르게 고정됐고, 도구 호출마다 실시간 웹 결과 5개를 사용했다
- •Exa 설정에서 SERP는 롤아웃당 더 많은 검색 호출과 20% 더 많은 총 토큰을 필요로 했다
Exa는 강화 학습으로 훈련한 검색 에이전트가 Google식 SERP 백엔드보다 Exa가 실시간 웹 결과를 제공했을 때 더 나은 성능을 냈다고 밝혔다. 회사는 Tinker에서 LoRA 어댑터를 사용해 Qwen3-4B-Instruct-2507 에이전트 2개를 훈련했고, 검색 백엔드를 제외한 모든 변수를 고정한 뒤 Google 결과의 대리 지표로 사용한 SERP와 Exa를 비교했다.
각 에이전트는 같은 Search-R1 기반 시스템 프롬프트를 썼고, 검색 호출마다 실시간 웹 결과 5개가 반환됐으며 스니펫은 2,000자로 제한됐다. 한 롤아웃에서 “Rossen 문화가 위치한 곳의 부족들이 로마 제국을 침공한 해의 끝은 언제였나”라는 질문이 나왔고, Exa 에이전트는 Crossing of the Rhine 출처를 찾아 406이라고 답했다. SERP 에이전트는 질의를 고트족과 아드리아노플 전투에 연결한 뒤 378이라고 답했으며, 훈련되지 않은 두 에이전트는 검색 호출 1번 뒤 모두 “never”라고 답했다.
훈련에는 MuSiQue와 HotpotQA 다중 홉 QA 데이터셋, Dr. GRPO가 사용됐다. 보상은 각 궤적 끝에서 단일 이진 신호로 주어졌고, 에이전트가 정확도가 아니라 형식 변경으로 보상을 얻은 뒤 정확한 부분 문자열 매칭은 제외됐다. Exa는 SimpleQA LLM 채점기를 사용했으며, 궤적이 컨텍스트 한도를 넘으면 -0.25 페널티를 적용했다. 평가는 MuSiQue, HotpotQA, 2WikiMultihopQA, FRAMES, BrowseComp, SimpleQA에서 pass@k로 이뤄졌고, 같은 도구를 사용한 Qwen3-235B-A22B-Instruct-2507이 기준점으로 포함됐다.
문항 200개와 문항당 n=200 롤아웃으로 진행한 pass@1 테스트에서 Exa 학습 4B 에이전트는 모든 벤치마크에서 SERP 학습 4B 에이전트를 앞섰다. 점수는 SimpleQA 0.767 대 0.692, 2WikiMultihopQA 0.839 대 0.798, HotpotQA 0.694 대 0.684, FRAMES 0.566 대 0.521, MuSiQue 0.311 대 0.307, BrowseComp 0.043 대 0.039였다. 또한 Exa 4B+RL 에이전트는 SimpleQA 0.767 대 0.730, 2WikiMultihopQA 0.839 대 0.774, HotpotQA 0.694 대 0.632, MuSiQue 0.311 대 0.273, BrowseComp 0.043 대 0.039로 훈련되지 않은 235B 모델을 넘어섰지만, FRAMES에서는 235B 모델이 0.604를 기록해 앞섰다.
Exa 기준선도 6개 pass@1 벤치마크 모두에서 SERP 기준선보다 높게 출발했다. 수치는 SimpleQA 0.651 대 0.579, 2WikiMultihopQA 0.500 대 0.461, HotpotQA 0.521 대 0.491, FRAMES 0.316 대 0.272, MuSiQue 0.151 대 0.146, BrowseComp 0.020 대 0.008이었다. Exa는 k=1, 2, 5, 10, 20, 50의 평균 pass@k에서 Exa 학습 에이전트가 RL 전후 모든 샘플링 예산에서 가장 높았다고 밝혔다. 또한 토큰 효율성도 더 높았으며, 학습이 진행될수록 SERP는 롤아웃당 더 많은 검색 호출을 요구했고 발췌문 기준 총 토큰은 20% 더 많이 사용했다.