ABSeeker, 장기 검색 에이전트 훈련
- •ABSeeker는 단계별 감독을 위해 Answer-Backtracked Credit Assignment로 장기 검색 에이전트를 훈련한다
- •논문에 따르면 Qwen3.5-4B 기반 ABSeeker는 훈련에 8.5k개 예제만 사용했다
- •점수는 BrowseComp 37.3%, BrowseComp-ZH 39.1%에 도달했으며, 컨텍스트 관리로 더 향상됐다
연구진 이준 루(Yijun Lu), 루이 예(Rui Ye), 자쥔 왕(Jiajun Wang), 유원 두(Yuwen Du), 톈 진(Tian Jin), 쑹화 류(Songhua Liu), 쓰헝 천(Siheng Chen)은 Aug 5 공개와 RuiYe의 Aug 6 제출 이후 Hugging Face Papers에 ABSeeker를 공개했다. ABSeeker는 Answer-Backtracked Credit Assignment로 훈련한 장기 검색 에이전트다. 논문은 장기 검색 에이전트가 최종 답변을 내기 전 검색, 검색 결과 확보, 검증, 증거 통합을 위해 여러 순차 행동을 수행해야 하지만, 기존 지도 미세조정과 강화 학습 방법은 보통 경로 안의 모든 단계를 같은 방식으로 취급한다고 설명했다.
Answer-Backtracked Credit Assignment, 즉 ABC는 전체 검색 경로만 판단하는 대신 단계 수준에서 기여도를 배정하도록 설계됐다. ABC는 잠재적으로 난해한 질의와 정답이 주어지면 먼저 Answer-Backtracked Clue Recovery를 수행한다. 이는 답에서 거꾸로 추적해 문제 해결에 필요한 중간 단서를 복원하는 절차다. 이어 Clue-Anchored Step Scoring으로 각 검색 단계를 해당 단서와 대조해 평가하며, 이에 따라 드문드문 주어지는 이진 결과 감독을 촘촘한 단계별 보상으로 바꾼다.
저자들은 이 보상을 두 가지 훈련 변형에 사용했다. ABC-SFT는 지도 미세조정 중 각 턴의 손실에 가중치를 다시 부여하고, ABC-GRPO는 단계별 점수를 GRPO의 보상으로 쓴다. 이 접근법은 실패한 경로 안에 있는 유용한 행동까지 보상하며, 동시에 다단계 검색 과정에서 나타날 수 있는 오류 행동이나 중복 행동은 억제한다.
ABSeeker는 Qwen3.5-4B에서 8.5k개 예제만으로 훈련됐다. 시스템은 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%를 기록했다. 컨텍스트 관리를 적용하자 점수는 각각 55.3%와 52.9%로 올랐으며, 논문은 이 결과가 같은 규모의 4B 에이전트를 크게 앞서고 약 30B 규모의 더 큰 에이전트 성능과 맞먹는다고 밝혔다.