AI 비교하기AI 사용하기AI 최신정보AI 배우기AI 솔루션
이벤트 정보
우리들의 비전우리들의 비전개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

ABSeeker, 장기 검색 에이전트 훈련

ABSeeker, 장기 검색 에이전트 훈련

HuggingFace
2026년 8월 7일 (금)
  • •ABSeeker는 단계별 감독을 위해 Answer-Backtracked Credit Assignment로 장기 검색 에이전트를 훈련한다
  • •논문에 따르면 Qwen3.5-4B 기반 ABSeeker는 훈련에 8.5k개 예제만 사용했다
  • •점수는 BrowseComp 37.3%, BrowseComp-ZH 39.1%에 도달했으며, 컨텍스트 관리로 더 향상됐다
  • •ABSeeker는 단계별 감독을 위해 Answer-Backtracked Credit Assignment로 장기 검색 에이전트를 훈련한다
  • •논문에 따르면 Qwen3.5-4B 기반 ABSeeker는 훈련에 8.5k개 예제만 사용했다
  • •점수는 BrowseComp 37.3%, BrowseComp-ZH 39.1%에 도달했으며, 컨텍스트 관리로 더 향상됐다
  • •ABSeeker는 단계별 감독을 위해 Answer-Backtracked Credit Assignment로 장기 검색 에이전트를 훈련한다
  • •논문에 따르면 Qwen3.5-4B 기반 ABSeeker는 훈련에 8.5k개 예제만 사용했다
  • •점수는 BrowseComp 37.3%, BrowseComp-ZH 39.1%에 도달했으며, 컨텍스트 관리로 더 향상됐다
  • •ABSeeker는 단계별 감독을 위해 Answer-Backtracked Credit Assignment로 장기 검색 에이전트를 훈련한다
  • •논문에 따르면 Qwen3.5-4B 기반 ABSeeker는 훈련에 8.5k개 예제만 사용했다
  • •점수는 BrowseComp 37.3%, BrowseComp-ZH 39.1%에 도달했으며, 컨텍스트 관리로 더 향상됐다

연구진 이준 루(Yijun Lu), 루이 예(Rui Ye), 자쥔 왕(Jiajun Wang), 유원 두(Yuwen Du), 톈 진(Tian Jin), 쑹화 류(Songhua Liu), 쓰헝 천(Siheng Chen)은 Aug 5 공개와 RuiYe의 Aug 6 제출 이후 Hugging Face Papers에 ABSeeker를 공개했다. ABSeeker는 Answer-Backtracked Credit Assignment로 훈련한 장기 검색 에이전트다. 논문은 장기 검색 에이전트가 최종 답변을 내기 전 검색, 검색 결과 확보, 검증, 증거 통합을 위해 여러 순차 행동을 수행해야 하지만, 기존 지도 미세조정과 강화 학습 방법은 보통 경로 안의 모든 단계를 같은 방식으로 취급한다고 설명했다.

Answer-Backtracked Credit Assignment, 즉 ABC는 전체 검색 경로만 판단하는 대신 단계 수준에서 기여도를 배정하도록 설계됐다. ABC는 잠재적으로 난해한 질의와 정답이 주어지면 먼저 Answer-Backtracked Clue Recovery를 수행한다. 이는 답에서 거꾸로 추적해 문제 해결에 필요한 중간 단서를 복원하는 절차다. 이어 Clue-Anchored Step Scoring으로 각 검색 단계를 해당 단서와 대조해 평가하며, 이에 따라 드문드문 주어지는 이진 결과 감독을 촘촘한 단계별 보상으로 바꾼다.

저자들은 이 보상을 두 가지 훈련 변형에 사용했다. ABC-SFT는 지도 미세조정 중 각 턴의 손실에 가중치를 다시 부여하고, ABC-GRPO는 단계별 점수를 GRPO의 보상으로 쓴다. 이 접근법은 실패한 경로 안에 있는 유용한 행동까지 보상하며, 동시에 다단계 검색 과정에서 나타날 수 있는 오류 행동이나 중복 행동은 억제한다.

ABSeeker는 Qwen3.5-4B에서 8.5k개 예제만으로 훈련됐다. 시스템은 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%를 기록했다. 컨텍스트 관리를 적용하자 점수는 각각 55.3%와 52.9%로 올랐으며, 논문은 이 결과가 같은 규모의 4B 에이전트를 크게 앞서고 약 30B 규모의 더 큰 에이전트 성능과 맞먹는다고 밝혔다.

연구진 이준 루(Yijun Lu), 루이 예(Rui Ye), 자쥔 왕(Jiajun Wang), 유원 두(Yuwen Du), 톈 진(Tian Jin), 쑹화 류(Songhua Liu), 쓰헝 천(Siheng Chen)은 Aug 5 공개와 RuiYe의 Aug 6 제출 이후 Hugging Face Papers에 ABSeeker를 공개했다. ABSeeker는 Answer-Backtracked Credit Assignment로 훈련한 장기 검색 에이전트다. 논문은 장기 검색 에이전트가 최종 답변을 내기 전 검색, 검색 결과 확보, 검증, 증거 통합을 위해 여러 순차 행동을 수행해야 하지만, 기존 지도 미세조정과 강화 학습 방법은 보통 경로 안의 모든 단계를 같은 방식으로 취급한다고 설명했다.

Answer-Backtracked Credit Assignment, 즉 ABC는 전체 검색 경로만 판단하는 대신 단계 수준에서 기여도를 배정하도록 설계됐다. ABC는 잠재적으로 난해한 질의와 정답이 주어지면 먼저 Answer-Backtracked Clue Recovery를 수행한다. 이는 답에서 거꾸로 추적해 문제 해결에 필요한 중간 단서를 복원하는 절차다. 이어 Clue-Anchored Step Scoring으로 각 검색 단계를 해당 단서와 대조해 평가하며, 이에 따라 드문드문 주어지는 이진 결과 감독을 촘촘한 단계별 보상으로 바꾼다.

저자들은 이 보상을 두 가지 훈련 변형에 사용했다. ABC-SFT는 지도 미세조정 중 각 턴의 손실에 가중치를 다시 부여하고, ABC-GRPO는 단계별 점수를 GRPO의 보상으로 쓴다. 이 접근법은 실패한 경로 안에 있는 유용한 행동까지 보상하며, 동시에 다단계 검색 과정에서 나타날 수 있는 오류 행동이나 중복 행동은 억제한다.

ABSeeker는 Qwen3.5-4B에서 8.5k개 예제만으로 훈련됐다. 시스템은 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%를 기록했다. 컨텍스트 관리를 적용하자 점수는 각각 55.3%와 52.9%로 올랐으며, 논문은 이 결과가 같은 규모의 4B 에이전트를 크게 앞서고 약 30B 규모의 더 큰 에이전트 성능과 맞먹는다고 밝혔다.

원문 보기 (영어)·2026년 8월 7일
#abseeker#answer backtracked credit assignment#long horizon search#agentic ai#qwen3.5 4b#browsecomp#browsecomp zh#supervised fine tuning#reinforcement learning#grpo