웹 에이전트 성능 높이는 DeepSearch-Evolve 프레임워크 공개
- •연구진이 웹 에이전트의 성능을 스스로 개선할 수 있도록 돕는 자가 증류 프레임워크인 DeepSearch-Evolve를 발표했다.
- •DeepSearch-World-9B 모델은 BrowseComp 31.2%, GAIA 61.5%, HotpotQA 93.4%의 벤치마크 점수를 기록했다.
- •DeepSearch-World는 42만 개의 다단계 질의응답 작업을 제공하여 장기 과제를 수행하는 에이전트의 확장 가능한 자가 진화를 지원한다.
연구진이 웹 에이전트가 스스로 경험을 통해 학습하며 성능을 향상할 수 있는 자가 증류 프레임워크 DeepSearch-Evolve를 공개했다. 기존의 지도 미세 조정은 교사 모델의 고정된 경로에 의존하는 한계가 있었고, 강화 학습은 장기 과제 수행 시 보상이 희소해 학습이 어렵다는 단점이 있었다. 이에 반해 이번 프레임워크는 재현 가능한 검색 및 페이지 읽기 기능을 갖춘 결정론적 검증 환경인 DeepSearch-World 위에서 작동한다.
DeepSearch-World는 진행 상황 확인, 근거에 기반한 성찰, 오류 복구 등 에이전트의 인지적 행동을 위한 기반을 제공한다. 특히 엔티티 단위의 무작위 보행을 통해 생성된 42만 개의 다단계 질의응답 작업을 포함하고 있어, 별도의 수동 라벨링 없이도 실제 정답 경로를 학습할 수 있다. DeepSearch-Evolve 과정은 경로 생성, 결과 필터링, 데이터 혼합 및 미세 조정의 반복을 통해 에이전트의 능력을 점진적으로 고도화한다.
연구진이 더 큰 규모의 모델을 사용하지 않고 자체적으로 훈련한 DeepSearch-World-9B 모델은 BrowseComp에서 31.2%, GAIA에서 61.5%, HotpotQA에서 93.4%의 벤치마크 점수를 기록했다. 이러한 성과는 검증 가능한 환경이 웹 에이전트의 확장 가능한 자가 진화를 지원할 수 있음을 입증한다. 연구팀은 향후 관련 연구를 지원하기 위해 해당 환경, 42만 개의 훈련 데이터셋, 검증 세트, 모델 가중치 및 관련 코드를 모두 공개할 계획이다.