ASPIRE, 모호한 목표 자기진화 시험
- •ASPIRE는 보이지 않는 downstream 평가 과제 없이 모호한 목표에서 LLM agent 자기진화를 시험했다
- •숨겨진 평가는 6개 자연어 능력 목표에 걸친 전문가 작성 520개 문항을 사용했다
- •Agent는 훈련 루프를 완료했지만, 가중치 수준 성능 향상은 드물고 불안정했다
ByteDance Seed 연구진은 Aug 31 ASPIRE를 공개했으며, Hugging Face는 Sep 3 제출 뒤 이를 당일 #3 Paper로 올렸다. ASPIRE는 “더 나은 물리학자가 되기” 또는 “연구 역량 향상” 같은 모호한 자연어 능력 목표에서 LLM agent가 downstream 평가 과제를 보지 않고 스스로 진화할 수 있는지 시험하는 benchmark다.
이 benchmark는 agent에게 자연어 능력 목표만 제공하고 평가 과제는 숨긴다. agent는 목표를 해석하고, 데이터와 업데이트 방법을 고르며, 훈련·검증 신호를 만들고, 평가 시점까지 결정해야 한다. ASPIRE는 하나의 interactive environment 안에서 model-weight evolution과 agent-harness evolution(도구 작업흐름을 바꾸는 방식)을 모두 지원한다.
연구진은 6개 목표에 걸친 전문가 작성 비공개 520개 문항으로 결과 시스템을 평가했다. 실험 결과, 모호한 목표는 탐색 노력을 목표 해석 쪽으로 이동시켰다. 현재 agent들은 훈련과 harness 편집 루프를 반복적으로 완료하지만, 가중치 수준의 성능 향상은 드물고 불안정했으며, 가장 강한 evolved harness도 engineered Qwen-Agent reference보다 낮은 성능에 머물렀다.
논문은 agent들이 맞지 않는 데이터로 훈련하는 경우가 잦고 좁은 self-evaluation에 의존해, 국소적 향상이 비공개 평가로 전이되지 않는다고 밝혔다. 또한 계속된 탐색과 훈련은 앞선 개선을 지울 수 있다. Hugging Face 페이지는 공개 시점에 172 upvotes를 기록했으며, 논문을 인용한 models 0개, datasets 0개, Spaces 0개를 표시했다.