Learn2Play Bench, 에이전트 학습 능력 시험
- •싱가포르국립대 연구진, 낯선 텍스트 게임으로 에이전트 학습을 시험하는 Learn2Play Bench 공개
- •행동과 피드백 전체 기록이 규칙·전략 요약보다 효과적인 학습 지원
- •인간 최고 점수가 에이전트보다 높았으며, 하네스 변경으로 성능 향상과 추론 비용 절감
싱가포르국립대 연구진은 대규모 언어 모델 에이전트가 낯선 환경에서 경험을 통해 학습하는지 시험하는 텍스트 게임 벤치마크 Learn2Play Bench를 공개했습니다. 게임에는 새롭거나 직관에 어긋나는 규칙이 적용돼, 에이전트는 기존 지식에만 의존하지 않고 직접 상호작용하며 규칙을 익혀야 합니다. 벤치마크는 반복 시도에서 재현 가능한 피드백과 자동 채점을 제공하고, 게임 사례를 바꿔 학습한 내용을 새로운 상황에도 적용하는지 시험합니다.
연구진은 세 가지 결과를 보고했습니다. 행동과 피드백을 빠짐없이 기록하면 경험을 규칙이나 전략으로 요약했을 때보다 학습 효과가 컸습니다. 최고 수준의 인간 참가자는 평가 대상 에이전트보다 더 높은 최고 점수를 기록했고, 더 다양한 전략을 시도하면서 같은 행동을 반복하는 횟수도 적었습니다. 기반 모델을 고정한 상태에서 에이전트 하네스(에이전트를 실행하는 소프트웨어 구성)를 바꾸자 성능이 향상되고 추정 추론 비용이 줄었습니다.
논문은 기반 모델, 에이전트가 시간이 지나며 성능을 높이도록 하는 방법, 에이전트 하네스가 학습 능력에 미치는 영향을 평가했습니다. 저자는 이보 리(Yibo Li), 진항 치우(Jinhang Qiu), 즈정 정(Zhi Zheng), 첸윈 궈(Qianyun Guo), 자잉 우(Jiaying Wu), 슈오 지(Shuo Ji), 브라이언 후이(Bryan Hooi)입니다. 논문은 10월 8일 발표됐으며, Hugging Face Papers 페이지에는 즈정 정이 10월 9일 제출한 것으로 기록됐고 당일 1위 논문으로 표시됐습니다.