Learn2Play Benchでエージェントの学習能力を検証
HuggingFace2026年10月9日 (金)
- •シンガポール国立大学の研究者が、未知のテキストゲームでエージェントの学習を測るベンチマークを公開
- •行動とフィードバックの完全な記録は、経験をルールや戦略に要約する方法より効果的な学習を支援
- •人間プレイヤーはより高い最高得点を記録し、エージェントの実行環境変更で性能向上と推論コスト低下
シンガポール国立大学の研究者は、未知の環境で大規模言語モデルのエージェントが経験から学べるかを検証するテキストゲーム群「Learn2Play Bench」を発表しました。ゲームには新奇なルールや直感に反するルールが使われ、エージェントは過去に学んだ知識だけに頼らず、実際に遊んで知識を身につける必要があります。ベンチマークは、繰り返し試行できる再現可能なフィードバックと自動採点を備え、ゲームの状況も変えて、新しい場面で学習内容を応用できるかを調べます。
研究者は3つの知見を報告しました。行動とフィードバックを完全に記録する方法は、経験をルールや戦略として要約する方法より効果的な学習を支えました。評価対象のエージェントより上位の人間プレイヤーのほうが最高得点は高く、より多様な戦略を試し、同じ行動を繰り返す頻度も低い結果でした。基盤モデルを固定したままエージェントハーネス(エージェントを動かすソフトウェア構成)を変更すると、性能が向上し、推定推論コストも下がりました。
論文では、基盤モデル、エージェントが時間とともに改善する手法、エージェントハーネスが学習能力に与える影響を評価しています。著者はYibo Li、Jinhang Qiu、Zhi Zheng、Qianyun Guo、Jiaying Wu、Shuo Ji、Bryan Hooiです。論文は10月8日に公開され、Hugging Face PapersのページではZhi Zhengが10月9日に投稿した論文として掲載され、その日の1位に挙げられました。