AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Learn2Play Benchでエージェントの学習能力を検証

Learn2Play Benchでエージェントの学習能力を検証

HuggingFace·2026年10月9日 (金)
  • •シンガポール国立大学の研究者が、未知のテキストゲームでエージェントの学習を測るベンチマークを公開
  • •行動とフィードバックの完全な記録は、経験をルールや戦略に要約する方法より効果的な学習を支援
  • •人間プレイヤーはより高い最高得点を記録し、エージェントの実行環境変更で性能向上と推論コスト低下
  • •シンガポール国立大学の研究者が、未知のテキストゲームでエージェントの学習を測るベンチマークを公開
  • •行動とフィードバックの完全な記録は、経験をルールや戦略に要約する方法より効果的な学習を支援
  • •人間プレイヤーはより高い最高得点を記録し、エージェントの実行環境変更で性能向上と推論コスト低下
  • •シンガポール国立大学の研究者が、未知のテキストゲームでエージェントの学習を測るベンチマークを公開
  • •行動とフィードバックの完全な記録は、経験をルールや戦略に要約する方法より効果的な学習を支援
  • •人間プレイヤーはより高い最高得点を記録し、エージェントの実行環境変更で性能向上と推論コスト低下
  • •シンガポール国立大学の研究者が、未知のテキストゲームでエージェントの学習を測るベンチマークを公開
  • •行動とフィードバックの完全な記録は、経験をルールや戦略に要約する方法より効果的な学習を支援
  • •人間プレイヤーはより高い最高得点を記録し、エージェントの実行環境変更で性能向上と推論コスト低下

シンガポール国立大学の研究者は、未知の環境で大規模言語モデルのエージェントが経験から学べるかを検証するテキストゲーム群「Learn2Play Bench」を発表しました。ゲームには新奇なルールや直感に反するルールが使われ、エージェントは過去に学んだ知識だけに頼らず、実際に遊んで知識を身につける必要があります。ベンチマークは、繰り返し試行できる再現可能なフィードバックと自動採点を備え、ゲームの状況も変えて、新しい場面で学習内容を応用できるかを調べます。

研究者は3つの知見を報告しました。行動とフィードバックを完全に記録する方法は、経験をルールや戦略として要約する方法より効果的な学習を支えました。評価対象のエージェントより上位の人間プレイヤーのほうが最高得点は高く、より多様な戦略を試し、同じ行動を繰り返す頻度も低い結果でした。基盤モデルを固定したままエージェントハーネス(エージェントを動かすソフトウェア構成)を変更すると、性能が向上し、推定推論コストも下がりました。

論文では、基盤モデル、エージェントが時間とともに改善する手法、エージェントハーネスが学習能力に与える影響を評価しています。著者はYibo Li、Jinhang Qiu、Zhi Zheng、Qianyun Guo、Jiaying Wu、Shuo Ji、Bryan Hooiです。論文は10月8日に公開され、Hugging Face PapersのページではZhi Zhengが10月9日に投稿した論文として掲載され、その日の1位に挙げられました。

シンガポール国立大学の研究者は、未知の環境で大規模言語モデルのエージェントが経験から学べるかを検証するテキストゲーム群「Learn2Play Bench」を発表しました。ゲームには新奇なルールや直感に反するルールが使われ、エージェントは過去に学んだ知識だけに頼らず、実際に遊んで知識を身につける必要があります。ベンチマークは、繰り返し試行できる再現可能なフィードバックと自動採点を備え、ゲームの状況も変えて、新しい場面で学習内容を応用できるかを調べます。

研究者は3つの知見を報告しました。行動とフィードバックを完全に記録する方法は、経験をルールや戦略として要約する方法より効果的な学習を支えました。評価対象のエージェントより上位の人間プレイヤーのほうが最高得点は高く、より多様な戦略を試し、同じ行動を繰り返す頻度も低い結果でした。基盤モデルを固定したままエージェントハーネス(エージェントを動かすソフトウェア構成)を変更すると、性能が向上し、推定推論コストも下がりました。

論文では、基盤モデル、エージェントが時間とともに改善する手法、エージェントハーネスが学習能力に与える影響を評価しています。著者はYibo Li、Jinhang Qiu、Zhi Zheng、Qianyun Guo、Jiaying Wu、Shuo Ji、Bryan Hooiです。論文は10月8日に公開され、Hugging Face PapersのページではZhi Zhengが10月9日に投稿した論文として掲載され、その日の1位に挙げられました。

原文(英語)を読む·2026年10月9日
#learn2play bench#llm agents#agent learning#text based games#experience retention#agent harness#inference cost#national university of singapore