AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

AgentGarten、エージェント向け仮想世界を構築

AgentGarten、エージェント向け仮想世界を構築

HuggingFace·2026年10月9日 (金)
  • •シミュレーター、ゲームエンジン、共通のニューラルレンダラーを組み合わせ、エージェントを訓練
  • •役割に応じて、かくれんぼの戦術を4ラウンド目または10ラウンド目までに習得
  • •従来型の強化学習では数百万ラウンドを要する学習を、4ラウンドで実現したと研究者らが報告
  • •シミュレーター、ゲームエンジン、共通のニューラルレンダラーを組み合わせ、エージェントを訓練
  • •役割に応じて、かくれんぼの戦術を4ラウンド目または10ラウンド目までに習得
  • •従来型の強化学習では数百万ラウンドを要する学習を、4ラウンドで実現したと研究者らが報告
  • •シミュレーター、ゲームエンジン、共通のニューラルレンダラーを組み合わせ、エージェントを訓練
  • •役割に応じて、かくれんぼの戦術を4ラウンド目または10ラウンド目までに習得
  • •従来型の強化学習では数百万ラウンドを要する学習を、4ラウンドで実現したと研究者らが報告
  • •シミュレーター、ゲームエンジン、共通のニューラルレンダラーを組み合わせ、エージェントを訓練
  • •役割に応じて、かくれんぼの戦術を4ラウンド目または10ラウンド目までに習得
  • •従来型の強化学習では数百万ラウンドを要する学習を、4ラウンドで実現したと研究者らが報告

研究者らは、リアルタイムで動く仮想世界でエージェントを訓練する枠組み「AgentGarten」を発表しました。論文は10月8日に公開され、10月9日にHugging Face Papersへ投稿されました。システムは、各世界の状態とルールを管理するシミュレーターやゲームエンジンに、エージェントが使う視覚情報を生成する共通のニューラルレンダラーを組み合わせています。著者らは、訓練環境には一貫した状態、ルール、動きに加え、現実世界の視覚的な分布に似た観察情報が必要だと述べています。

AgentGartenは、事前学習済みの動画モデルを幾何条件に適応させた後、「Adversarial Forcing」で蒸留します。この手法は、過去の映像を正確に再生しながら、その読み込み処理を微分可能にします。これにより、後の予測で生じた誤差を使って、レンダラーが以前の観察情報をどう表現するかを更新できます。視覚品質の向上には、実データを使った敵対的な教師信号も用います。レンダラーは共通インターフェースから構造化された条件を受け取り、シミュレーションの各基盤がプログラムで定義された相互作用のルールを実行します。

エージェントは描画された視界を認識し、環境内でリアルタイムに行動します。各ラウンドの経験から作った手順書は後続のエージェントに引き継がれ、改良されます。かくれんぼの例では、隠れる側は4ラウンド目までにシェルターを作り、探す側は10ラウンド目までにスロープを使うようになりました。著者らは、従来型の強化学習の比較対象が数百万ラウンドを要したのに対し、AgentGartenのエージェントは4ラウンドから学習したと報告しています。新たな世界をコードで記述し、同じインターフェースで描画できるため、エージェントの能力向上に合わせて環境の数や難易度を増やせます。

研究者らは、リアルタイムで動く仮想世界でエージェントを訓練する枠組み「AgentGarten」を発表しました。論文は10月8日に公開され、10月9日にHugging Face Papersへ投稿されました。システムは、各世界の状態とルールを管理するシミュレーターやゲームエンジンに、エージェントが使う視覚情報を生成する共通のニューラルレンダラーを組み合わせています。著者らは、訓練環境には一貫した状態、ルール、動きに加え、現実世界の視覚的な分布に似た観察情報が必要だと述べています。

AgentGartenは、事前学習済みの動画モデルを幾何条件に適応させた後、「Adversarial Forcing」で蒸留します。この手法は、過去の映像を正確に再生しながら、その読み込み処理を微分可能にします。これにより、後の予測で生じた誤差を使って、レンダラーが以前の観察情報をどう表現するかを更新できます。視覚品質の向上には、実データを使った敵対的な教師信号も用います。レンダラーは共通インターフェースから構造化された条件を受け取り、シミュレーションの各基盤がプログラムで定義された相互作用のルールを実行します。

エージェントは描画された視界を認識し、環境内でリアルタイムに行動します。各ラウンドの経験から作った手順書は後続のエージェントに引き継がれ、改良されます。かくれんぼの例では、隠れる側は4ラウンド目までにシェルターを作り、探す側は10ラウンド目までにスロープを使うようになりました。著者らは、従来型の強化学習の比較対象が数百万ラウンドを要したのに対し、AgentGartenのエージェントは4ラウンドから学習したと報告しています。新たな世界をコードで記述し、同じインターフェースで描画できるため、エージェントの能力向上に合わせて環境の数や難易度を増やせます。

原文(英語)を読む·2026年10月9日
#agentgarten#agent training#neural renderer#adversarial forcing#interactive environments#hide and seek#reinforcement learning