AgentGarten、エージェント向け仮想世界を構築
- •シミュレーター、ゲームエンジン、共通のニューラルレンダラーを組み合わせ、エージェントを訓練
- •役割に応じて、かくれんぼの戦術を4ラウンド目または10ラウンド目までに習得
- •従来型の強化学習では数百万ラウンドを要する学習を、4ラウンドで実現したと研究者らが報告
研究者らは、リアルタイムで動く仮想世界でエージェントを訓練する枠組み「AgentGarten」を発表しました。論文は10月8日に公開され、10月9日にHugging Face Papersへ投稿されました。システムは、各世界の状態とルールを管理するシミュレーターやゲームエンジンに、エージェントが使う視覚情報を生成する共通のニューラルレンダラーを組み合わせています。著者らは、訓練環境には一貫した状態、ルール、動きに加え、現実世界の視覚的な分布に似た観察情報が必要だと述べています。
AgentGartenは、事前学習済みの動画モデルを幾何条件に適応させた後、「Adversarial Forcing」で蒸留します。この手法は、過去の映像を正確に再生しながら、その読み込み処理を微分可能にします。これにより、後の予測で生じた誤差を使って、レンダラーが以前の観察情報をどう表現するかを更新できます。視覚品質の向上には、実データを使った敵対的な教師信号も用います。レンダラーは共通インターフェースから構造化された条件を受け取り、シミュレーションの各基盤がプログラムで定義された相互作用のルールを実行します。
エージェントは描画された視界を認識し、環境内でリアルタイムに行動します。各ラウンドの経験から作った手順書は後続のエージェントに引き継がれ、改良されます。かくれんぼの例では、隠れる側は4ラウンド目までにシェルターを作り、探す側は10ラウンド目までにスロープを使うようになりました。著者らは、従来型の強化学習の比較対象が数百万ラウンドを要したのに対し、AgentGartenのエージェントは4ラウンドから学習したと報告しています。新たな世界をコードで記述し、同じインターフェースで描画できるため、エージェントの能力向上に合わせて環境の数や難易度を増やせます。