RynnWorld-4D:ロボット操作の動的予測を強化
HuggingFace2026年7月9日 (木)
- •RynnWorld-4DはRGB、深度、光フローのデータを同期生成し、ロボットの4Dシーンダイナミクスをモデル化する。
- •モデルは2億5440万フレーム以上の操作動画を含むRynn4DDataset 1.0を用いて学習された。
- •RynnWorld-4D-Policyヘッドにより、4D表現を直接行動に変換し、ロボットのリアルタイム制御を実現する。
2026年7月7日、研究チームはロボット操作の4Dシーンダイナミクスを予測するマルチモーダル世界モデル「RynnWorld-4D」を発表した。このシステムは、単一のRGB-D画像と言語指示からRGB画像、深度マップ、光フローを同期して生成する「RGB-DF」と呼ばれるデータを構築する。視覚的特徴、幾何学的構造、時間的動きを統合することで、モデルは低レベルなロボットのエンドエフェクタ行動へ直接変換可能な表現空間を生成する。
アーキテクチャには、クロスモーダルアテンションと3D RoPEを組み合わせた3枝構造を採用し、空間的および時間的な整合性を確保した。この開発を支える「Rynn4DDataset 1.0」には、人間とロボットによるエゴセントリックな操作動画から抽出された2億5440万フレーム以上が含まれている。
リアルタイム制御を実現するため、研究チームはモデルの内部表現から直接ロボットの行動を抽出する「RynnWorld-4D-Policy」を開発した。この手法は1回のフォワードパスで行動を決定し、実行中の多段階ノイズ除去プロセスを回避する。実験結果では、実環境における両手操作タスクで最高性能を記録し、特に精度と協調性で優れた成果を示した。