Black Forest Labs、ロボット制御モデル「FLUX 3」を発表
- •Black Forest Labsとmimicが、ロボット制御向けの動画アクションモデル「FLUX-mimic」をリリースした。
- •FLUX 3は単一のバックボーンで画像、動画、音声、ロボットの動作予測を統合的に処理する。
- •アウディの生産ラインでテストされた本モデルは、101msという高速な反応時間を実現した。
Black Forest Labs(BFL)は、音声や視覚コンテンツの生成と物理ロボットの制御が可能なマルチモーダル基盤モデル「FLUX 3」を2026年7月23日に発表した。同社はロボット企業mimicと協力し、動画アクションモデル「FLUX-mimic」を開発。アウディの生産ラインで試験運用されている。FLUX 3の学習において、動画予測が計算コストの95%以上を占め、音声予測は720p動画トークン全体の0.5%未満である。動作予測は動画内の物理的現実に関連するモダリティとして組み込まれた。
大規模学習の初期段階では、動作予測の統合によりテキストから動画、画像から動画への生成品質が最大10%低下したが、3500ステップの学習後に品質を回復しつつ動作予測能力を獲得した。FLUX-mimicは、FLUX 3のバックボーンから得た中間特徴で学習する軽量なアクションデコーダーを採用している。このアーキテクチャには、生成学習と表現学習を統合し、高品質で分離された世界モデルを生成するフレームワーク「Self-Flow」が利用されている。
ベンチマークによると、FLUX-mimicはバックボーンを微調整することで従来のVision-Language-Actionモデルを上回る成功率を記録した。学習効率も高く、実験によっては「Self-Flow」非採用モデルの半分のステップ数で学習が完了する。工場環境では、電子制御ユニットの挿入やシール、ケーブルといった柔軟な素材の取り扱いが可能だ。FLUX-mimicはNVIDIA RTX 5090 GPU上で80ms未満で世界表現を生成でき、最適化されたスタックにより、人間と同等レベルの101msの反応時間を達成している。アウディは現在、従来の自動化では困難だった柔軟な部品操作タスクで本モデルを試験運用している。