Kwai、マルチモーダルモデル「Keye-VL-2.0」を発表
- •Kwai Keye-VL-2.0-30B-A3Bは、長編動画理解のために3BパラメータのMixture-of-Expertsアーキテクチャを採用している。
- •DeepSeek Sparse Attentionを統合し、動画データに対して損失のない256Kコンテキスト処理を実現した。
- •Multi-Teacher On-Policy Distillationを実装し、エージェント間の協調性向上と壊滅的忘却の低減を図った。
Kwaiチームは2026年6月9日、オープンソースのマルチモーダル基盤モデル「Keye-VL-2.0-30B-A3B」を公開した。本モデルはMixture-of-Experts (MoE) アーキテクチャを活用しており、推論時には3Bのパラメータをアクティブにする。主な技術革新として、DeepSeek Sparse Attention (DSA) をGQAベースのマルチモーダルアーキテクチャに適応させ、1時間規模の動画解析において損失のない256Kのコンテキスト処理を可能にした。長距離の時間依存関係を管理し情報の冗長性を回避するため、異種混合型のViT-LM並列処理や独自のDSAカーネルといった特殊な学習インフラが採用されている。
開発チームは、マルチタスク調整における壊滅的忘却の課題に対し、Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) を導入した。この手法は、オンポリシーのロールアウトを通じて密なトークンレベルの教師フィードバックを統合し、Context-RLやVideo-RL技術を用いてモデルを最適化する。これにより、コード、ツール、検索といったシナリオ間でのネイティブなエージェント連携が可能となり、マルチモーダルな自己修正機能も備えている。
実験結果によると、Keye-VL-2.0-30B-A3Bはその規模において最先端の性能を達成している。TimeLensベンチマークでの高精度な時間ローカライゼーションや、Video-MME-v2およびLongVideoBenchにおける長編動画理解で優れた結果を示した。研究チームは、スケーラブルなマルチモーダルエージェントアプリケーションの開発を支援するため、モデルのチェックポイントを公開している。