AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Kwai、マルチモーダルモデル「Keye-VL-2.0」を発表

Kwai、マルチモーダルモデル「Keye-VL-2.0」を発表

HuggingFace·2026年6月11日 (木)
  • •Kwai Keye-VL-2.0-30B-A3Bは、長編動画理解のために3BパラメータのMixture-of-Expertsアーキテクチャを採用している。
  • •DeepSeek Sparse Attentionを統合し、動画データに対して損失のない256Kコンテキスト処理を実現した。
  • •Multi-Teacher On-Policy Distillationを実装し、エージェント間の協調性向上と壊滅的忘却の低減を図った。
  • •Kwai Keye-VL-2.0-30B-A3Bは、長編動画理解のために3BパラメータのMixture-of-Expertsアーキテクチャを採用している。
  • •DeepSeek Sparse Attentionを統合し、動画データに対して損失のない256Kコンテキスト処理を実現した。
  • •Multi-Teacher On-Policy Distillationを実装し、エージェント間の協調性向上と壊滅的忘却の低減を図った。

Kwaiチームは2026年6月9日、オープンソースのマルチモーダル基盤モデル「Keye-VL-2.0-30B-A3B」を公開した。本モデルはMixture-of-Experts (MoE) アーキテクチャを活用しており、推論時には3Bのパラメータをアクティブにする。主な技術革新として、DeepSeek Sparse Attention (DSA) をGQAベースのマルチモーダルアーキテクチャに適応させ、1時間規模の動画解析において損失のない256Kのコンテキスト処理を可能にした。長距離の時間依存関係を管理し情報の冗長性を回避するため、異種混合型のViT-LM並列処理や独自のDSAカーネルといった特殊な学習インフラが採用されている。

開発チームは、マルチタスク調整における壊滅的忘却の課題に対し、Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) を導入した。この手法は、オンポリシーのロールアウトを通じて密なトークンレベルの教師フィードバックを統合し、Context-RLやVideo-RL技術を用いてモデルを最適化する。これにより、コード、ツール、検索といったシナリオ間でのネイティブなエージェント連携が可能となり、マルチモーダルな自己修正機能も備えている。

実験結果によると、Keye-VL-2.0-30B-A3Bはその規模において最先端の性能を達成している。TimeLensベンチマークでの高精度な時間ローカライゼーションや、Video-MME-v2およびLongVideoBenchにおける長編動画理解で優れた結果を示した。研究チームは、スケーラブルなマルチモーダルエージェントアプリケーションの開発を支援するため、モデルのチェックポイントを公開している。

Kwaiチームは2026年6月9日、オープンソースのマルチモーダル基盤モデル「Keye-VL-2.0-30B-A3B」を公開した。本モデルはMixture-of-Experts (MoE) アーキテクチャを活用しており、推論時には3Bのパラメータをアクティブにする。主な技術革新として、DeepSeek Sparse Attention (DSA) をGQAベースのマルチモーダルアーキテクチャに適応させ、1時間規模の動画解析において損失のない256Kのコンテキスト処理を可能にした。長距離の時間依存関係を管理し情報の冗長性を回避するため、異種混合型のViT-LM並列処理や独自のDSAカーネルといった特殊な学習インフラが採用されている。

開発チームは、マルチタスク調整における壊滅的忘却の課題に対し、Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) を導入した。この手法は、オンポリシーのロールアウトを通じて密なトークンレベルの教師フィードバックを統合し、Context-RLやVideo-RL技術を用いてモデルを最適化する。これにより、コード、ツール、検索といったシナリオ間でのネイティブなエージェント連携が可能となり、マルチモーダルな自己修正機能も備えている。

実験結果によると、Keye-VL-2.0-30B-A3Bはその規模において最先端の性能を達成している。TimeLensベンチマークでの高精度な時間ローカライゼーションや、Video-MME-v2およびLongVideoBenchにおける長編動画理解で優れた結果を示した。研究チームは、スケーラブルなマルチモーダルエージェントアプリケーションの開発を支援するため、モデルのチェックポイントを公開している。

原文(英語)を読む·2026年6月11日
#multimodal#moe#video understanding#agentic ai#sparse attention