VideoChat3:効率的なビデオ理解を実現する新モデル
HuggingFace2026年7月18日 (土)
- •南京大学の研究チームが、完全オープンかつ効率的なビデオ中心型マルチモーダル言語モデル「VideoChat3」を公開した。
- •4Bパラメータの同モデルは、I3D-ViTと適応型フレーム解像度技術を導入し、時空間処理の効率を大幅に向上させた。
- •VideoChat3は、ドメイン横断的な汎用性を高めるために3つの独自データセットであるVideoChat3-Academic2M、VideoChat3-LV116K、およびVideoChat3-OL617Kを使用している。
南京大学マルチメディアコンピューティンググループの研究チームは、ビデオを主軸としたマルチモーダル大規模言語モデル(MLLM)であるVideoChat3を公開した。このシステムは、広い汎用性と高い計算効率を両立させることを目的として設計されている。
パフォーマンス向上の核となるのは、Inflated 3D Vision Transformer(I3D-ViT)と「ストリーミングビデオ知覚のための適応型フレーム解像度」という2つの設計要素だ。これにより、物体移動と時系列の両方を理解する効率的な時空間表現が可能となり、訓練および推論に必要な計算コストを削減できる。
開発チームはスケーラブルなデータ合成パイプラインを構築し、それを用いてVideoChat3-Academic2M、VideoChat3-LV116K、VideoChat3-OL617Kという3つの高品質な訓練データセットを作成した。これらのデータセットは汎用ビデオから長尺動画、ストリーミングコンテンツまで幅広いシナリオを網羅しており、異なるビデオドメイン間での汎化性能を大幅に高めている。
各種シナリオにおけるベンチマークの結果、VideoChat3は同規模あるいはそれ以上のパラメータを持つ既存のオープンソース代替モデルを上回る性能を示した。4Bパラメータという軽量なサイズで高い効率を実現したこのプロジェクトは、訓練コード、戦略、データセットを含めて完全にオープンソースとして公開されている。