Google Research、AI動画の共同監督システムを発表
- •Google Research、GeminiとVeoで数分間の一貫した動画を生成する4つの枠組みを公開
- •Co-DirectorはGenAD-Benchで81.4点、CANVASは背景の連続性を21.6%改善
- •A²RDが10分の映画を制作、Co-DirectorとA²RDのコードを公開しCANVASは準備中
Google Researchは、短い映像を一貫性のある数分間の物語に変える、4つのエージェント型枠組みからなるAI動画共同監督システムを発表しました。GeminiとVeoで動作し、ほかの動画生成器にも対応します。基盤モデルのSynthID透かしも引き継ぎます。ショットごとに登場人物の服装や風景が変わる「アイデンティティのずれ」や、欠陥のある素材が後続のショットに影響する連鎖的な誤りへの対処を目指します。完成動画の問題を原因となったプロンプトまでさかのぼることを、チームは信用割当問題と説明しています。
第1の枠組みCo-DirectorはCOLM 2026で採択され、マルチアームド・バンディット探索で創作方針、物語形式、美的類型を選びます。オーケストレーター・エージェントが構成を選択し、プリプロダクション・エージェントが絵コンテを作成した後、キーフレーム、動画、音声の各サブエージェントが素材を生成します。マルチモーダル大規模言語モデルの判定役が結果を採点し、要素別の報酬を探索過程に返します。Co-DirectorはGenAD-Benchで81.4点、人間による評価で5点満点中3.96点を記録し、ランダム探索の基準値75.7点を上回りました。同ベンチマークは、50ブランドの架空製品200点を扱う広告シナリオ400件で構成されています。
EMNLP 2026で採択されたCANVASは、登場人物、場所、物体の状態を保存し、同じ場面が再登場した際に視覚的な参照情報を呼び出します。博物館の強盗を題材にしたテストでは、AutoStudioで盗人の帽子が失われ、Gemini-3.1-Proでは宝石が変わりましたが、CANVASは両方の一貫性を保ちました。背景の連続性を21.6%、登場人物の一貫性を9.6%、小道具の一貫性を7.6%改善しました。Agentic Autoregressive Diffusionの略称であるA²RDは、学習を必要としないシステムです。マルチモーダル動画メモリーを使い、各区間を「検索、合成、改善、更新」のループで処理します。新しい物語の展開を加える作業と、再登場する要素を補完する作業を交互に行います。Googleは10分間の連続映画を公開しました。1分から10分の動画を使った結果では、一貫性が最大30%、物語のまとまりが最大20%向上しました。
第4の枠組みVQQA(動画品質の質問応答)は、各プロンプトについて視覚に関する質問を作成し、動画と言語を扱うモデルの批評を使って、モデル内部にアクセスせずにテキストプロンプトを修正します。反復の最後の結果をそのまま採用するのではなく、全反復から最良の結果を選ぶ「全体選択」段階も設けています。標準的な生成と比べ、T2V-CompBenchで11.57%、VBench2で8.43%の絶対向上を記録しました。Googleは、再登場する場面や変化した小道具の状態を試すHardContinuityBenchと、重要な素材が少なくとも10区間消えた後に戻る120のシナリオを含むLVBench-Cも開発しました。Co-DirectorとA²RDのコードは公開済みで、CANVASのコードは準備中です。全体のパイプラインはGoogleの製品ではありません。