2026-09-24 · ← ニュース
Google、記憶とエージェントで10分間のAI動画を構成
Google Researchは、長尺の生成動画に向けた4つの連携framework、AI video co-director、CANVAS、A²RD、VQQAを発表した。連続性を単体の動画モデルの性能ではなく、システム全体の問題として扱う研究だ。
4つの層が物語、シーン、時間、修正を管理する
AI video co-directorは創作方針を選び、プリプロダクション、キーフレーム、動画、音声の各agentに作業を割り当てる。GeminiとVeoの上でオーケストレーション層として動き、multimodal LLMが編集結果を評価して次の反復へ信号を返す。
CANVASは登場人物、場所、物体の構造化された記憶を維持する。A²RDはsegment単位で生成し、物語を進める外挿と、既知の要素を再登場させる内挿を切り替える。VQQAは映像について質問を作り、pixelを直接編集せずtext promptを修正する。
価値はモデルから制作の指揮系統へ移る
制作者にとって重要なのは、責任の置き場所が変わることだ。衣装、空間、小道具の連続性を、手作業で管理するprompt列ではなく、明示的な記憶と制御loopに任せられる。GoogleはA²RDが過去の文脈を継続的に参照する10分間の映像を示した。
この方式は魔法の入力欄より制作softwareに近い。複数モデルを連携させ、状態を保存し、特定のshotを選んだ理由を説明できるtoolが競争力を持つ可能性がある。
Benchmarkは同じ研究チームの設計である
Googleは、50の架空ブランドに対する400 scenarioを含むGenAD-Benchで81.4を報告した。LVBench-Cは120 scenarioを収録し、重要な要素が少なくとも10 segment消えた後に戻る条件を課す。ただし、これらのbenchmarkとdemoはシステム開発者に結び付いたもので、日常的な制作工程を第三者が検証した結果ではない。
各frameworkは研究段階であり、価格、latency、編集可能なproject fileを備えた製品として提供されてはいない。agentが増えれば、生成と評価の回数、故障点も増える。
未完成のシーンに人が介入できるかが実用性を決める
次の検証では、監督が1つのsceneだけを変更し、残りを壊さず、特定の素材を固定し、エラーの起点を追跡できるかを見る必要がある。利用可能な1分を得るための費用と時間も重要だ。
反復修正に耐え、version間で状態を維持できれば、AI動画制作に隠れていた作業を大きく減らせる。10分間の完成映像だけでは、編集室の床に何take落ちたかは分からない。
Lilithの判定
Googleは計画役、記憶役、批評役を1本の映画に配置した。第3sceneを直しても、第8sceneの人物が同じ鞄を持っている。その時に初めて、この仕組みの価値が見える。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗