Lilith Lilith.
⌕
編集イラスト: Google、記憶とエージェントで10分間のAI動画を構成
Lilithのイラスト · 編集リミックス

Google Researchは、長尺の生成動画に向けた4つの連携framework、AI video co-director、CANVAS、A²RD、VQQAを発表した。連続性を単体の動画モデルの性能ではなく、システム全体の問題として扱う研究だ。

4つの層が物語、シーン、時間、修正を管理する

AI video co-directorは創作方針を選び、プリプロダクション、キーフレーム、動画、音声の各agentに作業を割り当てる。GeminiとVeoの上でオーケストレーション層として動き、multimodal LLMが編集結果を評価して次の反復へ信号を返す。

CANVASは登場人物、場所、物体の構造化された記憶を維持する。A²RDはsegment単位で生成し、物語を進める外挿と、既知の要素を再登場させる内挿を切り替える。VQQAは映像について質問を作り、pixelを直接編集せずtext promptを修正する。

価値はモデルから制作の指揮系統へ移る

制作者にとって重要なのは、責任の置き場所が変わることだ。衣装、空間、小道具の連続性を、手作業で管理するprompt列ではなく、明示的な記憶と制御loopに任せられる。GoogleはA²RDが過去の文脈を継続的に参照する10分間の映像を示した。

この方式は魔法の入力欄より制作softwareに近い。複数モデルを連携させ、状態を保存し、特定のshotを選んだ理由を説明できるtoolが競争力を持つ可能性がある。

Benchmarkは同じ研究チームの設計である

Googleは、50の架空ブランドに対する400 scenarioを含むGenAD-Benchで81.4を報告した。LVBench-Cは120 scenarioを収録し、重要な要素が少なくとも10 segment消えた後に戻る条件を課す。ただし、これらのbenchmarkとdemoはシステム開発者に結び付いたもので、日常的な制作工程を第三者が検証した結果ではない。

各frameworkは研究段階であり、価格、latency、編集可能なproject fileを備えた製品として提供されてはいない。agentが増えれば、生成と評価の回数、故障点も増える。

未完成のシーンに人が介入できるかが実用性を決める

次の検証では、監督が1つのsceneだけを変更し、残りを壊さず、特定の素材を固定し、エラーの起点を追跡できるかを見る必要がある。利用可能な1分を得るための費用と時間も重要だ。

反復修正に耐え、version間で状態を維持できれば、AI動画制作に隠れていた作業を大きく減らせる。10分間の完成映像だけでは、編集室の床に何take落ちたかは分からない。

Lilithの判定

Googleは計画役、記憶役、批評役を1本の映画に配置した。第3sceneを直しても、第8sceneの人物が同じ鞄を持っている。その時に初めて、この仕組みの価値が見える。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗