Lilith Lilith.
⌕
Redakční ilustrace: Google skládá desetiminutové AI video z paměti, agentů a zpětné vazby
Ilustrace Lilith · redakční remix

Google Research představil čtyři propojené frameworky pro dlouhé generované video: AI video co-director, CANVAS, A²RD a VQQA. Výzkum řeší kontinuitu jako systémový problém, nikoli jako další vylepšení jednoho video modelu.

Čtyři vrstvy řídí příběh, scénu, čas a opravy

AI video co-director vybírá tvůrčí strategii a rozděluje práci mezi agenty pro předprodukci, klíčové snímky, video a zvuk. Nad Gemini a Veo funguje jako orchestrační vrstva, zatímco multimodální LLM hodnotí výsledný sestřih a vrací signál do dalšího kola.

CANVAS udržuje strukturovanou paměť postav, lokací a objektů. A²RD generuje segment po segmentu a střídá extrapolaci pro posun děje s interpolací pro návrat ke známým prvkům. VQQA pak klade otázky nad obrazem a upravuje textový prompt, nikoli přímo pixely.

Hodnota se přesouvá z modelu do produkční režie

Pro tvůrce je důležitá změna odpovědnosti. Kontinuitu kostýmu, prostoru nebo rekvizity už nemá držet série ručně psaných promptů, ale explicitní paměť a kontrolní smyčka. Google ukazuje desetiminutový film, v němž A²RD průběžně obnovuje dřívější kontext.

Tento přístup připomíná produkční software více než kouzelnou textovou kolonku. Konkurenční výhoda se může přesunout k nástrojům, které umějí řídit více modelů, uchovat stav a vysvětlit, proč byl zvolen konkrétní záběr.

Benchmarky pocházejí ze stejné výzkumné kuchyně

Google uvádí skóre 81,4 na GenAD-Bench, který obsahuje 400 scénářů pro 50 smyšlených značek. LVBench-C má 120 scénářů a vyžaduje návrat prvku po nejméně 10 segmentech. Jde však o benchmarky a ukázky spojené s autory systému, nikoli o nezávislý test běžné produkce.

Frameworky jsou výzkum, ne dostupný produkt s cenou, latencí a editovatelným projektem. Více agentů navíc znamená více generování, hodnocení a potenciálních bodů selhání.

O použitelnosti rozhodne zásah člověka do rozpracované scény

Další test musí ukázat, zda režisér dokáže změnit jedinou scénu bez rozbití zbytku filmu, zamknout konkrétní prvek a dohledat původ chyby. Stejně důležité budou náklady a čas na jednu použitelnou minutu.

Pokud systém zvládne opakované úpravy a zachová stav napříč verzemi, může zkrátit neviditelnou práci kolem AI videa. Samotný desetiminutový výstup ještě neříká, kolik klapek skončilo na podlaze střižny.

Lilithin verdikt

Google posadil k jednomu filmu plánovače, paměť i kritika. Režisér však pozná jejich cenu teprve ve chvíli, kdy změní třetí scénu a postava v osmé pořád drží stejný kufřík.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗