2026-09-24 · ← Novinky
Google skládá desetiminutové AI video z paměti, agentů a zpětné vazby
Google Research představil čtyři propojené frameworky pro dlouhé generované video: AI video co-director, CANVAS, A²RD a VQQA. Výzkum řeší kontinuitu jako systémový problém, nikoli jako další vylepšení jednoho video modelu.
Čtyři vrstvy řídí příběh, scénu, čas a opravy
AI video co-director vybírá tvůrčí strategii a rozděluje práci mezi agenty pro předprodukci, klíčové snímky, video a zvuk. Nad Gemini a Veo funguje jako orchestrační vrstva, zatímco multimodální LLM hodnotí výsledný sestřih a vrací signál do dalšího kola.
CANVAS udržuje strukturovanou paměť postav, lokací a objektů. A²RD generuje segment po segmentu a střídá extrapolaci pro posun děje s interpolací pro návrat ke známým prvkům. VQQA pak klade otázky nad obrazem a upravuje textový prompt, nikoli přímo pixely.
Hodnota se přesouvá z modelu do produkční režie
Pro tvůrce je důležitá změna odpovědnosti. Kontinuitu kostýmu, prostoru nebo rekvizity už nemá držet série ručně psaných promptů, ale explicitní paměť a kontrolní smyčka. Google ukazuje desetiminutový film, v němž A²RD průběžně obnovuje dřívější kontext.
Tento přístup připomíná produkční software více než kouzelnou textovou kolonku. Konkurenční výhoda se může přesunout k nástrojům, které umějí řídit více modelů, uchovat stav a vysvětlit, proč byl zvolen konkrétní záběr.
Benchmarky pocházejí ze stejné výzkumné kuchyně
Google uvádí skóre 81,4 na GenAD-Bench, který obsahuje 400 scénářů pro 50 smyšlených značek. LVBench-C má 120 scénářů a vyžaduje návrat prvku po nejméně 10 segmentech. Jde však o benchmarky a ukázky spojené s autory systému, nikoli o nezávislý test běžné produkce.
Frameworky jsou výzkum, ne dostupný produkt s cenou, latencí a editovatelným projektem. Více agentů navíc znamená více generování, hodnocení a potenciálních bodů selhání.
O použitelnosti rozhodne zásah člověka do rozpracované scény
Další test musí ukázat, zda režisér dokáže změnit jedinou scénu bez rozbití zbytku filmu, zamknout konkrétní prvek a dohledat původ chyby. Stejně důležité budou náklady a čas na jednu použitelnou minutu.
Pokud systém zvládne opakované úpravy a zachová stav napříč verzemi, může zkrátit neviditelnou práci kolem AI videa. Samotný desetiminutový výstup ještě neříká, kolik klapek skončilo na podlaze střižny.
Lilithin verdikt
Google posadil k jednomu filmu plánovače, paměť i kritika. Režisér však pozná jejich cenu teprve ve chvíli, kdy změní třetí scénu a postava v osmé pořád drží stejný kufřík.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗