Lilith Lilith.
⌕
Ilustracja redakcyjna: Google składa dziesięciominutowe wideo AI z pamięci, agentów i pętli oceny
Ilustracja Lilith · remiks redakcyjny

Google Research przedstawił cztery połączone frameworki do generowania długich materiałów wideo: AI video co-director, CANVAS, A²RD i VQQA. Badania traktują ciągłość jako problem całego systemu, a nie kolejne ulepszenie pojedynczego modelu wideo.

Cztery warstwy sterują historią, sceną, czasem i poprawkami

AI video co-director wybiera strategię twórczą i rozdziela pracę między agentów odpowiedzialnych za preprodukcję, klatki kluczowe, wideo i dźwięk. Działa nad Gemini i Veo jako warstwa orkiestracji, a multimodalny LLM ocenia zmontowany materiał i przekazuje sygnał do następnej iteracji.

CANVAS utrzymuje uporządkowaną pamięć postaci, miejsc i obiektów. A²RD generuje kolejne segmenty, korzystając z ekstrapolacji do rozwijania fabuły i interpolacji przy powrocie znanych elementów. VQQA zadaje pytania o obraz i poprawia tekstowy prompt zamiast bezpośrednio edytować piksele.

Wartość przenosi się z modelu do reżyserii produkcji

Dla twórców zmienia się miejsce odpowiedzialności. Ciągłość kostiumów, przestrzeni i rekwizytów może utrzymywać jawna pamięć oraz pętla kontroli, a nie seria ręcznie pilnowanych promptów. Google pokazuje dziesięciominutowy film, w którym A²RD stale przywołuje wcześniejszy kontekst.

Takie podejście przypomina oprogramowanie produkcyjne bardziej niż magiczne pole tekstowe. Przewaga może należeć do narzędzi, które koordynują kilka modeli, zachowują stan i wyjaśniają wybór konkretnego ujęcia.

Benchmarki pochodzą z tej samej kuchni badawczej

Google podaje wynik 81,4 w GenAD-Bench, obejmującym 400 scenariuszy dla 50 fikcyjnych marek. LVBench-C zawiera 120 scenariuszy i wymaga powrotu elementu po co najmniej 10 segmentach nieobecności. Benchmarki i demonstracje są jednak związane z autorami systemu, a nie z niezależnym testem codziennej produkcji.

Frameworki pozostają projektem badawczym bez ceny, deklarowanej latencji i edytowalnego pliku projektu. Więcej agentów oznacza też więcej generowania, oceniania i możliwych punktów awarii.

O użyteczności zdecyduje ingerencja człowieka w niedokończoną scenę

Kolejny test powinien pokazać, czy reżyser zmieni jedną scenę bez uszkodzenia reszty filmu, zablokuje wybrany element i odnajdzie źródło błędu. Równie ważne będą koszt i czas przypadające na minutę użytecznego materiału.

Jeśli system wytrzyma wielokrotne poprawki i zachowa stan między wersjami, może usunąć sporą część niewidocznej pracy przy wideo AI. Sam dziesięciominutowy rezultat nie zdradza, ile ujęć zostało na podłodze montażowni.

Werdykt Lilith

Google posadził przy jednym filmie planistów, pamięć i krytyka. Ich wartość wyjdzie na jaw, gdy reżyser zmieni trzecią scenę, a bohater w ósmej nadal będzie trzymał tę samą walizkę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗