Lilith Lilith.
⌕
Redaktionelle Illustration: Google baut zehnminütige KI-Videos aus Gedächtnis, Agenten und Feedback
Illustration von Lilith · redaktioneller Remix

Google Research stellte vier miteinander verbundene Frameworks für lange generierte Videos vor: AI video co-director, CANVAS, A²RD und VQQA. Die Arbeiten behandeln Kontinuität als Systemproblem und nicht als weiteres Upgrade eines einzelnen Videomodells.

Vier Ebenen steuern Handlung, Szene, Zeit und Korrektur

AI video co-director wählt eine kreative Strategie und verteilt Aufgaben an Agenten für Vorproduktion, Keyframes, Video und Audio. Über Gemini und Veo dient er als Orchestrierungsebene, während ein multimodales LLM den fertigen Schnitt bewertet und ein Signal in die nächste Runde zurückgibt.

CANVAS führt ein strukturiertes Gedächtnis für Figuren, Orte und Objekte. A²RD generiert Abschnitt für Abschnitt und wechselt zwischen Extrapolation für den Fortgang der Handlung und Interpolation bei der Rückkehr bekannter Elemente. VQQA stellt visuelle Fragen und überarbeitet den Textprompt, anstatt Pixel direkt zu bearbeiten.

Der Wert wandert vom Modell zur Produktionsregie

Für Kreative verschiebt sich die Verantwortung. Kontinuität bei Kostüm, Raum und Requisiten kann durch explizites Gedächtnis und eine Kontrollschleife gesichert werden, statt durch eine manuell gepflegte Promptfolge. Google zeigt einen zehnminütigen Film, in dem A²RD fortlaufend früheren Kontext abruft.

Der Ansatz ähnelt eher Produktionssoftware als einem magischen Textfeld. Wettbewerbsvorteile könnten zu Werkzeugen wandern, die mehrere Modelle koordinieren, Zustände bewahren und die Auswahl einer Einstellung erklären.

Die Benchmarks stammen aus derselben Forschungsküche

Google meldet 81,4 Punkte auf GenAD-Bench mit 400 Szenarien für 50 fiktive Marken. LVBench-C umfasst 120 Szenarien und verlangt, dass ein Element mindestens 10 Segmente lang fehlt, bevor es zurückkehrt. Benchmarks und Demos stammen jedoch aus dem Umfeld der Systemautoren, nicht aus unabhängiger Alltagsproduktion.

Die Frameworks sind Forschung und kein verfügbares Produkt mit Preis, Latenz und editierbarer Projektdatei. Mehr Agenten bedeuten zudem mehr Generierung, Bewertung und mögliche Fehlerstellen.

Eingriffe in eine unfertige Szene entscheiden über den Nutzen

Der nächste Test muss zeigen, ob eine Regisseurin eine einzelne Szene ändern kann, ohne den übrigen Film zu beschädigen, ein bestimmtes Element sperren und die Fehlerquelle nachvollziehen kann. Kosten und Zeit pro nutzbarer Minute sind ebenso wichtig.

Übersteht das System wiederholte Änderungen und bewahrt den Zustand über Versionen hinweg, kann es viel unsichtbare Arbeit aus der KI-Videoproduktion entfernen. Ein zehnminütiges Ergebnis verrät noch nicht, wie viele Takes auf dem Boden des Schneideraums landeten.

Liliths Urteil

Google setzt Planer, Gedächtnis und Kritiker an denselben Film. Ihr Wert zeigt sich, wenn die Regie Szene drei ändert und die Figur in Szene acht noch denselben Koffer trägt.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗