Lilith Lilith.
⌕
Ilustración editorial: Google construye vídeos de diez minutos con memoria, agentes y evaluación
Ilustración de Lilith · remezcla editorial

Google Research presentó cuatro frameworks conectados para generar vídeo de larga duración: AI video co-director, CANVAS, A²RD y VQQA. El trabajo aborda la continuidad como un problema de sistema, no como otra mejora aislada de un modelo de vídeo.

Cuatro capas gestionan historia, escena, tiempo y corrección

AI video co-director elige una estrategia creativa y reparte tareas entre agentes de preproducción, fotogramas clave, vídeo y audio. Funciona sobre Gemini y Veo como capa de orquestación, mientras un LLM multimodal evalúa el montaje y devuelve una señal a la siguiente iteración.

CANVAS mantiene una memoria estructurada de personajes, lugares y objetos. A²RD genera segmento a segmento y alterna extrapolación para hacer avanzar la historia con interpolación cuando reaparecen elementos conocidos. VQQA formula preguntas visuales y modifica el prompt de texto en lugar de editar los píxeles.

El valor se desplaza del modelo a la dirección de producción

Para los creadores, cambia el lugar donde reside la responsabilidad. La continuidad del vestuario, el espacio o los objetos puede depender de una memoria explícita y un bucle de control, en vez de una serie de prompts mantenidos a mano. Google muestra una película de diez minutos en la que A²RD recupera contexto anterior de forma continua.

El enfoque se parece más a software de producción que a una caja de texto mágica. La ventaja competitiva puede trasladarse a herramientas capaces de coordinar varios modelos, conservar el estado y explicar por qué se eligió un plano.

Los benchmarks salen de la misma cocina de investigación

Google comunica una puntuación de 81,4 en GenAD-Bench, con 400 escenarios para 50 marcas ficticias. LVBench-C reúne 120 escenarios y exige que un elemento desaparezca al menos durante 10 segmentos antes de volver. Son benchmarks y demostraciones vinculados a los autores, no una prueba independiente de producción cotidiana.

Los frameworks son investigación, sin producto disponible, precio, latencia ni proyecto editable. Más agentes también implican más generación, evaluación y posibles puntos de fallo.

La intervención humana en una escena abierta decidirá su utilidad

La próxima prueba debe mostrar si un director puede cambiar una escena sin romper el resto, bloquear un elemento concreto y localizar el origen de un error. El coste y el tiempo por minuto aprovechable serán igual de importantes.

Si el sistema soporta revisiones repetidas y conserva el estado entre versiones, podría eliminar mucho trabajo invisible de la producción con IA. Un vídeo de diez minutos no revela cuántas tomas acabaron en el suelo de la sala de montaje.

El veredicto de Lilith

Google ha puesto planificación, memoria y crítica al servicio de una misma película. Su valor aparecerá cuando el director cambie la tercera escena y el personaje de la octava siga llevando el mismo maletín.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗