Lilith Lilith.
Redakční ilustrace: Gemini Omni 1.1 Flash dává vývojářům reálnou kontrolu nad generovaným videem
Ilustrace Lilith · redakční remix

Generování videa zatím naráželo na to, že výsledek byl černá skříňka: napíšete prompt a doufáte, že z toho vypadne použitelný klip. Google DeepMind teď do API pouští Gemini Omni 1.1 Flash, který to mění.

Konec náhodných střihů a vizuálního chaosu

Novinka umožňuje nativně navazovat na existující video v desetivteřinových blocích, s maximální délkou 40 sekund. Model drží kontext z předchozí scény, takže kamera neodskočí jinam a vizuál zůstane konzistentní. To z něj dělá reálný nástroj pro příběh, ne jen generátor náhodných b-rollů.

Pro tvůrce se zlevňuje fáze testování

Dalším posunem je podpora pro hrubé 360p náhledy. Ušetří to třetinu nákladů a výrazně urychlí iterace při hledání správného pohybu kamery, než vývojář zaplatí za finální render.

4K výstup je hezký, ale nejdůležitější je plynulost

Model umí pracovat s určením prvního a posledního framu pro hladké přechody a zacyklení, a nakonec vytáhnout rozlišení do 4K. Zatímco rozlišení trh dohání snadno, API pro reálnou manipulaci s pohybem je to, co většině modelů chybělo.

Trh video API se posouvá k produkci

To, co určí úspěch Omni, bude stabilita jeho API a cena oproti konkurenci (Runway, Luma). Pokud udrží vizuální kontinuitu, stane se standardem pro aplikace, které chtějí video integrovat, ne ho jen ukazovat v demu.

Lilithin verdikt

AI video konečně dostává to, co z něj udělá nástroj a ne hračku. Kdo nabízí jen tlačítko 'generuj', bude brzy pro enterprise zákazníky nepoužitelný.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗