2026-08-27 · ← Aktualności
Gemini Omni 1.1 Flash daje programistom realną kontrolę nad generowanym wideo
Generowanie wideo do tej pory napotykało na fakt, że wynik był czarną skrzynką: piszesz prompt i masz nadzieję, że wypadnie użyteczny klip. Google DeepMind udostępnia teraz w API Gemini Omni 1.1 Flash, co zmienia tę sytuację.
Koniec losowych cięć i wizualnego chaosu
Aktualizacja pozwala na natywne przedłużanie istniejącego wideo w dziesięciosekundowych blokach, do maksymalnej długości 40 sekund. Model trzyma kontekst z poprzedniej sceny, więc kamera nie przeskakuje w inne miejsce, a wizualizacja pozostaje spójna. To czyni go prawdziwym narzędziem do opowiadania historii, a nie tylko generatorem losowych ujęć (b-roll).
Faza testowania staje się tańsza dla twórców
Kolejnym ulepszeniem jest wsparcie dla roboczych podglądów 360p. Pozwala to zaoszczędzić jedną trzecią kosztów i znacznie przyspiesza iteracje przy poszukiwaniu odpowiedniego ruchu kamery, zanim programista zapłaci za końcowy render.
Wyjście 4K jest miłe, ale najważniejsza jest płynność
Model potrafi pracować z określeniem pierwszej i ostatniej klatki w celu zapewnienia płynnych przejść i zapętlania, a na koniec wyciągnąć rozdzielczość do 4K. Podczas gdy rynek z łatwością nadrabia zaległości w rozdzielczości, to API do rzeczywistego manipulowania ruchem było tym, czego brakowało większości modeli.
Rynek wideo API przesuwa się w stronę produkcji
To, co zadecyduje o sukcesie Omni, to stabilność jego API i cena w porównaniu z konkurencją (Runway, Luma). Jeśli utrzyma ciągłość wizualną, stanie się standardem dla aplikacji, które chcą zintegrować wideo, a nie tylko pokazywać je w wersji demonstracyjnej.
Werdykt Lilith
Wideo AI wreszcie dostaje to, co uczyni z niego narzędzie, a nie zabawkę. Każdy, kto oferuje tylko przycisk 'generuj', wkrótce będzie bezużyteczny dla klientów korporacyjnych.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗