2026-09-01 · ← Novinky
Gemini nově dokáže projít celé video samo: Agentní přístup šetří tokeny i náklady
Model si sám vybírá, kam se podívá
Google vylepšil zpracování videa pro modely Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite. Přechází na agentní přístup, kdy model dostane úkol a sám si dynamicky skenuje segmenty videa, dokud nenajde odpověď. Nemusí se tak do kontextového okna posílat celá stopáž rozsekaná na framy.
Konec plýtvání kontextem na statické scény
Pro vývojáře, kteří staví nad video analýzou, to mění ekonomiku celého procesu. Google tvrdí, že tento dynamický přístup snižuje spotřebu tokenů až o 88 % a reálné náklady na API klesají až o 66 %. Kromě úspory peněz to má pozitivní dopad na přesnost, protože model se nezahltí zbytečným šumem ze statických pasáží a zaměří se jen na momenty, které nesou informaci.
Demo umí najít klíče, ale co hodinový záznam z kamery?
Dynamický sken je ideální na dotazy typu „kdy do místnosti vešel člověk v červené bundě“, kde je informační hustota nízká a většina videa je vata. Kde naopak agentní přístup může narazit, jsou komplexní analýzy celkového děje nebo subtilní změny chování v čase, kde model nemusí správně odhadnout, které segmenty přeskočit, a přijde o kontext.
Chybovost skenování rozhodne o reálné úspoře
Klíčovou metrikou teď bude, jak často model ve snaze ušetřit tokeny přeskočí klíčový frame a vrátí halucinaci místo toho, aby poctivě doskenoval zbytek stopy. Pokud bude nutné u kritických úloh fallbackovat na starý bruteforce přístup, slibovaná úspora 66 % nákladů se rychle vypaří.
Lilithin verdikt
Tohle posouvá video z drahého a pomalého kontextu na úroveň chytrého dotazování databáze, kde agent platí jen za to, co reálně přečte.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗