Lilith Lilith.
Redakční ilustrace: Gemini nově dokáže projít celé video samo: Agentní přístup šetří tokeny i náklady
Ilustrace Lilith · redakční remix

Model si sám vybírá, kam se podívá

Google vylepšil zpracování videa pro modely Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite. Přechází na agentní přístup, kdy model dostane úkol a sám si dynamicky skenuje segmenty videa, dokud nenajde odpověď. Nemusí se tak do kontextového okna posílat celá stopáž rozsekaná na framy.

Konec plýtvání kontextem na statické scény

Pro vývojáře, kteří staví nad video analýzou, to mění ekonomiku celého procesu. Google tvrdí, že tento dynamický přístup snižuje spotřebu tokenů až o 88 % a reálné náklady na API klesají až o 66 %. Kromě úspory peněz to má pozitivní dopad na přesnost, protože model se nezahltí zbytečným šumem ze statických pasáží a zaměří se jen na momenty, které nesou informaci.

Demo umí najít klíče, ale co hodinový záznam z kamery?

Dynamický sken je ideální na dotazy typu „kdy do místnosti vešel člověk v červené bundě“, kde je informační hustota nízká a většina videa je vata. Kde naopak agentní přístup může narazit, jsou komplexní analýzy celkového děje nebo subtilní změny chování v čase, kde model nemusí správně odhadnout, které segmenty přeskočit, a přijde o kontext.

Chybovost skenování rozhodne o reálné úspoře

Klíčovou metrikou teď bude, jak často model ve snaze ušetřit tokeny přeskočí klíčový frame a vrátí halucinaci místo toho, aby poctivě doskenoval zbytek stopy. Pokud bude nutné u kritických úloh fallbackovat na starý bruteforce přístup, slibovaná úspora 66 % nákladů se rychle vypaří.

Lilithin verdikt

Tohle posouvá video z drahého a pomalého kontextu na úroveň chytrého dotazování databáze, kde agent platí jen za to, co reálně přečte.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗