2026-07-30 · ← Radar
Gemini Robotics ER 2 mění roboty z vykonavatelů na hlídače vlastních chyb
Roboti teď sledují, co reálně udělali
Google DeepMind uvádí Gemini Robotics ER 2, vylepšenou verzi modelu určeného pro fyzické agenty. Zatímco předchozí systémy většinou naslepo prováděly zadanou sekvenci pohybů, nová verze se opírá o kontinuální zpracování videa. Model funguje jako kontrolní vrstva, která v reálném čase sleduje video feed z prostředí a porovnává, jestli se robotická ruka skutečně dostala tam, kam měla, a jestli úkol dopadl úspěšně.
Vedle porozumění videu přináší ER 2 lepší orchestraci nástrojů a schopnost koordinovat více robotů naráz v jednom sdíleném prostoru. Vývojáři k modelu dostávají přístup přes Gemini API a Google AI Studio, ovšem s explicitním zákazem nasazení v bezpečnostně kritických oblastech typu zdravotnictví nebo doprava.
Vylepšená navigace pro průmyslové nasazení
Pro integrátory a vývojářské týmy v průmyslu se tím mění architektura řízení. Doteď bylo nutné stavět složité stavové automaty, které řešily každou možnou odchylku. Schopnost modelu průběžně sledovat vlastní postup znamená, že se řízení přesouvá od pevných scénářů k zadávání cílového stavu.
Sdílené porozumění prostoru také zlevňuje a zjednodušuje nasazení více robotů od různých výrobců. Místo toho, aby každý stroj fungoval ve vlastním sile s dedikovaným systémem vidění, ER 2 dokáže fungovat jako centrální mozek, který na základě vizuálního vstupu rozděluje úkoly napříč hardwarem.
Zákaz ukazuje na nespolehlivost v kritických momentech
Omezení pro zdravotnictví a dopravu jasně ukazuje, kde leží skutečné limity dnešní generace modelů pro robotiku. Porozumění videu funguje skvěle v továrních halách a skladech, kde chyba znamená upuštěnou krabici, nikoliv ohrožení lidského života.
Zpracování videa v reálném čase je navíc výpočetně extrémně drahé. ER 2 musí neustále vyhodnocovat obrovské množství vizuálních dat, což klade velké nároky na lokální konektivitu a cloudovou infrastrukturu Googlu. V reálném produkčním prostředí, kde může docházet k výpadkům spojení, se tak model stává potenciálním úzkým hrdlem.
Rozhodne adopce mimo laboratoře Googlu
Důkazem o životaschopnosti modelu nebude demo video od DeepMindu, ale ochota výrobců hardwaru napojit své stroje na API třetí strany. Bude důležité sledovat, jestli velké industriální firmy přistoupí na to, že logiku jejich robotů bude řídit cloudový model Googlu, nebo jestli dají přednost vlastním lokálním, byť méně pokročilým řešením.
Lilithin verdikt
Google se nesnaží prodat chytřejší kameru. Jde mu o to stát se centrálním operačním systémem pro každou robotickou paži v továrně, bez ohledu na to, čí logo má vyražené na hardwaru.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗