Lilith Lilith.
⌕
Redakční ilustrace: Gemini 3.8 Live dostal tvář, která mluví v 97 jazycích
Ilustrace Lilith · redakční remix

Google spojil živý dialog Gemini 3.8 Live s průběžně generovaným videem avatara. Enterprise agent tak může uživatele poslouchat, sledovat obrazový vstup, mluvit a během konverzace měnit výraz, aniž by čekal na dokončení každého nástroje.

Live Avatar propojuje řeč, obraz a nástroje v jednom proudu

Gemini 3.8 Live with Live Avatar generuje zvuk a video téměř v reálném čase. Google uvádí přesný lip sync, plynulé střídání mluvčích a mimiku. Asynchronní function calling dovoluje agentovi na pozadí načítat data nebo spustit nástroj a mezitím pokračovat v rozhovoru.

Systém umí přecházet mezi 97 jazyky a průběžně přizpůsobovat pohyb úst i výraz. Google nabízí knihovnu přednastavených postav. Z kvalitního referenčního obrázku lze vytvořit vlastní avatar se zachovaným vzhledem značky nebo postavy, tato možnost je ale dostupná jen firmám na allowlistu. Veškerý generovaný zvuk a obraz má nést watermark SynthID.

Firemní agent získává sociální rozhraní, ne jen další výstupní formát

Pro zákaznickou podporu, onboarding nebo interaktivní průvodce je tvář funkční vrstva. Uživatel vidí reakci během čekání na backend a může snáz poznat, kdy systém poslouchá, přemýšlí nebo odpovídá. Asynchronní nástroje jsou zde možná důležitější než samotná grafika, protože drží konverzaci při životě během práce na pozadí.

Pro produktové týmy se zároveň rozšiřuje plocha, kterou musí navrhovat a testovat. Vedle správnosti odpovědi přibývá soulad hlasu, mimiky, lip syncu, latence a stavu nástrojů. Chyba už nebude jen špatná věta. Může to být sebejistý úsměv při zamítnuté platbě.

Plynulá tvář může maskovat nepřesný nebo drahý backend

Oznámení neuvádí veřejné údaje o end to end latenci, chybovosti lip syncu, ceně video vrstvy ani výkonu při dlouhých špičkách. Dostupnost přes Gemini Enterprise také neznamená otevřený spotřebitelský produkt a vlastní identita avatara zůstává omezená povolením.

SynthID pomáhá s původem výstupu, ale neřeší souhlas osoby z referenční fotografie, přístupová práva ani správnost odpovědi. Enterprise nasazení bude potřebovat logy, jasné označení AI a cestu k člověku.

O výsledku rozhodne latence, cena relace a chování při chybě

První ostré signály přijdou z dlouhých zákaznických rozhovorů: zda se zvuk a obraz nerozejdou, zda nástroj na pozadí nezablokuje relaci a kolik stojí několikaminutový hovor. Stejně důležité bude, jak avatar přizná nejistotu nebo technickou chybu.

Google ukázal přesvědčivou prezentační vrstvu. Produkční hodnotu potvrdí teprve měření celého řetězce od mikrofonu přes function calling až po video, ne samotný dojem z tváře.

Lilithin verdikt

Google postavil za přepážku tvář, která umí 97 jazyků a při práci nástrojů nepřestává mluvit. Podnik ji ocení až tehdy, když se při chybě přestane usmívat a zavolá správného člověka.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗