2026-09-23 · ← Novinky
Gemini 3.8 mění TTS z nabídky hlasů na režii výkonu
Google uvedl dva modely pro převod textu na řeč. Gemini 3.8 Flash TTS míří na tvorbu postav a detailní režii, zatímco Flash-Lite TTS je určený pro velkoobjemový dubbing, audio obsah a hlasové agenty. Oba se od 23. září zavádějí v Gemini API a Google AI Studio.
Hlas vzniká z promptu a replika dostává vlastní režii
Flash umí vytvořit nový hlas z popisu a řídit každou repliku podle tempa, emocí, přízvuku nebo zvuků běžné konverzace. Google uvádí podporu více než 100 jazyků a dialektů a knihovnu přes 2 000 produkčních hlasů. Vlastní profil lze uložit pro konzistentnější výkon v delším projektu.
Model dokáže také replikovat hlas z nahrávky dlouhé 30 sekund. Google u této funkce vyžaduje hlasový souhlas vlastníka předlohy. Gemini Notebook dostává Flash, Google Vids Flash-Lite a Gemini Enterprise má obě varianty získat přes API později.
Produkční výhodou je opakovatelnost výkonu
Pro tvůrce her, podcastů nebo lokalizace je cennější přesná režie než další ukázka příjemného hlasu. Možnost vrátit se ke stejné postavě, upravit jednu repliku a udržet akcent napříč scénami zkracuje práci, kterou dnes vyplňuje řetězec generování, poslechu a oprav.
Flash-Lite zároveň ukazuje, kde Google čeká objem: dubbing a voice agents. Rozdělení modelů odděluje dražší kreativní kontrolu od provozu, který bude citlivý na cenu a latenci. Google však v oznámení konkrétní cenu ani latenci neuvádí.
Souhlas a watermark neřeší celý život hlasu
Každý výstup má podle Googlu SynthID watermark a u replikace firma zmiňuje také C2PA credentials. Ověření souhlasu při vytvoření hlasu je důležitá brzda, ale samo neřeší pozdější odvolání licence, únik uloženého profilu ani použití výsledku mimo původně dohodnutý projekt.
Benchmarky jsou navíc převážně součástí příběhu dodavatele. Google uvádí skóre 71,4 v Hume AI Voice Design Benchmarku a 60,8 za modelování přízvuku. Pro nákupní rozhodnutí bude důležitější stabilita na dlouhém textu a v produkčním provozu.
Práva, cena a drift rozhodnou o nasazení
Sledujme, jak snadno lze hlas z projektu odstranit, auditovat souhlas a zachovat stejnou postavu po stovkách replik. Stejně podstatné budou veřejná cena Flash-Lite, reálná latence v Gemini API a chybovost SynthID po běžných úpravách audia. Teprve tahle provozní čísla oddělí studio od působivého playgroundu.
Lilithin verdikt
Google postavil režisérské studio, kde herec vznikne z 30 sekund audia. Teď musí dokázat, že když vlastník hlasu odejde ze scény, jeho digitální dvojník opravdu přestane hrát.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗