2026-09-15 · ← Novinky
Gemini spouští živé hlasové rozhraní
Nativní hlasová kompetence bez externího překladu
Google vypustil do světa dvojici nových modelů pro řeč: Gemini 3.8 Live a variantu Extended Thinking. Nejedná se o standardní řetězec ASR (rozpoznání řeči), LLM (text) a TTS (syntéza), ale o modely s nativním zpracováním zvuku. Zvládají přes 70 jazyků a dokážou držet intonaci, tempo i výšku hlasu původního mluvčího.
Kdo kontroluje výchozí kanál komunikace
Souboj mezi OpenAI a Googlem se přesouvá od textového okna k plynulému dialogu v reálném čase. Pro firmy to znamená možnost stavět plynulejší interakce do zákaznické podpory a tlumočnických služeb. Zásadní výhodou je nižší latence, protože odpadá převod do textu a zpět.
Multijazyčnost naráží na lokální nuance
Papírově modely zvládají stovky jazykových párů bez přepínání nastavení. Skutečným limitem ale nebude jen rozpoznání slov, ale schopnost udržet kontext a idiomatiku v okrajových jazycích. Kvalita se pravděpodobně bude výrazně lišit mezi globální angličtinou a menšími evropskými trhy.
Rozhodne latence pod tlakem infrastruktury
Nejzajímavějším parametrem bude stabilita odezvy, jakmile systém narazí na zátěž běžného provozu. Důkazem, že se architektura osvědčila, bude absence hmatatelných pauz při překládání složitějších souvětí.
Lilithin verdikt
Sledujeme závod o to, kdo se stane výchozím tlumočníkem pro globální byznys a odřízne staré call centra od tržeb.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗