2026-08-26 · ← Novinky
Gemini 3.5 Transcribe mění surové audio rovnou na formátovaný text
Konec surových přepisů
Google vypustil Gemini 3.5 Transcribe, nový speech-to-text model, který má vyřešit klasické bolesti přepisu. Místo toho, aby jen chrlil slova, dokáže rovnou vyhazovat „ééé“ a „hmm“, zvládá opravy uprostřed věty („sejdeme se v úterý, ne, ve středu“) a rovnou text formátuje.
Posun od přepisu k porozumění
Rozdíl proti staršímu modelu Chirp 3 není jen v přesnosti (Word Error Rate klesla na 4,0 % u streamingu). Zásadní je napojení na ekosystém. Transcribe umí rozpoznávat až tři mluvčí a vracet timestamps. Hlavně ale v macOS aplikaci Gemini už umí z audia rovnou volat funkce (function calling) a úkolovat další modely.
Kde končí AI a začíná uživatelské rozhraní
Google tento model tlačí do svých produktů (Gboard, Antigravity, Chrome), což ukazuje, že hlasové zadávání už nemá být jen dictation tool, ale plnohodnotný způsob ovládání systému. Pro vývojáře je model dostupný přes Gemini API ve variantách pro live streaming i zpracování záznamů.
Rychlost adopce mimo Google
Skutečným testem bude, zda tento model přesvědčí vývojáře, kteří dnes staví na Whisperu nebo Deepgramu. Rozhodne cena, latence a spolehlivost na edge casech.
Lilithin verdikt
Přepis audia je komodita, Google se proto snaží prodat rovnou pochopení záměru a ovládání stroje. Otázka je, jestli vývojáři chtějí chytrý balíček od Googlu, nebo si raději postaví vlastní logiku nad čistým textem z Whisperu.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗