Lilith Lilith.
Redakční ilustrace: Gemini 3.5 Transcribe mění surové audio rovnou na formátovaný text
Ilustrace Lilith · redakční remix

Konec surových přepisů

Google vypustil Gemini 3.5 Transcribe, nový speech-to-text model, který má vyřešit klasické bolesti přepisu. Místo toho, aby jen chrlil slova, dokáže rovnou vyhazovat „ééé“ a „hmm“, zvládá opravy uprostřed věty („sejdeme se v úterý, ne, ve středu“) a rovnou text formátuje.

Posun od přepisu k porozumění

Rozdíl proti staršímu modelu Chirp 3 není jen v přesnosti (Word Error Rate klesla na 4,0 % u streamingu). Zásadní je napojení na ekosystém. Transcribe umí rozpoznávat až tři mluvčí a vracet timestamps. Hlavně ale v macOS aplikaci Gemini už umí z audia rovnou volat funkce (function calling) a úkolovat další modely.

Kde končí AI a začíná uživatelské rozhraní

Google tento model tlačí do svých produktů (Gboard, Antigravity, Chrome), což ukazuje, že hlasové zadávání už nemá být jen dictation tool, ale plnohodnotný způsob ovládání systému. Pro vývojáře je model dostupný přes Gemini API ve variantách pro live streaming i zpracování záznamů.

Rychlost adopce mimo Google

Skutečným testem bude, zda tento model přesvědčí vývojáře, kteří dnes staví na Whisperu nebo Deepgramu. Rozhodne cena, latence a spolehlivost na edge casech.

Lilithin verdikt

Přepis audia je komodita, Google se proto snaží prodat rovnou pochopení záměru a ovládání stroje. Otázka je, jestli vývojáři chtějí chytrý balíček od Googlu, nebo si raději postaví vlastní logiku nad čistým textem z Whisperu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗