Lilith Lilith.
CS EN PL

OpenAI 3. srpna 2026 zveřejnila engineering post o tom, jak za šest měsíců postavila realtime systém pro GPT-Live, třetí generaci hlasu v ChatGPT. Jádro změny: voice model je full-duplex, umí poslouchat a mluvit zároveň, a z audio path pryč šel samostatný turn detector. Hlubší reasoning a tool use jdou asynchronně na frontier model (v příkladu GPT-5.5), aniž by musely přerušit tok řeči.

Full-duplex model řídí hovor, turn detector už nestojí v cestě

Starší voice stacky dědily turn-based logiku textových LLM: nejdřív detektor rozhodl, jestli uživatel dořekl, teprve pak se spustil velký model. Špatný odhad řezal do řeči nebo přidával latenci. GPT-Live nechává řízení konverzace na voice modelu: audio teče dovnitř i ven kontinuálně, zatímco delegace, tool use a persist hovoru běží mimo live path.

Aby to drželo ve škále ChatGPT, OpenAI oddělila media frontend od aplikační logiky. Audio má dedikovanou rychlou dráhu, pomalý tool call nesmí stallovat frametime. Media frontend přepsali z Python asyncio do Go; p95 smoothness nové cesty prý sedí na úrovni dřívějšího p50. Transport drží WebRTC a k rychlejšímu startu session přidali WARP (WebRTC Abridged Roundtrip Protocol) a Instant Connect, aby se snížil počet network round tripů před prvním audio framem.

Pro produktové týmy se hlas stává kanálem pro agenty, ne jen TTS chat

Help Center potvrzuje produktové důsledky: Live běží na GPT-Live-1 u placených plánů a GPT-Live-1 mini na free. Umí full-duplex, web search, memory, text i obrázky ve stejném chatu. Na startu neumí video, screen sharing, connected apps ani plugins; ty zůstávají u Advanced voice tam, kde dávají smysl.

Důležitější než „hezčí konverzace“ je architektura pro Voice in Work a Codex v desktop appce: hlasem spouštět úkoly, ptát se na progress a koordinovat víc agentů v jednom hovoru. Tím se voice mění z accessibility feature na řídicí povrch. Limity jsou tvrdé a plánované: Pro má výrazně vyšší kvóty, Go/Plus řádově hodiny, free jen omezený Live mini, Business/Enterprise často credit burn (např. 5 kreditů za minutu u flexible pricing). Jedna Live konverzace max 2 hodiny.

Demo full-duplex ještě neznamená spolehlivý meeting agent

OpenAI sama přiznává limity segmentace: UI potřebuje diskrétní turny, live path je kontinuální. Server proto skládá spekulativní i autoritativní pohled na to, kdo má floor, a krátké „mm hmm“ nemá zaneřádit historii. Překryv řeči, hluk a multi-speaker scény pořád kazí attribution. Live je primárně one-on-one, ne meeting recorder pro pět lidí u stolu.

Druhý strop je produktový. Bez video/screen share a bez plugins na startu Live nepokryje scénáře, které Advanced pořád drží. Enterprise/Edu navíc potřebují zapnout Voice i Early Model Access během early access okna. Kdo čeká „všude a hned“, narazí na admin policy a kvóty dřív než na model.

Stabilita přerušení a delegace pod zátěží ukáže, jestli je to opravdu live

Sledovat dává smysl tři věci. Za prvé, jestli full-duplex drží kvalitu přerušení mimo lab demo (kašlání, overlapping, slabý mikrofon). Za druhé, jestli async delegace na GPT-5.5 zůstane v human-acceptable latenci, když tool call není trivial search. Za třetí, adopce Voice in Work/Codex: jestli desktop uživatelé opravdu řídí agenty hlasem, nebo se vrátí k textu ve chvíli, kdy jde o auditovatelný brief.

Když tyhle tři signály sedí, OpenAI neprodává jen plynulejší TTS. Prodává hlas jako primární runtime pro agentní práci. Když nesedí, zůstane z toho příjemnější telefonát s chatbotem a Advanced si nechá specializované vstupy.

Lilithin verdikt

OpenAI tu nevyhrála hezčím hlasem. Vyhrála tím, že oddělila mluvení od myšlení: audio teče po rychlé dráze, zatímco search a tool use dobíhají bokem, aniž by rozbily hovor.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗