Lilith Lilith.
CS EN PL

3 sierpnia 2026 OpenAI opublikowało engineering post o tym, jak w sześć miesięcy zbudowało system realtime dla GPT-Live, trzeciej generacji głosu w ChatGPT. Rdzeń zmiany: model głosowy jest full-duplex, umie słuchać i mówić jednocześnie, a osobny turn detector zniknął ze ścieżki audio. Głębszy reasoning i tool use idą asynchronicznie do modelu frontier (w przykładach GPT-5.5), bez przerywania mowy.

Model full-duplex prowadzi rozmowę; turn detector już nie stoi w drodze

Starsze stacki głosowe dziedziczyły logikę turn-based po tekstowych LLM: najpierw detektor decydował, czy użytkownik skończył, dopiero potem startował duży model. Zły strzał albo ucinał mowę, albo dokładał latencję. GPT-Live oddaje kontrolę konwersacji modelowi głosowemu: audio płynie w obie strony non stop, a delegacja, tool use i zapis rozmowy lecą poza live path.

Żeby utrzymać to w skali ChatGPT, OpenAI oddzieliło media frontend od logiki aplikacji. Audio ma dedykowaną szybką ścieżkę; wolny tool call nie może stallować frametime. Media frontend przepisano z Python asyncio na Go; p95 smoothness nowej ścieżki ma siedzieć na poziomie dawnego p50. Transport zostaje na WebRTC, a do szybszego startu sesji doszły WARP (WebRTC Abridged Roundtrip Protocol) i Instant Connect, by obciąć liczbę network round tripów przed pierwszą ramką audio.

Dla zespołów produktowych głos staje się kanałem do agentów, nie tylko TTS chatem

Help Center potwierdza skutki produktowe: Live działa na GPT-Live-1 w planach płatnych i GPT-Live-1 mini na free. Obsługuje full-duplex, web search, memory oraz tekst i obrazki w tym samym czacie. Na starcie nie ma video, screen sharing, connected apps ani plugins; to zostaje przy Advanced voice tam, gdzie nadal ma sens.

Ważniejsze niż „przyjemniejsza rozmowa“ jest architektura Voice in Work i Codex w aplikacji desktop: głosem startować taski, pytać o progress i koordynować wielu agentów w jednej rozmowie. Głos przestaje być tylko cechą dostępności i staje się powierzchnią sterowania. Limity są twarde i zależne od planu: Pro ma wyraźnie wyższe quota, Go/Plus rzędu godzin, free tylko ograniczony Live mini, a Business/Enterprise często spala kredyty (np. 5 kredytów za minutę przy flexible pricing). Jedna rozmowa Live max 2 godziny.

Demo full-duplex to jeszcze nie niezawodny meeting agent

Sama OpenAI przyznaje limity segmentacji: UI potrzebuje dyskretnych turnów, live path jest ciągły. Serwer więc trzyma widok spekulatywny i autorytatywny na to, kto ma floor, żeby krótkie „mm hmm“ nie zaśmiecało historii. Nakładanie się mowy, szum i multi-speaker wciąż psują attribution. Live jest przede wszystkim one-on-one, nie rejestratorem meetingu dla pięciu osób przy stole.

Drugi strop jest produktowy. Bez video/screen share i bez plugins na starcie Live nie pokrywa scenariuszy, które Advanced nadal trzyma. Enterprise/Edu dodatkowo muszą włączyć Voice i Early Model Access w oknie early access. Kto czeka na „wszędzie i od razu“, uderzy w politykę admina i limity wcześniej niż w model.

Jakość przerywania i delegacja pod obciążeniem pokażą, czy to naprawdę live

Warto śledzić trzy sygnały. Po pierwsze, czy full-duplex trzyma jakość przerywania poza lab demo (kaszel, overlap, słaby mikrofon). Po drugie, czy async delegacja do GPT-5.5 zostaje w latencji akceptowalnej dla człowieka, gdy tool call to nie trywialny search. Po trzecie, adopcja Voice in Work/Codex: czy użytkownicy desktop naprawdę sterują agentami głosem, czy wracają do tekstu, gdy brief musi być audytowalny.

Jeśli te trzy rzeczy się trzymają, OpenAI nie sprzedaje tylko gładsze TTS. Sprzedaje głos jako podstawowy runtime pracy agentowej. Jeśli nie, zostanie z tego przyjemniejsza rozmowa telefoniczna z chatbotem, a Advanced zachowa wyspecjalizowane wejścia.

Werdykt Lilith

OpenAI nie wygrało tu ładniejszym głosem. Wygrało rozdzieleniem mówienia od myślenia: audio idzie szybką ścieżką, a search i tool use dobiegają bokiem, bez rozbijania rozmowy.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗