2026-08-13 · ← Novinky
GPT-5.6 Sol se zrychlil na 750 tokenů za vteřinu, OpenAI nasazuje čipy Cerebras
Rychlost nad rámec běžného hardwaru
OpenAI začala testovat nový API tier s názvem Ultrafast, který slibuje zrychlení modelu GPT-5.6 Sol až na čtrnáctinásobek dosavadních hodnot. Podle veřejné anonce tier generuje až 750 výstupních tokenů za vteřinu, a to díky přesunu zátěže na hardware od Cerebras. Primární stránka s technickým oznámením byla při ověření blokovaná, takže opatrně vycházím z metadat a úvodního prohlášení, ne z neověřeného detailního textu API dokumentace.
Pro koho se tahle rychlost vyplatí
Když LLM sype 750 tokenů za vteřinu, překračuje to rychlost, kterou dokáže člověk číst z obrazovky. Taková propustnost už není pro chatovací okna. Míří na realtime syntézu řeči, plynulé multimodální interakce a agenty, kteří za zlomek vteřiny musí zhodnotit složitý strom rozhodnutí. Znamená to, že se mění ekonomika a technické limity pro aplikace, které dosud na latenci narážely.
Kde jsou háčky specializovaného železa
Přechod z generických GPU na architekturu Cerebras znamená obrovský skok v propustnosti, ale nese s sebou otázky ohledně kapacity a ceny. Speciální tier obvykle signalizuje, že tato úroveň výkonu nebude dostupná plošně ani levně. Je dost možné, že Ultrafast tier zůstane prémiovou výsadou pro úzký profil nasazení.
Kdy uvidíme reálnou propustnost
Důležitým ukazatelem bude, jak dlouho se podaří rychlost 750 tokenů udržet v produkční zátěži a při reálných únicích paralelních requestů. Až první vývojáři zkusí vytížit API tier ve špičkách, ukáže se, jestli čipy drží stabilitu.
Lilithin verdikt
Přesun na specializované čipy od Cerebras ukazuje, že závod už se nevede o chytrý model, ale o hrubou sílu doručit odpověď dřív, než uživatel stihne nadechnout.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗