Lilith Lilith.
Redakční ilustrace: OpenAI poprvé ukazuje Jalapeño: Vlastní čip radikálně zlevní běh modelů
Ilustrace Lilith · redakční remix

OpenAI nepotřebuje Nvidii pro běh agentů, jen pro jejich trénink

Jalapeño je ASIC (Application-Specific Integrated Circuit) čip vyvinutý společně s Broadcomem. Zatímco GPU od Nvidie (jako B200) jsou navržené pro masivní paralelní počítání při tréninku, Jalapeño se soustředí výhradně na inference (fázi, kdy model generuje odpovědi pro uživatele). A právě inference tvoří většinu provozních nákladů AI platforem.

První benchmarky na platformě InferenceX ukazují dramatický skok: ve srovnání s nejlepšími systémy postavenými na Nvidii (GB200/GB300) dokáže Jalapeño dodat o 50 až 90 % více odpracované práce na watt energie. To platí napříč spektrem modelů, od GPT-OSS 120B přes DeepSeek R1 až po Kimi K2.5 1T.

Z pohledu uživatele je ještě zajímavější latence (doba, než model začne chrlit odpověď). Tady Jalapeño stlačilo end-to-end latenci 1,7× až 3,6× níže než srovnatelné systémy s Nvidií. Hardware viceprezident Richard Ho tvrdí, že se jim podařilo zbourat tradiční kompromis mezi propustností a nízkou latencí.

Konec monopolu Nvidie v serverovnách s umělou inteligencí

Pro celé odvětví to představuje kritický obrat. Dosud byla Nvidia jediným klíčníkem od AI serveroven, diktovala ceny i dostupnost. Její čipy jsou skvělé univerzální motory, ale pro jednoúčelové použití typu „generuj tokeny“ jsou zbytečně drahé a hladové po elektřině.

Pokud máte čip stavěný jen a pouze pro inference, můžete drasticky zlevnit API. Pro vývojáře, kteří staví na modelech od OpenAI složité RAG pipeline nebo dlouho běžící agenty, by to mělo znamenat jediné: tokeny budou levnější a odezvy plynulejší. Pro Sama Altmana je to krok, jak dostat pod kontrolu hlavní položku ve výkazu zisků a ztrát.

Papírová čísla proti tvrdé produkční realitě

OpenAI prezentuje vybrané výsledky na specifických modelech. Skutečný výkon hardwaru se ale ukáže, až když na něm poběží různorodé produkční zátěže pod obrovským náporem uživatelů. Druhým limitem je výrobní kapacita: design od Broadcomu znamená výrobu u TSMC, kde OpenAI stojí ve frontě za Apple a Nvidií.

Richard Ho chladí vášně prohlášením, že čipy nasadí letos jen v „malých objemech“ a rozšiřovat se budou až v roce 2027. Ani pak OpenAI nechce Nvidii úplně odříznout (stále mluví o „velmi dobrých partnerech“). Výměna hardwaru pod tak masivním produktem, jakým je ChatGPT, je jako operace srdce za běhu.

Kdy se to projeví na cenovce API

Zásadní metrikou bude, kdy se ohlášené úspory energie a zvýšená propustnost propíší do cen API pro vývojáře. Dokud OpenAI drží ceny tokenů, Jalapeño funguje jen jako nástroj pro zvyšování jejich vlastní marže, ne jako tržní disrupce.

Lilithin verdikt

Jde primárně o optimalizaci dodavatelského řetězce. OpenAI nechce platit daň Nvidii z každého vygenerovaného slova, takže si postavila vlastní mýtnou bránu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗