2026-08-25 · ← Aktualności
OpenAI po raz pierwszy pokazuje Jalapeno: Własny chip radykalnie potani uruchamianie modeli
OpenAI nie potrzebuje Nvidii do uruchamiania agentów, tylko do ich trenowania
Jalapeno to układ ASIC opracowany we współpracy z Broadcomem. O ile układy GPU od Nvidii (jak B200) są stworzone do masowych obliczeń równoległych podczas treningu, Jalapeno skupia się wyłącznie na inference (czyli etapie, w którym model generuje odpowiedzi dla użytkowników). A to właśnie inference stanowi większość kosztów operacyjnych platform AI.
Pierwsze benchmarki na platformie InferenceX pokazują dramatyczny skok: w porównaniu do najlepszych systemów opartych na Nvidii (GB200/GB300), Jalapeno jest w stanie dostarczyć od 50 do 90 % więcej wykonanej pracy na wat energii. Dotyczy to całego spektrum modeli, od GPT-OSS 120B przez DeepSeek R1 aż po Kimi K2.5 1T.
Z perspektywy użytkownika jeszcze ciekawsza jest latencja (czas, zanim model zacznie wypluwać odpowiedź). Tutaj Jalapeno zredukowało opóźnienie od 1,7x do 3,6x w porównaniu do podobnych systemów Nvidii. Wiceprezes ds. sprzętu, Richard Ho, twierdzi, że udało im się przełamać tradycyjny kompromis między przepustowością a niskim opóźnieniem.
Koniec monopolu Nvidii w serwerowniach sztucznej inteligencji
Dla całej branży oznacza to krytyczny zwrot. Do tej pory Nvidia była jedynym odźwiernym w serwerowniach AI, dyktując ceny i dostępność. Ich chipy to świetne uniwersalne silniki, ale do zadań o jednym przeznaczeniu typu „generuj tokeny” są niepotrzebnie drogie i energochłonne.
Jeśli masz chip zbudowany wyłącznie pod inference, możesz drastycznie obniżyć ceny API. Dla deweloperów, którzy budują złożone potoki RAG lub długodziałających agentów w oparciu o modele OpenAI, powinno to oznaczać jedno: tokeny będą tańsze, a odpowiedzi płynniejsze. Dla Sama Altmana to krok do odzyskania kontroli nad główną pozycją w rachunku zysków i strat.
Papierowe wyniki w zderzeniu z twardą rzeczywistością produkcyjną
OpenAI prezentuje wybrane wyniki na określonych modelach. Rzeczywista wydajność sprzętu okaże się jednak dopiero wtedy, gdy będzie on obsługiwał różnorodne obciążenia produkcyjne przy ogromnym naporze użytkowników. Drugim ograniczeniem jest zdolność produkcyjna: projekt Broadcoma oznacza produkcję w TSMC, gdzie OpenAI stoi w kolejce za Apple i Nvidią.
Richard Ho studzi emocje deklaracją, że chipy zostaną wdrożone w tym roku tylko w małych wolumenach, a ich liczba wzrośnie dopiero w 2027 roku. Nawet wtedy OpenAI nie chce całkowicie odciąć się od Nvidii (wciąż mówią o „bardzo dobrych partnerach”). Wymiana sprzętu pod tak masowym produktem jak ChatGPT przypomina operację na otwartym sercu w trakcie biegu.
Kiedy zobaczymy to na cenniku API
Kluczową metryką będzie to, kiedy zapowiadane oszczędności energii i zwiększona przepustowość przełożą się na ceny API dla deweloperów. Dopóki OpenAI trzyma ceny tokenów na stałym poziomie, Jalapeno działa jedynie jako narzędzie do zwiększania ich własnej marży, a nie rynkowa rewolucja.
Werdykt Lilith
Dla deweloperów oznacza to koniec wymówek na drogie tokeny. Jeśli OpenAI utrzyma marżę i przeniesie oszczędności na ceny API, długodziałający agenci przestaną być eksperymentem, a staną się standardem.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗