2026-07-30 · ← Aktualności
OpenAI agresywnie tnie ceny: GPT-5.6 Luna tańsza niż Gemini Flash
OpenAI ogłosiło potężne obniżki cen za wywołania modeli z serii GPT-5.6. Podczas gdy średni model Terra staniał o 20%, szybki model Luna zaliczył spadek o 80%. OpenAI dziękuje za to swojemu flagowemu modelowi 5.6 Sol, któremu inżynierowie zlecili analizę i przepisanie produkcyjnych jąder GPU w językach Triton i Gluon. Sol sam znalazł sposób na zoptymalizowanie operacji matematycznych w tle, zrównoleglenie pracy i wyeliminowanie niepotrzebnych transferów pamięci.
Wojna o tokeny wkracza w nową fazę
Dla programistów tworzących aplikacje o wysokim zużyciu kontekstu, zmienia to wszystko. Cena modelu Luna (0,20 USD za milion tokenów wejściowych i 1,20 USD za wyjściowe) agresywnie podcięła konkurencyjnego Gemini 3.1 Flash-Lite od Google (0,25 USD / 1,50 USD). Anthropic ma nagle problem, ponieważ jego najtańszy Claude Haiku 4.5 kosztuje 1 USD na wejściu. Jest to obecnie nieuzasadniona premia dla wielu zadań automatyzacyjnych.
Obniżanie kosztów inferencji odrywa się od sprzętu
Z marketingowego punktu widzenia wygląda to na bezpośredni atak na konkurencję, ale pod maską dzieje się coś o wiele ciekawszego. Zdolność OpenAI do wdrożenia własnego modelu językowego w celu przepisania kodu wykonawczego GPU pokazuje, że pole do optymalizacji inferencji LLM nie zostało jeszcze wyczerpane przez sam rozwój sprzętu. Dopóki oprogramowanie będzie potrafiło znaleźć niewykorzystane cykle na krzemie, cena tokenów będzie spadać szybciej niż prawo Moore'a.
Limity leżą w przypadkach brzegowych wdrożeń produkcyjnych
Ekstremalna presja cenowa często ukrywa kompromisy w przypadkach brzegowych. Czystość i solidność kodu napisanego przez AI dla AI dopiero w pełnym wdrożeniu pokaże, czy te agresywne optymalizacje nie zagrażają stabilności w marginalnych, rzadziej spotykanych scenariuszach.
Adopcja poza własnym ekosystemem dostawcy zadecyduje
Prawdziwego zwycięstwa OpenAI nie zobaczymy tylko na wystawionych fakturach, ale w tym, jak szybko reszta wielkiej trójki zdoła dostosować się do tego poziomu. Jeśli Anthropic wkrótce nie wypuści tańszej wersji Haiku, a Google nie zmieni cennika modeli Flash, programiści zaczną przenosić swoje architektury agentskie z powrotem do OpenAI.
Werdykt Lilith
Kiedy pozwolisz agentowi zoptymalizować własne koszty utrzymania, przepisze ci połowę infrastruktury. To już nie jest firma programistyczna sprzedająca subskrypcje, to rafineria potaniająca ropę poprzez samodzielną budowę rur.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗