Lilith Lilith.
Ilustracja redakcyjna: GPT-6 Luna obniżyła cenę tokenów wyjściowych o ponad połowę
Ilustracja Lilith · remiks redakcyjny

Anthropic wydało Claude Opus 5.5, a mniej więcej godzinę później OpenAI przedstawiło GPT-6 Sol i GPT-6 Luna. Te trzy modele mają różne możliwości, lecz łączy je komunikat cenowy: dostawcy obniżają koszt warstwy, na której firmy mogą uruchamiać duży wolumen pracy agentów.

Luna obniżyła cenę wyjścia z 1,20 do 0,50 dolara

GPT-6 Luna kosztuje 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion wyjściowych. GPT-5.6 Luna kosztowała wcześniej 0,20 i 1,20 dolara. GPT-6 Sol wyceniono na 2 dolary za wejście i 10 dolarów za wyjście, czyli połowę ceny GPT-5.6 Sol.

Claude Opus 5.5 jest o 20 % tańszy od Opus 5 i kosztuje 4 oraz 20 dolarów. Odczyt cache potaniał o 60 % do 0,20 dolara. Anthropic twierdzi także, że typowe workloady kosztują o 40 % mniej dzięki mniejszemu zużyciu tokenów, a odpowiedzi powstają ponad 30 % szybciej.

Cennik zaczyna zmieniać model routing w aplikacjach

Dla zespołów produktowych oznacza to zmianę domyślnej architektury. Luna może wykonywać tanie, częste kroki, Sol podejmować trudniejsze decyzje, a Opus obsługiwać długie zadania programistyczne i analityczne. Przy takiej rozpiętości cen jeden model do wszystkiego staje się kosztownym uproszczeniem.

Szczególnie słabo wygląda GPT-5.6 Terra. Ma taką samą cenę wejścia jak GPT-6 Sol, lecz wyjście kosztuje 12 dolarów. Dotychczasowe reguły routingu potrzebują więc nowych evals, a nie tylko zmiany nazwy modelu w konfiguracji.

Tańszy token nie gwarantuje tańszego ukończonego zadania

Porównanie cen nie pokazuje liczby kroków, ponownych prób ani kosztu porażki. Anthropic zestawia Opus 5.5 głównie ze swoimi modelami i starszymi modelami OpenAI. OpenAI używa własnych ram oceny. Nadal brakuje bezpośredniego, niezależnego testu Sol przeciw Opus 5.5.

Znaczenie ma też rodzaj workloadu. Długie sesje agentów korzystają z taniego odczytu cache, a przy krótkim generowaniu większą rolę może odgrywać cena wyjścia. Jedna tabela nie wystarczy do decyzji zakupowej.

Zwycięzcę wskażą evals połączone z prawdziwą fakturą

Zespoły powinny odtworzyć własny zestaw zadań na wszystkich trzech modelach i zmierzyć skuteczność, opóźnienie, tokeny, powtórzenia oraz interwencje ludzi. Dopiero suma pokaże koszt ukończonego wyniku.

Jeżeli niskie ceny się utrzymają, wzrośnie znaczenie ciągłego multi-model routingu. Sygnałem nie będzie kolejny wykres producenta, lecz miesiąc logów produkcyjnych, w którym tańszy model zachowa jakość i rzeczywiście obniży rachunek.

Werdykt Lilith

Dostawcy przepisali cenniki w ciągu godziny, lecz firmowa faktura nie zmieni się sama. Wygra model, który dojedzie do mety z ukończonym zadaniem, a nie ten reklamujący najtańsze paliwo.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗