Lilith Lilith.
CS EN PL

Anthropic udostępnił Opus 5, a Ars Technica opisuje go przede wszystkim jako krok w efektywności tokenów, nie jako duży skok możliwości. Model kosztuje 5 dolarów za milion input tokenów i 25 dolarów za milion output tokenów, czyli tyle co poprzedni Opus, a ma oferować wydajność bliską droższym modelom z najwyższej półki.

Opus 5 sprzedaje lepszy stosunek ceny do wydajności

Według Ars Technica benchmarki Anthropic pokazują iteracyjną poprawę względem Opus 4.8 i konkurencji takiej jak GPT-5.6-Sol, ale nie radykalny przełom na miarę wcześniejszych skoków agentowych. Główny argument jest inny: coś blisko najwyższej klasy za mniej więcej połowę ceny Fable.

To ważniejsze, niż wygląda. W zadaniach coding i agentowych zespoły coraz rzadziej pytają, czy model potrafi napisać fragment kodu. Pytają, ile kosztuje pozwolenie mu na myślenie, poprawianie się i wielokrotne wywoływanie narzędzi.

Ars zwraca też uwagę na kompromis w cyberbezpieczeństwie. Anthropic według artykułu uniknął najmocniejszego treningu na zadaniach exploitaion, więc Opus 5 zostaje w tej części za Mythos i Fable.

Model routing staje się koniecznością, nie optymalizacją

Dla organizacji deweloperskich praktyczny skutek jest jasny. Nie każdy prompt potrzebuje najmocniejszego modelu. Jeśli Opus 5 daje wystarczającą jakość przy niższym efektywnym koszcie, pasuje do warstwy, która decyduje, kiedy użyć drogiego modelu, a kiedy tańszej alternatywy.

Ars wspomina, że Cursor i Meta budują model routers: systemy dobierające model do typu zadania. To mniej efektowne niż nowy leaderboard, ale ważniejsze dla kosztów w firmach.

Gdy agent działa długo, różnica między dobrym a najlepszym modelem mnoży się przez tokeny, poprawki i równoległe próby. Ekonomia inference staje się funkcją produktu.

Tańszy Opus nie usuwa presji open-weight modeli

Słaby punkt Anthropic to konkurencja z dołu. Ars podaje Kimi K3 w cenie 15 dolarów za milion output tokenów przy podobnej wydajności. Jeśli tańsze open-weight models będą się poprawiać, klienci zaczną przenosić rutynowe zadania poza najdroższe frontier API.

To nie oznacza końca Opus 5. Oznacza koniec wygody, w której najlepszy model dostaje każde zapytanie tylko dlatego, że jest najlepszy. Wydajność musi obronić rachunek.

Adopcja w routowanych workflow rozstrzygnie wynik

Kolejnym sygnałem nie będzie sam benchmark. Liczy się to, czy Opus 5 trafi do model routers jako domyślny wybór dla trudniejszych zadań coding, czy tylko jako kolejna pozycja w cenniku.

Jeśli zespoły użyją go tam, gdzie Fable jest za drogi, a mniejsze modele zawodzą, Anthropic trafił w realny problem. Jeśli nie, będzie to kolejny release, który dobrze wygląda na wykresie i gorzej na fakturze.

Werdykt Lilith

Opus 5 celuje w człowieka, który nie podziwia już dema, tylko trzyma fakturę za miliony tokenów. W tej chwili inteligentny model to ten, który mieści się na paragonie.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗