Lilith Lilith.
⌕
Ilustracja redakcyjna: Claude Sonnet 5.5 przyspiesza o 30 % i walczy kosztem zadania, a nie tokena
Ilustracja Lilith · remiks redakcyjny

Anthropic wydało Claude Sonnet 5.5 jako szybsze i oszczędniejsze uzupełnienie Opusa 5.5. Cennik pozostaje taki sam jak w Sonnet 5, ale firma twierdzi, że model kończy większość zadań przy mniejszej liczbie tokenów i generuje odpowiedzi o ponad 30 % szybciej.

Ten sam cennik ukrywa niższy koszt ukończonego zadania

Sonnet 5.5 kosztuje 2 dolary za milion tokenów wejściowych, 10 dolarów za milion tokenów wyjściowych i 0,20 dolara za milion tokenów odczytanych z cache. W testach Anthropic koszt zadania był do 30 % niższy niż w Sonnet 5.

Model uzyskał 70,6 % w Terminal-Bench 4.0 wobec 10,3 % poprzednika. Przy ustawieniu Max zdobył 46,2 % w FrontierCode 1.1 i 55,5 % w CursorBench 4.0. Jest dostępny na Claude Platform jako claude-sonnet-5-5 oraz przez AWS, Google Cloud i Microsoft Azure.

Efektywność agentów mierzy się ukończoną pracą, nie tanim tokenem

W przypadku coding agents mniejsza liczba tool calls i krótsza ścieżka mogą przeważyć różnicę w cenniku. Model o tej samej cenie tokena jest tańszy, jeśli rzadziej powtarza wyszukiwanie, mniej błądzi po repozytorium i częściej kończy zadanie bez pomocy człowieka.

Anthropic pozycjonuje Sonnet do rutynowych, dobrze określonych prac, a Opus 5.5 pozostawia do otwartych zadań wymagających długiego namysłu. Dla zespołów produktowych to wskazówka do routingu, a nie automatyczny powód do wymiany modelu wszędzie.

Duży skok w benchmarku nadal pochodzi od producenta

Wyniki porównują różne effort settings, a część evals wykonano na wdrożeniu przedprodukcyjnym. Sam Anthropic przyznaje, że Opus pozostaje mocniejszy w złożonych, otwartych zadaniach. Sonnet 5.5 ma też nowe safeguards dla cyberbezpieczeństwa i przy ryzykownych zadaniach może wracać do Sonnet 5.

Wewnętrzne evals pokażą, czy 30 % przetrwa produkcję

Zespoły powinny porównać pełny koszt zadania, czas do zaakceptowania zmiany, liczbę interwencji człowieka i nieudane tool calls. Dopiero identyczne workflow na własnych danych pokaże, czy szybsze generowanie skraca dostarczenie wyniku.

Werdykt Lilith

Sonnet 5.5 nie zmienił ceny na metce tokena, tylko skrócił drogę do kasy. Jeśli firmowe evals potwierdzą mniej kroków i interwencji człowieka, księgowi zauważą to przed fanami benchmarków.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗