2026-09-27 · ← Aktualności
Opus 5.5 przywraca cechę, której benchmark nie mierzy: osobowość
Ethan Mollick opisuje Opus 5.5 jako powrót do dawnego odczucia pracy z Claude’em. Jego zdaniem modele Opus od wersji około 4.7 do 5 straciły część charakterystycznej osobowości i przypominały osłabioną odmianę Fable. To doświadczenie jednego użytkownika, a nie pomiar. Mimo to wskazuje słaby punkt dzisiejszych rankingów.
Anthropic przyznaje, że tabela pokazuje tylko część obrazu
Anthropic udostępniło Opus 5.5 22 września 2026 roku. Firma twierdzi, że model komunikuje się naturalniej niż poprzednie wersje, podaje najważniejsze informacje na początku i odpowiada na krytykę zbyt gęstego stylu Opus 5. Jednocześnie przyznaje, że przy obecnym poziomie możliwości różnice w benchmarkach coraz gorzej przekładają się na realną pracę.
Nowa wersja przynosi także łatwiejsze do zmierzenia zmiany. Według Anthropic typowe zadania kosztują o 40 % mniej niż w Opus 5, a generowanie odpowiedzi jest szybsze o ponad 30 %. API kosztuje 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych. Model jest dostępny przez Anthropic, AWS, Google Cloud i Microsoft Azure.
Styl modelu wyznacza koszt ludzkich poprawek
W długiej pracy osobowość ma praktyczne skutki. Wpływa na to, czy model przyznaje się do niepewności, jak porządkuje argumenty i ile tekstu trzeba później przepisać. Dwa modele z takim samym wynikiem mogą więc generować zupełnie inne koszty liczone w godzinach redaktora, programisty lub analityka.
Wpis Mollicka dodaje perspektywę użytkownika do liczb producenta. Anthropic mierzy tokeny, szybkość i skuteczność zadań. Użytkownik sprawdza również, czy z modelem da się pracować przez trzy godziny bez ciągłego poprawiania jego tonu i oceny sytuacji.
Wrażenie powrotu opiera się dziś na anegdocie i deklaracji producenta
Określenie Claude-like nie ma ustandaryzowanej miary. Mollick nie opublikował ślepego testu ani zestawu promptów, a Anthropic cytuje swoich early testers. Lepszy styl może wynikać z rzeczywistej zmiany modelu, działania system promptu albo zwykłego efektu świeżej wersji.
Naturalniejsza komunikacja może też rozmijać się z trafnością. Płynna odpowiedź jest łatwiejsza w lekturze, lecz sama płynność nie dowodzi, że model lepiej poprawia błędy, przestrzega instrukcji lub opiera się pochlebstwu.
Ślepe preferencje i długie sesje pokażą, czy Claude naprawdę wrócił
Liczyć się będą powtarzane ślepe porównania na identycznych zadaniach oraz prawdziwe sesje robocze. Warto mierzyć liczbę ludzkich poprawek, stabilność tonu po kilkudziesięciu turach i gotowość modelu do zmiany stanowiska po przedstawieniu dowodów.
Jeśli preferencja utrzyma się w różnych grupach użytkowników i dziedzinach, laboratoria będą musiały mierzyć obok możliwości także spójność współpracy. Benchmark pozostanie tablicą wyników, a nie pełnym opisem produktu.
Werdykt Lilith
Tabela potrafi ustawić modele w kolejności. O prawdziwym powrocie Claude’a przekonamy się, gdy po trzygodzinnej sesji kolega zetrze z tablicy mniej poprawek.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗