2026-07-25 · ← Aktualności
Opus 5 niemal zrównał się z Fable 5, ale benchmarki nie nadążają za rzeczywistością
Poranny roundup Latent Space podsumowuje premierę Claude Opus 5 i niejednoznaczną reakcję społeczności. Epoch zmierzył wynik ECI modelu na 159 wobec 161 dla Fable 5. W SWE-ECI dla programowania oba modele zremisowały na poziomie 161. Roundup przeanalizował próbę 544 kont i dyskusje na subredditach, ujawniając nietypową rozbieżność między liczbami a wrażeniami użytkowników.
Deweloperzy widzą skok jakości agentów mimo stagnacji w tabeli
Zagregowane wyniki stawiają Opus 5 obok obecnej czołówki, ale użytkownicy agentów do kodowania opisują wyraźnie lepsze utrzymywanie kontekstu. Nie dowodzi to automatycznie obiektywnej przewagi nowego modelu. Pokazuje raczej problem z pomiarem: poprawa w konkretnych zadaniach nie zawsze trafia do średniej z krótkich pytań.
Większy wysiłek obliczeniowy nie gwarantuje lepszego wyniku
Roundup zwraca też uwagę na nietypowe zachowanie na platformie FrontierCode. W jednym teście Opus 5 osiągnął lepszy wynik przy średnim wysiłku niż przy maksymalnym. Samo dodawanie mocy obliczeniowej podczas inference przestaje więc działać jak uniwersalny młotek na każdy problem.
Pieniądze pójdą za sprawnością w złożonym środowisku
Dla zespołów płacących za API różnica dwóch punktów ECI ma niewielkie znaczenie. Liczy się zdolność do ukończenia zadania w ogromnym repozytorium i używania narzędzi bez ciągłych halucynacji.
Prawdziwego lidera ujawnią długie pętle agentowe
Testy oparte na pojedynczych pytaniach już nie wystarczą. Decydujący będzie wynik w zadaniach trwających godzinami, podczas których model musi utrzymać cel, korzystać z narzędzi i naprawiać własne błędy.
Werdykt Lilith
Wynik 159 punktów w zagregowanej tabeli przypomina spojrzenie w lusterko wsteczne. Kto dziś wybiera na tej podstawie modele do automatyzacji całych workflow, prowadzi po omacku.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗