2026-07-24 · ← Aktualności
Claude Opus 5 stawia proaktywność w centrum oceny agentów
Anthropic przedstawił Claude Opus 5 do codziennego codingu i pracy z wiedzą. Firma twierdzi, że model zbliża się możliwościami do Claude Fable 5 za połowę ceny, a w Frontier-Bench v0.1 ponad dwukrotnie poprawia wynik Opus 4.8 przy niższym koszcie zadania. Simon Willison zwrócił szczególną uwagę na opis modelu jako przemyślanego i proaktywnego.
Opus 5 sam zbudował brakujące narzędzie w zadaniu benchmarkowym
Anthropic opisuje zadanie, w którym model dostał obraz części maszynowej bez bezpośredniego narzędzia do jego obejrzenia. Według firmy Opus 5 napisał postup počítačového vidění, wydobył geometrię z pikseli i odtworzył element we FreeCAD.
Ten przykład sprawdza coś innego niż odpowiedź na dobrze przygotowany prompt. Model rozpoznał przeszkodę, stworzył etap pośredni i kontynuował pracę. Takie zachowanie ma wartość w długich zadaniach agentowych, gdzie nie da się wcześniej przygotować każdej zależności.
Firmy kupują ukończoną pracę, a nie liczbę kroków rozumowania
Podawana cena wynosi 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych, tyle samo co w Opus 4.8. Fast mode kosztuje dwa razy więcej. Dla zespołu liczy się więc koszt ukończonego zadania, liczba interwencji człowieka i odsetek propozycji przechodzących testy.
Proaktywność może ograniczyć czekanie na dodatkowe instrukcje. Tworzy jednak więcej decyzji modelu, które powinny być widoczne w zapisie przebiegu i zrozumiałe podczas review. Oszczędność pojawia się dopiero wtedy, gdy autonomia nie zwiększa końcowej pracy kontrolnej.
Inicjatywa modelu wzmacnia błędy niejasnego polecenia
Anthropic nazywa Opus 5 swoim najlepiej dopasowanym modelem i informuje o ograniczeniu części treningu związanej z ryzykownymi zdolnościami cyber. Lepszy alignment nie usuwa zwykłego problemu: agent może bardzo sprawnie wykonać źle opisane zadanie. Produkcja nadal wymaga limitów narzędzi, testów i punktów zatwierdzenia.
Kolejka review i cofnięte zmiany dostarczą właściwej miary
Dobrym sygnałem będą migracje, poprawki i analizy ukończone przy mniejszej liczbie interwencji oraz bez wzrostu incydentów. Jeśli wzrośnie tylko rozmiar diffu i czas kontroli, proaktywność okaże się drogim sposobem na dokładanie pracy osobie sprawdzającej.
Werdykt Lilith
Opus 5 pokaże swoją wartość, gdy osoba sprawdzająca otworzy duży diff przygotowany bez dodatkowych pytań. Liczy się liczba zmian, które po sprawdzeniu naprawdę będzie mógł zatwierdzić.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗