2026-07-25 · ← Radar
System card Opus 5 pokazuje model mocny z dala od najgroźniejszej krawędzi
Zvi Mowshowitz opisuje system card Claude Opus 5 jako próbę połączenia dwóch światów. W wielu praktycznych zadaniach Opus 5 ma być według niego tak dobry jak Fable 5 albo lepszy, szybszy i za połowę ceny. Jednocześnie nie ma pełnej siły Mythos 5 w ryzykownych zadaniach cyber i bio. The Verge podaje cenę API 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych.
Opus 5 przenosi praktyczną siłę niżej na drabinie ryzyka
Anthropic we własnym ogłoszeniu twierdzi, że Opus 5 jest state-of-the-art w evals dotyczących codingu i pracy z wiedzą, takich jak Frontier-Bench i GDPval-AA, ale pozostaje za Mythos 5 w cybersecurity. W interpretacji system card przez Zviego ważne jest też celowe pominięcie części treningu cyber.
To ciekawy kompromis produktowy. Anthropic próbuje dostarczyć model dość mocny do agentic codingu, computer use i długiej pracy z wiedzą, ale bez dokładania zbyt dużej siły tam, gdzie prowadzi ona prosto do najgorszych scenariuszy dual-use.
Dla enterprise granica możliwości jest częścią produktu
Klienci często nie chcą absolutnie najmocniejszego modelu. Chcą modelu, który przejdzie przez bezpieczeństwo, prawo i operacje. Jeśli Opus 5 obsłuży większość codziennych zadań agentowych szybciej i taniej niż Fable 5, może być użyteczniejszy właśnie dlatego, że nie jest maksymalny wszędzie.
To zmienia sposób sprzedawania AI performance. Nie chodzi tylko o najwyższe miejsce w leaderboardzie. Chodzi o pakiet możliwości, odmów, audytów i zabezpieczeń, który firma może wdrożyć bez otwierania sztabu kryzysowego przy każdym use case.
System card nadal nie jest gwarancją produkcyjną
Zvi zachowuje właściwy dystans: na ostateczną ocenę capabilities jest za wcześnie, a benchmarki wyglądają mocno, ale praktyka rozstrzygnie później. System card nie opisze też w pełni emergentnego zachowania w konkretnej integracji firmowej, gdzie spotykają się narzędzia, uprawnienia i źle napisane procesy.
Niezależne testy pokażą, czy kompromis się utrzyma
Trzeba obserwować zewnętrzne evals codingowe, oceny bezpieczeństwa cyber i incydenty z realnych wdrożeń. Jeśli Opus 5 utrzyma wysoki performance bez wejścia w bardziej ryzykowne capabilities, Anthropic będzie miał mocny argument dla mainstreamowych agentów. Jeśli granica okaże się tylko linią w laboratorium, klienci znów będą sami stawiać płot.
Werdykt Lilith
Opus 5 wygląda jak model z czerwoną taśmą przy drzwiach, za którymi leżą groźniejsze zabawki. Pytanie nie brzmi, czy taśma wygląda solidnie. Pytanie brzmi, kto pilnuje jej o trzeciej nad ranem.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗