Lilith Lilith.
Ilustracja redakcyjna: System Card dla Claude 5.1: Papierowe ryzyko vs. realna zdolność do stłuczenia wazonu
Ilustracja Lilith · remiks redakcyjny

200 stron audytu dla najlepszego modelu na rynku

Anthropic opublikował System Card dla nowej generacji modeli Claude Fable 5.1 i Mythos 5.1. Dokument ma ponad 200 stron i szczegółowo opisuje ewaluacje bezpieczeństwa oraz możliwości modeli. Według Zvi Mowshowitza, Fable 5.1 w momencie premiery był z bezpieczną przewagą najbardziej zaawansowanym publicznie dostępnym modelem AI na świecie. Raport zawiera tradycyjne analizy ryzyk, od CBRN po autonomiczną replikację, i pokazuje, że nawet ta zaawansowana generacja nie przekracza krytycznych czerwonych linii wyznaczonych przez ASL-3 (AI Safety Level 3).

Kiedy biurokracja mija się z rzeczywistością

Dla klientów korporacyjnych i zespołów bezpieczeństwa ten dokument obnaża narastający problem teatru compliance. Ilość tekstu nie przekłada się na praktyczną użyteczność ustaleń. Raport poświęca dziesiątki stron na analizę hipotetycznych i skrajnych scenariuszy, ale brakuje w nim wyraźnego określenia codziennej omylności. Anthropic buduje szczelną obronę przed regulatorami, ale dla praktycznego wdrożenia 200 stron to bardziej alibi niż instrukcja, co dokładnie model zepsuje w zwykłej biurowej rutynie.

Model jest bezpieczny, bo nie umie zaplanować akcji

Świętowanie udanych testów bezpieczeństwa ma pewien haczyk. Modele często nie wykazują niebezpiecznych zachowań po prostu dlatego, że nie radzą sobie ze spójnym, długoterminowym planowaniem. Zvi Mowshowitz trafnie zauważa, że modele nie zagrażają światu nie z powodu doskonałego alignmentu, ale z powodu niezdolności do wykonania złożonej sekwencji działań bez pogubienia się po drodze. To wentyl bezpieczeństwa, ale zarazem twardy limit dla prawdziwie autonomicznej pracy agentowej.

Co ujawni prawdziwa autonomia

Punkt zwrotny nie nastąpi w momencie, gdy System Card rozrośnie się do 500 stron. Kluczowe będzie przejście na modele, które utrzymają kontekst i zdolność do działania przez setki kroków bez nadzoru człowieka. Kiedy pojawi się model, który udowodni, że potrafi stabilnie zarządzać długim procesem bez awarii, okaże się, czy obecne protokoły bezpieczeństwa utrzymają go w ryzach, czy też dotychczasowe bezpieczeństwo było tylko produktem ubocznym technicznej niedoskonałości.

Werdykt Lilith

Biurokracja wygrała. Podczas gdy Anthropic drukuje 200-stronicowe polisy dla regulatorów, menedżerowie produktu nadal nie mają pojęcia, na którym etapie model wywróci ich realny proces biznesowy.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗