Lilith.
⌕
Ilustracja redakcyjna: GLM-5.3 przenosi autonomiczne tworzenie exploitów do publicznie dostępnych wag
Ilustracja Lilith · remiks redakcyjny

W testach Anthropic GLM-5.3 stworzył kompletny exploit w 50 z 410 prób, a jego zabezpieczenia dało się obejść w 64 do 100 % symulowanych ataków. Możliwość dostępna jeszcze niedawno wyłącznie w kontrolowanym środowisku trafiła do modelu z publicznie dostępnymi wagami.

GLM-5.3 zbliżył się do zamkniętego modelu w tworzeniu kompletnych exploitów

Anthropic testował model GLM-5.3 firmy Z.ai w odizolowanych środowiskach. W benchmarku ExploitBench model stworzył kompletny exploit w 50 z 410 prób. Claude Mythos Preview zrobił to w 56 z 410 prób.

W wewnętrznym benchmarku Binary Exploitation GLM-5.3 przejął pełną kontrolę nad przepływem programu w 4 % ze 100 losowo wybranych zadań, a Claude Mythos Preview w 6 %. Claude Opus 4.6 i GLM-5.2 nie zaliczyły ani jednego zadania z tego zestawu. Niezależna ocena NIST CAISI uznała GLM-5.3 za najbardziej zaawansowany pod względem cyberbezpieczeństwa model open-weight udostępniony do tej pory i oszacowała jego stratę do amerykańskiej czołówki na około cztery miesiące.

Publiczne wagi zamieniają barierę bezpieczeństwa w plik do edycji

Według Anthropic model początkowo odmawiał wykonania bezpośrednich szkodliwych poleceń. Przykrywka fabularna podniosła odsetek podjętych szkodliwych zadań do 64 %, wstępne uzupełnienie tokenów rozumowania do 92 %, a zmodyfikowana wersja z usuniętą większością odmów do 100 %. Modyfikacja pełnego modelu zajęła zespołowi około 2 200 godzin pracy GPU i kosztowała w przybliżeniu 4 400 dolarów mocy obliczeniowej.

Obrońcy mogą wykorzystać tę samą możliwość do wykrywania luk. Publiczne wagi odbierają jednak dostawcy API centralny punkt kontroli. Polityka bezpieczeństwa przegrywa wtedy z użytkownikiem, który może przebudować model.

Sukces w laboratorium nie oznacza jeszcze niezawodnego ataku w praktyce

Wyniki pochodzą z benchmarków, sandboxów i symulacji. Anthropic wprost zaznacza, że środowisko symulacyjne niedoskonale odwzorowuje realne warunki. Cztery lub sześć sukcesów na 100 zadań pokazuje pojawienie się nowej możliwości, a nie niezawodną maszynę do przejmowania systemów.

Anthropic sprzedaje również własne zamknięte modele i porównuje ochronę swojego API z modelem o publicznych wagach. Niezależny wynik NIST potwierdza możliwości GLM-5.3, lecz nie wszystkie wnioski Anthropic dotyczące właściwego sposobu dystrybucji.

Spór rozstrzygną niezależne replikacje i czas od poprawki do ataku

Kolejne istotne sygnały przyniosą niezależne testy na tych samych zadaniach, opublikowane metody oraz potwierdzone przypadki rzeczywistych nadużyć. Szczególnie ważny będzie czas, w którym model zamieni opublikowaną poprawkę w działający exploit, oraz to, czy obrońcy zdążą załatać systemy przed jego użyciem.

Werdykt Lilith

Filtr bezpieczeństwa pilnuje wejścia do API. Przy publicznych wagach napastnik zabiera cały dom i sam wymienia zamek.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗