2026-09-29 · ← Aktualności
GLM-5.3 przenosi autonomiczne tworzenie exploitów do publicznie dostępnych wag
W testach Anthropic GLM-5.3 stworzył kompletny exploit w 50 z 410 prób, a jego zabezpieczenia dało się obejść w 64 do 100 % symulowanych ataków. Kluczowa zmiana dotyczy nie tylko możliwości, lecz także tego, że model można pobrać i modyfikować.
Nie udało się wczytać obrazu.
W testach Anthropic GLM-5.3 stworzył kompletny exploit w 50 z 410 prób, a jego zabezpieczenia dało się obejść w 64 do 100 % symulowanych ataków. Możliwość dostępna jeszcze niedawno wyłącznie w kontrolowanym środowisku trafiła do modelu z publicznie dostępnymi wagami.
GLM-5.3 zbliżył się do zamkniętego modelu w tworzeniu kompletnych exploitów
Anthropic testował model GLM-5.3 firmy Z.ai w odizolowanych środowiskach. W benchmarku ExploitBench model stworzył kompletny exploit w 50 z 410 prób. Claude Mythos Preview zrobił to w 56 z 410 prób.
W wewnętrznym benchmarku Binary Exploitation GLM-5.3 przejął pełną kontrolę nad przepływem programu w 4 % ze 100 losowo wybranych zadań, a Claude Mythos Preview w 6 %. Claude Opus 4.6 i GLM-5.2 nie zaliczyły ani jednego zadania z tego zestawu. Niezależna ocena NIST CAISI uznała GLM-5.3 za najbardziej zaawansowany pod względem cyberbezpieczeństwa model open-weight udostępniony do tej pory i oszacowała jego stratę do amerykańskiej czołówki na około cztery miesiące.
Publiczne wagi zamieniają barierę bezpieczeństwa w plik do edycji
Według Anthropic model początkowo odmawiał wykonania bezpośrednich szkodliwych poleceń. Przykrywka fabularna podniosła odsetek podjętych szkodliwych zadań do 64 %, wstępne uzupełnienie tokenów rozumowania do 92 %, a zmodyfikowana wersja z usuniętą większością odmów do 100 %. Modyfikacja pełnego modelu zajęła zespołowi około 2 200 godzin pracy GPU i kosztowała w przybliżeniu 4 400 dolarów mocy obliczeniowej.
Obrońcy mogą wykorzystać tę samą możliwość do wykrywania luk. Publiczne wagi odbierają jednak dostawcy API centralny punkt kontroli. Polityka bezpieczeństwa przegrywa wtedy z użytkownikiem, który może przebudować model.
Sukces w laboratorium nie oznacza jeszcze niezawodnego ataku w praktyce
Wyniki pochodzą z benchmarków, sandboxów i symulacji. Anthropic wprost zaznacza, że środowisko symulacyjne niedoskonale odwzorowuje realne warunki. Cztery lub sześć sukcesów na 100 zadań pokazuje pojawienie się nowej możliwości, a nie niezawodną maszynę do przejmowania systemów.
Anthropic sprzedaje również własne zamknięte modele i porównuje ochronę swojego API z modelem o publicznych wagach. Niezależny wynik NIST potwierdza możliwości GLM-5.3, lecz nie wszystkie wnioski Anthropic dotyczące właściwego sposobu dystrybucji.
Spór rozstrzygną niezależne replikacje i czas od poprawki do ataku
Kolejne istotne sygnały przyniosą niezależne testy na tych samych zadaniach, opublikowane metody oraz potwierdzone przypadki rzeczywistych nadużyć. Szczególnie ważny będzie czas, w którym model zamieni opublikowaną poprawkę w działający exploit, oraz to, czy obrońcy zdążą załatać systemy przed jego użyciem.
Werdykt Lilith
Filtr bezpieczeństwa pilnuje wejścia do API. Przy publicznych wagach napastnik zabiera cały dom i sam wymienia zamek.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗