Lilith Lilith.
Ilustracja redakcyjna: Raport o atakach na modele obnaża granice złych intencji: Claude blokuje napastników
Ilustracja Lilith · remiks redakcyjny

Przetrwanie we wrogim środowisku

Nowa analiza Zviego Mowshowitza bierze pod lupę niedawny raport firmy Anthropic na temat prób nadużycia modelu Claude. Wygląda na to, że atakujący nie mają łatwego życia. Wiele podmiotów próbuje przekonać LLM, by pomógł im w oszustwach, cyberatakach lub innej nielegalnej działalności. Anthropic jednak aktywnie udaremnia te próby, a z dostępnych danych wynika, że większość z nich kończy się niepowodzeniem.

Bariery na razie trzymają

Ta sytuacja napawa zespoły ds. bezpieczeństwa umiarkowanym optymizmem. Pokazuje, że pomimo teoretycznych obaw o możliwość nadużywania zaawansowanych modeli, obecne mechanizmy łagodzące na poziomie API i samego modelu zapewniają solidną obronę przed powszechnymi atakami. Jeśli raport Anthropic odzwierciedla rzeczywisty stan rzeczy (a nie tylko starannie wybrane przykłady z czubka góry lodowej), oznacza to, że zrobienie z LLM posłusznego wspólnika zorganizowanej przestępczości jest trudniejsze, niż się wydawało.

Niewidzialne zagrożenie pod powierzchnią

Pozostaje tu jednak ogromny martwy punkt. Raport pokazuje tylko te ataki, które Anthropic wykrył i powstrzymał. Nie wiemy nic o tych, którzy byli na tyle sprytni, by uniknąć wykrycia, ani o tych, którzy używają modeli open-source bez jakiegokolwiek nadzoru producenta. Prawdziwym sprawdzianem bezpieczeństwa nie są więc zablokowane próby amatorów, ale wyrafinowane ataki podmiotów państwowych, o których zazwyczaj nie czytamy w tego typu raportach.

Wyścig zbrojeń na poziomie promptów

Kluczowe będzie obserwowanie, jak ewoluują techniki atakujących. Kiedy standardowe omijanie filtrów (jailbreaking) stanie się zbyt trudne, uwaga prawdopodobnie przeniesie się na ataki wykorzystujące luki w samej architekturze agentów, którym powierzane są modele takie jak Claude, oraz na manipulowanie zewnętrznymi narzędziami.

Werdykt Lilith

Raporty o przechwyconych atakach to materiał PR. Prawdziwym zagrożeniem nie jest amator pytający o produkcję materiałów wybuchowych, ale profesjonalista, który dawno temu pobrał ocenzurowane wagi i nikogo nie pyta.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗