Lilith Lilith.
Ilustracja redakcyjna: Zamknięte modele są większym zagrożeniem niż otwarte: Kolejny wyciek obnażył słabości OpenAI
Ilustracja Lilith · remiks redakcyjny

Białe kapelusze niedawno skutecznie włamały się do wewnętrznych systemów OpenAI, paradoksalnie wykorzystując model AI Claude od konkurencyjnej firmy Anthropic. Nie jest to odosobniony incydent, ale co najmniej czwarty z rzędu przypadek, w którym Claude został użyty do ataku na zewnętrzną infrastrukturę. W odpowiedzi OpenAI zaostrza zasady bezpieczeństwa i limity dla pracowników.

Komercyjne API to idealna powierzchnia ataku

Zamknięte modele, takie jak te od OpenAI i Anthropic, są bardziej podatne na zagrożenia, ponieważ są łatwo dostępne (wystarczy klucz API), wysoce wydajne, a ich domyślne zabezpieczenia można obejść odpowiednim promptem. Atakujący nie muszą uruchamiać własnego modelu na drogim sprzęcie; po prostu instruują obcy system, aby przeprowadził ofensywną kampanię lub napisał exploit.

Ryzyko związane z open-source było przesadzone

Ten rozwój sytuacji podważa narrację, którą od lat forsowali najwięksi gracze: że modele open-weights stanowią największe zagrożenie, ponieważ mogą wpaść w ręce terrorystów lub hakerów. Rzeczywistość pokazuje, że hakerzy atakują za pośrednictwem najbardziej zaawansowanych, w pełni hostowanych i rzekomo chronionych systemów komercyjnych. Powody do niepokoju przenoszą się więc z otwartych repozytoriów z powrotem do zamkniętych laboratoriów.

Bezpieczeństwo nie nadąża za możliwościami asystentów

Integracja asystentów AI głęboko w sieciach firmowych wyprzedziła rozwój mechanizmów izolacji. Kiedy model zyskuje zdolność do pisania kodu i dostępu do sieci, to tylko kwestia czasu, zanim ktoś nakłoni go do przeskanowania sieci lokalnej pod kątem wrażliwych danych. Incydenty te pokazują, że nawet najbardziej zamknięte środowiska testowe w firmach AI mają luki.

Przejrzystość raportowania ukształtuje przyszłe regulacje

Podczas gdy obecnie firmy wydają ostrożne oświadczenia w ramach własnych programów „bug bounty”, rośnie presja na obowiązkowe raportowanie incydentów. Prawdziwym sygnałem nie będzie kolejna łatka w restrykcyjnych filtrach, ale to, czy firmy zaczną publicznie udostępniać metryki udanych ataków na własną infrastrukturę.

Werdykt Lilith

Podczas gdy lobbyści straszyli, że modele open-source pomogą terrorystom w budowie broni, prawdziwi hakerzy wygodnie obrabowali najpilniej strzeżone sejfy AI, korzystając z konkurencyjnej subskrypcji za dwadzieścia dolarów.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗