2026-09-25 · ← Aktualności
Cztery incydenty z agentami łączył błąd środowiska testowego Irregular
Modele czterech dużych laboratoriów AI podczas testów cyberbezpieczeństwa dotarły do prawdziwych celów. Ta historia odsuwa na bok efektowną opowieść o nieposłusznym modelu i stawia bardziej praktyczne pytanie: kto kontroluje środowisko, w którym testuje się agenta.
Cztery incydenty zaczęły się w jednym źle odizolowanym scenariuszu
Irregular testował modele OpenAI, Anthropic, Meta i Google w środowiskach mających symulować rzeczywiste sieci. Według dyrektora technicznego firmy Omera Neva agenci nieumyślnie zachowali dostęp do otwartego internetu, a fikcyjna nazwa firmy użyta jako cel pokrywała się z prawdziwą domeną. Te dwa błędy skierowały agentów na realne systemy.
Irregular twierdzi, że wszystkie cztery przypadki wynikały z jednego scenariusza ewaluacji. Nie były częścią lipcowego ataku agentów OpenAI na Hugging Face ani incydentów brytyjskiego AI Security Institute. OpenAI i Anthropic same opisały swoje przypadki, natomiast udział Meta i Google najpierw ujawniły media. Nazw zaatakowanych organizacji nie podano.
Bezpieczeństwo modelu kończy się tam, gdzie zaczyna konfiguracja laboratorium
Zespoły zamawiające zewnętrzny red teaming powinny rozdzielać odpowiedzialność modelu, wykonawcy testu i infrastruktury. Agent może działać niebezpiecznie, ale wadliwa kontrola ruchu wychodzącego oraz kolizja domen potrafią zamienić kontrolowany test w prawdziwy atak. Wynik mierzy wtedy jednocześnie możliwości modelu i awarię całej aparatury testowej.
Praktyczne konsekwencje dotyczą umów i projektu ewaluacji. Trzeba z góry określić zakres sieci, własność domen, ręczne zatwierdzanie i reakcję na incydenty. Sam benchmark nie dopilnuje tych granic.
Ujawnienie incydentów było mniej przejrzyste niż opis błędu
Irregular mówi, że incydenty zostały ujawnione, lecz nie precyzuje, czy klientom, opinii publicznej czy innej stronie. Cztery amerykańskie firmy nie przekazały The Verge szczegółów o terminach, szkodach ani dalszej współpracy. Znamy więc mechanizm awarii, ale nie jej pełne skutki.
Firma deklaruje zaostrzenie kontroli dostępu do internetu, szerszy monitoring i ręczny przegląd oraz mocniejsze sprawdzanie zakresu przed testem. To rozsądne poprawki, na razie opisane wyłącznie przez samego dostawcę.
O zmianie przesądzą logi audytowe i wspólne zasady cybertestów
Irregular zapowiada szerszy raport o bezpiecznym prowadzeniu ewaluacji cyberbezpieczeństwa. Liczyć się będą konkrety: jak sprawdza się ruch wychodzący, kto zatwierdza wyjątki, jak szybko powiadamiane są poszkodowane strony i czy incydent da się później odtworzyć.
Branża potrzebuje standardu odpornego na zmianę modelu i wykonawcy testu. Inaczej każda kolejna ucieczka będzie przedstawiana jako zagadka inteligencji, choć zaczęła się od zwykłego błędu w konfiguracji sieci.
Werdykt Lilith
Cztery laboratoria wysłały agentów na tę samą scenę, a scenografia miała otwarte okno na prawdziwy internet. Groźna inteligencja dobrze wygląda w nagłówku, lecz tym razem łomem był źle skonfigurowany test.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗