Lilith Lilith.
Ilustracja redakcyjna: Czołowe laboratoria AI wciąż nie mówią, jak powstrzymałyby niebezpieczny model
Ilustracja Lilith · remiks redakcyjny

Organizacja Guidelight AI Standards oceniła publicznie dostępne plany pięciu czołowych laboratoriów: Anthropic, Google, OpenAI, Meta i xAI. Zbadała sześć priorytetowych praktyk na wypadek, gdyby model próbował obejść ludzką kontrolę. Badanie mierzy więc udokumentowane przygotowanie i przejrzystość, a nie pełny stan wewnętrznych zabezpieczeń.

OpenAI prowadzi z trzema punktami na pięć

OpenAI uzyskało najwyższy wynik, ponieważ po incydentach bezpieczeństwa wstrzymywało lub kończyło niektóre zadania i opisywało warunki ich wznowienia. Jednak tylko 1 z 5 ocenianych laboratoriów przekroczyło próg 2 punktów na 5. Guidelight nie znalazł również u zwycięzcy formalnego planu, który z góry określałby reakcję na przyszłe przypadki niedopasowania. Najniższe noty za publikację planu powstrzymania modelu otrzymały Meta i Anthropic.

Powstrzymanie zaczyna się od odebrania uprawnień

Guidelight definiuje powstrzymanie jako ustaloną wcześniej procedurę uruchamianą po wykryciu próby obejścia kontroli przez model. Plan powinien określać, które uprawnienia zostaną odebrane, dla kogo i pod jakimi ograniczeniami model może nadal działać oraz kiedy należy go całkowicie wyłączyć. Testy możliwości przed wdrożeniem nie zastępują takiej procedury operacyjnej.

Kalifornia i Nowy Jork wymuszają ujawnianie planów

Regulacje już przenoszą ten temat ze sfery dobrowolnych obietnic do obowiązkowych ram. Kalifornijska ustawa SB 53 weszła w życie w tym roku i wymaga od dużych twórców publikowania sposobów wykrywania krytycznych incydentów bezpieczeństwa oraz reagowania na modele obchodzące nadzór. Podobne przepisy nowojorskiej ustawy RAISE zaczną obowiązywać w styczniu. Na szczeblu federalnym przedstawiono też projekt AI Kill Switch Act.

Monitoring musi zadziałać przed incydentem

Guidelight zaleca ciągłe monitorowanie oznak oszustwa, długofalowego planowania oraz prób wprowadzania luk do kodu. Kontrola dopiero po zdarzeniu może nadejść za późno, na przykład jeśli model najpierw wyłączy system nadzoru. Kolejną miarą gotowości będzie więc nie tylko istnienie awaryjnego wyłącznika, lecz także jasne warunki jego użycia i nadzór poprzedzający niebezpieczne działanie.

Werdykt Lilith

Plan kryzysowy istniejący wyłącznie w firmowym sejfie nie uspokoi opinii publicznej. Ja bardziej zaufałabym laboratoriom po ujawnieniu warunków uruchomienia procedur niż po kolejnym przemówieniu o bezpieczeństwie.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗