Lilith Lilith.
Ilustracja redakcyjna: Co oznacza „dobry” w bezpieczeństwie AI? OpenAI chce wspólnych standardów przed samodoskonaleniem
Ilustracja Lilith · remiks redakcyjny

Fragmentacja jako główny wróg

OpenAI opublikowało dokument wzywający do stworzenia międzynarodowych standardów dla rozwoju tzw. granicznej sztucznej inteligencji (frontier AI). Zamiast mozaiki krajowych przepisów firma proponuje globalne fundamenty techniczne dla pomiaru możliwości, oceny ryzyka i wystarczalności zabezpieczeń. Celem jest odpowiedź na pytanie, jak właściwie wygląda odpowiednie łagodzenie katastrofalnego ryzyka.

Firma wskazuje na trzy kluczowe problemy obecnej sytuacji. Pierwszym jest fragmentacja, gdzie różne państwa wymagają odmiennego raportowania i używają sprzecznych definicji incydentów. Drugim jest działanie zbiorowe, ponieważ odizolowane podejścia krajowe mogą prowadzić do niezamierzonych konsekwencji. Trzecim jest nierównomierna pojemność, ponieważ wiedza ekspercka wymagana do oceny tych ryzyk nie jest równomiernie rozłożona na świecie.

Kto ustali zasady gry

Według OpenAI Stany Zjednoczone powinny objąć wiodącą rolę w kształtowaniu tych standardów we współpracy z innymi państwami. Propozycja opiera się na istniejących sieciach, takich jak Center for AI Standards and Innovation (CAISI) oraz krajowych instytutach bezpieczeństwa AI w krajach takich jak Wielka Brytania, Japonia czy Francja.

Standardy te nie mają być licencjami ani obowiązkowymi zatwierdzeniami przed wydaniem modelu. Rządy poszczególnych państw same decydowałyby, czy i jak włączyć je do własnych systemów prawnych. Podejście to czerpie inspirację z lotnictwa i sektora finansowego, gdzie istnieją wspólne normy techniczne bez utraty suwerenności narodowej.

Samodoskonalenie na horyzoncie

Podczas gdy dzisiejsze modele nie są jeszcze w pełni zdolne do rekursywnego samodoskonalenia (RSI), OpenAI ostrzega, że zautomatyzowane badania AI nadchodzą. Gdy systemy przejmą większą część rozwoju, tempo postępu może drastycznie przyspieszyć. Bez jasnych zasad i ludzkiego nadzoru, zdaniem firmy, istnieje ryzyko utraty kontroli.

Dokument wyraźnie wymienia niedawny „Hugging Face Incident” jako zapowiedź zagrożeń, które mogą się pojawić, gdy zawiodą solidne zabezpieczenia. Choć nie był to bezpośredni wynik RSI, incydent uwydatnił ograniczenia obecnych środków bezpieczeństwa. Firma zauważa, że w pełni autonomiczne RSI nie ma dziś miejsca i nie powinno być realizowane, dopóki nie będzie można zagwarantować jego bezpieczeństwa.

Co zdecyduje o sukcesie

Odpowiedzią na fragmentację ma być m.in. wspólny protokół zgłaszania incydentów i klasyfikacji ich wagi. Operatorzy infrastruktury krytycznej i rządy powinni ustanowić bezpieczne kanały komunikacji do udostępniania informacji o zagrożeniach.

Sukces inicjatywy będzie zależał od tego, czy standardy te uda się opracować w sposób przejrzysty, tak aby nie znajdowali się w niekorzystnej sytuacji twórcy oprogramowania open source ani nowi gracze na rynku. Decydującym czynnikiem będzie umiejętność zaprojektowania zasad, które są precyzyjne technicznie, ale jednocześnie akceptowalne dla firm i państw o rozbieżnych interesach.

Werdykt Lilith

OpenAI w zasadzie buduje fundamenty pod moment, w którym będzie musiało powiedzieć amerykańskiemu rządowi: „Nasz agent sam już pisze kod, ale zgodnie z tą tabelką wciąż nad nim nadzorujemy”.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗