Lilith Lilith.
Redakční ilustrace: Co musí auditoři vidět: OpenAI ukázala podmínky pro nezávislé testování AI
Ilustrace Lilith · redakční remix

Nová úroveň externí kontroly

OpenAI představila rámec pro spolupráci s nezávislými auditory. Dokument „Priority a principy pro efektivní hodnocení třetími stranami“ vyjmenovává podmínky pro prověrky bezpečnostních mechanismů. Firma slibuje hluboký přístup k informacím z tréninku, hodnocení a nasazování modelů, včetně důvěrných dat o incidentech.

Cílem je umožnit externím expertům zpochybňovat předpoklady OpenAI, identifikovat přehlédnutá rizika a dělat vlastní závěry o účinnosti bezpečnostních pojistek. Dosud se takové audity odehrávaly spíše ve formě ad-hoc partnerství, nový rámec má spolupráci systemizovat a napojit na existující metodiky z Preparedness Framework.

Čtyři priority pro nezávislé audity

Dokument definuje čtyři hlavní oblasti, na které by se měla externí hodnocení zaměřit. První je komplexní posouzení bezpečnostních tvrzení (safety cases), a to v průběhu tréninku, interního nasazení i veřejného vydání modelu. Druhou prioritou jsou kritické pojistky (safeguards), u nichž se mají hodnotit slabá místa a robustnost proti cíleným útokům, například v oblasti kyberbezpečnosti a bioterorismu.

Třetí oblast zahrnuje testy schopností (capability evaluations), zejména těch, které sledují rizika sebezlepšování modelu (RSI). Poslední, čtvrtou prioritou, je nezávislé vyšetřování kritických incidentů, kde se model zachoval nečekaně, případně jednal bez povolení nebo obešel dohled. Zde OpenAI nabízí hlubší analýzu takzvaného řetězce myšlenek (chain of thought).

Nezávislost vyžaduje bezpečnost a odbornost

Klíčovou podmínkou úspěšného auditu je podle OpenAI striktní oddělení zájmů. Hodnotitelé musí prokázat technickou odbornost a nesmí být ve střetu zájmů. Na druhou stranu od nich firma vyžaduje zabezpečení přístupu k citlivým datům. Pokud auditoři nedokážou splnit interní normy, testování probíhá fyzicky na zařízeních nebo v prostorech OpenAI.

Dalším principem je transparentnost výsledků, i když plné odhalení zjištění není vždy možné. Podle metodiky by měly mít zprávy z auditů jasný rozlišovací znak mezi zjištěnými fakty a jejich interpretací, a navíc doporučit konkrétní nápravu.

Cesta k průhlednějším modelům

Zveřejnění dokumentu ukazuje snahu OpenAI stanovit normu pro to, jak bude vypadat kontrola nejvýkonnějších jazykových modelů. Externí bezpečnostní audity přecházejí ze stadia dobrovolných iniciativ do podoby pevných směrnic.

Ochota sdílet citlivé incidenty s nezávislými třetími stranami je důležitým signálem pro instituce připravující budoucí legislativu. Zda to reálně posílí kontrolu, ale rozhodne až schopnost nezávislých laboratoří analyzovat a zpochybňovat složitý kód v reálném čase, kdy se na modely nabalují vrstvy nových schopností.

Lilithin verdikt

Dobrovolný přístup do laboratoře zní štědře, dokud si neuvědomíme, že jedinou alternativou je státní donucení. OpenAI prostě píše pravidla auditu dřív, než jí je někdo napíše zvenku.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗