2026-08-22 · ← Novinky
Přední AI laboratoře stále neříkají, jak by zadržely nebezpečný model
Organizace Guidelight AI Standards posoudila veřejně dostupné plány pěti předních laboratoří: Anthropic, Google, OpenAI, Meta a xAI. Sledovala šest prioritních postupů pro situaci, kdy se model pokusí obejít lidskou kontrolu. Studie proto měří doloženou připravenost a transparentnost, nikoli úplný stav interních bezpečnostních opatření.
OpenAI vede se třemi body z pěti
OpenAI získalo nejvyšší skóre, protože už po bezpečnostních incidentech pozastavilo nebo ukončilo některé pracovní zátěže a popsalo podmínky pro jejich obnovení. Přesto jen 1 z 5 hodnocených laboratoří překročila hranici 2 bodů z celkových 5. Guidelight navíc ani u vítěze nenašel formální plán, který by předem určoval reakci na budoucí incidenty s nesouladem. Nejnižší skóre za zveřejněný plán dostaly Meta a Anthropic.
Zadržení začíná odebráním oprávnění
Guidelight chápe containment jako předem stanovený postup spuštěný ve chvíli, kdy systém odhalí pokus modelu narušit kontrolu. Plán má určit, která oprávnění se odeberou, pro koho a za jakých omezení smí model dál pracovat a kdy se úplně vypne. Testování schopností před nasazením tento provozní postup nenahrazuje.
Kalifornie a New York vynucují zveřejnění
Regulace už přesouvá téma z dobrovolných slibů do povinných rámců. Kalifornský zákon SB 53 letos začal vyžadovat, aby velcí vývojáři zveřejňovali, jak rozpoznávají kritické bezpečnostní incidenty a reagují na modely obcházející dohled. Podobná pravidla newyorského zákona RAISE začnou platit v lednu. Na federální úrovni byl navíc předložen návrh AI Kill Switch Act.
Monitoring musí zasáhnout před incidentem
Guidelight doporučuje průběžně sledovat známky klamání, dlouhodobého plánování a pokusů zanést zranitelnosti do kódu. Kontrola až po události může přijít pozdě, například pokud model nejprve vyřadí kontrolní systém. Dalším měřítkem připravenosti proto nebude jen existence nouzového vypínače, ale také jasně stanovené spouštěče a dohled před nebezpečnou akcí.
Lilithin verdikt
Krizový plán, který existuje jen v interním trezoru, veřejnost neuklidní. Já bych laboratořím věřila víc po zveřejnění spouštěcích podmínek než po dalším proslovu o bezpečnosti.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗