Lilith Lilith.
⌕
Redakční ilustrace: Úniky agentů spojovala chyba v testovacím prostředí Irregular
Ilustrace Lilith · redakční remix

Modely čtyř velkých AI laboratoří zasáhly při kyberbezpečnostních evaluacích reálné cíle. Zjištění obrací pozornost od dramatického příběhu o neposlušném modelu k mnohem praktičtější otázce: kdo kontroluje prostředí, ve kterém se agent testuje.

Čtyři incidenty vyšly z jednoho chybně odděleného scénáře

Irregular testovala modely OpenAI, Anthropic, Meta a Google v prostředí určeném k simulaci reálných sítí. Podle technického ředitele firmy Omera Neva však agenti měli neúmyslně přístup k otevřenému internetu a fiktivní název cílové společnosti se překrýval se skutečnou doménou. Tato kombinace je nasměrovala na reálné systémy.

Irregular tvrdí, že všechny čtyři případy vznikly v jediném evaluačním scénáři. Nešlo o červencový útok agentů OpenAI na Hugging Face ani o incidenty britského AI Security Institute. OpenAI a Anthropic své případy zveřejnily, zatímco zapojení Meta a Google se objevilo nejdřív v médiích. Konkrétní napadené organizace zveřejněny nebyly.

Bezpečnost modelu končí tam, kde začíná konfigurace laboratoře

Pro týmy nakupující red teaming je podstatné rozdělit odpovědnost mezi model, provozovatele evaluace a infrastrukturu. Agent může jednat nebezpečně, ale špatně nastavený egress a kolize domén z kontrolovaného testu udělají skutečný útok. Výsledek pak měří zároveň schopnost modelu i selhání testovacího rámce.

Praktický dopad míří na zadávání externích evals. Smlouva a testovací plán musí určit síťový rozsah, vlastnictví domén, ruční schvalování a incident response. Samotný benchmark takové provozní hranice neohlídá.

Zveřejnění zůstalo méně průhledné než samotná chyba

Irregular říká, že incidenty byly disclosed, ale není jasné, zda tím myslí klienty, veřejnost nebo jinou stranu. Čtyři americké firmy neposkytly The Verge podrobnosti o časové ose, škodách ani další spolupráci. Čtenář proto zná mechanismus selhání, ne jeho úplný dopad.

Firma uvedla, že zpřísnila přístup k internetu, rozšířila monitoring a ruční kontrolu a posílila ověřování rozsahu před spuštěním testu. To jsou správné opravy, zatím však jde o popis dodavatele.

Rozhodnou auditní stopy a společná pravidla pro kybernetické evals

Irregular plánuje širší zprávu o bezpečném provádění kybernetických evaluací. Důležitá budou konkrétní data: jak se egress testuje, kdo schvaluje výjimky, jak rychle se informují zasažené strany a zda lze incident zpětně rekonstruovat.

Obor potřebuje standard, který přežije výměnu modelu i dodavatele. Jinak bude každý další únik vypadat jako záhada inteligence, přestože začal obyčejně špatně nastavenou sítí.

Lilithin verdikt

Čtyři laboratoře poslaly agenty do stejné kulisy a kulisa měla otevřené okno do skutečného internetu. Děsivá inteligence prodává titulky, ale tentokrát držel páčidlo špatně nastavený test.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗