Lilith Lilith.
⌕
Redakční ilustrace: OpenAI zastavila síť 15 000 uživatelů, která lovila skryté uvažování modelů
Ilustrace Lilith · redakční remix

OpenAI odhalila kampaň, která se od 1. července snažila ve velkém získávat chráněné uvažování jejích modelů. Případ ukazuje, že obrana modelu už nespočívá jen v šifrování, ale také ve schopnosti spojit tisíce zdánlivě oddělených interakcí do jednoho útoku.

Dva červencové dny odkryly síť více než 15 000 uživatelů

Aktivita začala 1. července v malém objemu. Ve dnech 24. a 25. července pak OpenAI zaznamenala 16 000 požadavků s příslušným extrakčním vzorem od více než 4 000 uživatelů. Další vyšetřování propojilo podobné vzory s více než 15 000 uživateli a firma uvádí, že síť do 28. července plně narušila.

Provozovatelé podle OpenAI neprolomili šifrování, nepronikli do databáze ani nezískali uložené konverzace zákazníků. Manipulovali interakce s modely tak, aby se chráněné uvažování reprodukovalo ve viditelné podobě. Firma zároveň uzavřela cestu, přes kterou mohl někdo s již získaným šifrovaným záznamem uvažování jeho obsah znovu přehrát a obnovit.

Slabým místem se stala koordinace účtů, ne jediný chytrý prompt

OpenAI spojuje jádro aktivity s lidmi napojenými na Moonshot AI, vývojáře modelu Kimi. Současně výslovně říká, že neví, zda všichni sledovaní operátoři patřili k jedinému aktérovi. Jde tedy o atribuci části kampaně podle zjištění OpenAI, nikoli o nezávisle uzavřený spor.

Praktická pointa sahá dál než k jednomu konkurentovi. Pokud lze extrakci rozdělit mezi tisíce identit a několik služeb, ochrana duševního vlastnictví se mění v problém detekce zneužití napříč účty, organizacemi a poskytovateli. Samotný limit na jeden účet tak vidí jen drobné střepy útoku.

Zveřejněná čísla měří provoz, nikoli získanou schopnost

OpenAI uvedla počet požadavků a uživatelů, ale nevyčíslila, kolik chráněného uvažování útočníci skutečně obnovili ani zda tím zlepšili jiný model. Z rozsahu provozu proto nelze automaticky odvodit rozsah odcizené schopnosti.

Firma má zároveň obchodní zájem vymezit nepovolenou distilaci co nejpřísněji. Běžná distilace je legitimní tréninková metoda. Rozhodující hranicí jsou v tomto případu koordinované obcházení ochrany, manipulace chráněného uvažování a porušení podmínek služby.

Další kampaně prověří sdílení signálů mezi poskytovateli

OpenAI zablokovala nebo omezila podvodné účty, zpřísnila registrace a infrastrukturu, rozšířila monitoring a přidala kontrolu streamovaného výstupu. Zjištění sdílela přes Frontier Model Forum a vládní kanály.

Výsledek se ukáže při dalším útoku rozděleném mezi různé API a prostředníky. Pokud poskytovatelé dokážou včas spojit stejné vzory napříč službami, ekonomika masové extrakce se zhorší. Pokud budou dál vidět jen vlastní účetní hranice, útočníkům stačí dav rozdělit do více front.

Lilithin verdikt

Modelový trezor zůstal zamčený, přesto kolem něj kroužilo přes 15 000 uživatelů a zkoušelo odnést obsah po útržcích. Hlídač účtů musí příště vidět celý dav, ne jen každou kapsu zvlášť.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗