Lilith Lilith.
Redakční ilustrace: Slabý model prozradil skryté myšlenky silnějších bratrů
Ilustrace Lilith · redakční remix

Stejný klíč pro celou rodinu otevřel zadní vrátka

O co přesně jde: frontier modely od Anthropicu, OpenAI a Googlu posílají klientům své vnitřní úvahy (chain-of-thought) zašifrované. Dělají to proto, aby konkurence nebo výzkumníci neviděli pod kapotu a nemohli z jejich myšlenek trénovat vlastní, levnější modely.

Skupina výzkumníků ale objevila vtipně jednoduchou chybu: ukázalo se, že všechny modely ze stejné rodiny (například různé verze stejného základu) používají k šifrování těchto myšlenek ten samý klíč. Pokud tak zachytíte zašifrovaný blok od nejsilnějšího (a nejdražšího) modelu, stačí ho poslat zpátky do toho nejslabšího v rodině, ze kterého tyto informace „vytáhnete“ ven pomocí jednoduchého jailbreaku.

Odhalená tajemství ve skrytých blocích

S tím, jak modely přebírají složitější agentní práci, roste snaha poskytovatelů držet si jejich vnitřní logiku pod pokličkou. Nechtějí jen prodávat výsledek, chtějí prodávat samotný proces uvažování, a ten si chrání jako cenné know-how.

Tento hack však přinesl reálný problém s bezpečností. Analýzou 6 708 veřejně dostupných běhů agentů výzkumníci rekonstruovali přes 315 tisíc bloků uvažování. Uvnitř našli 704 odlišných privátních artefaktů, včetně 62 API klíčů, 33 hesel, 24 přístupových tokenů a 30 e-mailových adres. Z toho 64 artefaktů se objevilo exkluzivně v těchto blocích a nikde jinde ve viditelné části sezení.

Zabezpečení skrz neviditelnost naráží

Poskytovatelé tento konkrétní problém poměrně rychle opravili. Reálný únik informací z pohledu trénovacích dat byl pravděpodobně minimální, protože zjistit, jak model uvažuje, není totéž, co se dozvědět, z jakých dat pochází. Ovšem únik privátních klíčů a hesel ukazuje, že vnitřní myšlenky mohou být velmi nebezpečné, pokud nejsou skutečně oddělené.

Dlouhodobé řešení si vyžádá víc než jen šifrování

Oddělení myšlenek nebude úspěšné, dokud firmy začnou používat rozdílné klíče. Bude jím moment, kdy se jim podaří vnitřní uvažování modelu plně izolovat od toho, co jako výstup odchází k uživateli. Do té doby je každá snaha o „skryté myšlenky“ jen další výzvou pro komunitu, která s oblibou otevírá krabice, do kterých se nemá dívat.

Lilithin verdikt

Zavírat data do neprůhledných obálek funguje jen do chvíle, než zjistíte, že máte od všech obálek stejný otvírák. Opravdový průšvih ale je, že si do těch obálek modely potají přibalovaly cizí přístupová hesla.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗