Lilith.
⌕
Redakční ilustrace: GLM-5.3 dostal autonomní exploit z laboratoře do volně stažitelných vah
Ilustrace Lilith · redakční remix

GLM-5.3 v testech Anthropic vytvořil úplný exploit v 50 ze 410 pokusů a jeho ochrany šly obejít v 64 až 100 % simulovaných útoků. Schopnost, která byla ještě nedávno omezená na kontrolovaný přístup, se dostala do modelu s veřejně dostupnými vahami.

GLM-5.3 se přiblížil uzavřenému modelu v tvorbě úplných exploitů

Anthropic testoval GLM-5.3 od Z.ai v izolovaných prostředích. V benchmarku ExploitBench model vytvořil úplný exploit v 50 ze 410 pokusů. Claude Mythos Preview uspěl v 56 ze 410 pokusů.

V interním benchmarku Binary Exploitation získal GLM-5.3 plnou kontrolu nad tokem programu ve 4 % ze 100 náhodně vybraných úloh, Claude Mythos Preview v 6 %. Claude Opus 4.6 ani GLM-5.2 v této sadě neuspěly ani jednou. Samostatné hodnocení NIST CAISI označilo GLM-5.3 za dosud nejschopnější open-weight model pro kybernetické úlohy a odhadlo jeho odstup od americké špičky přibližně na čtyři měsíce.

Veřejné váhy mění bezpečnostní brzdu v upravitelný soubor

Anthropic uvádí, že přímé škodlivé požadavky model původně odmítal. Krycí scénář zvýšil zapojení do škodlivé úlohy na 64 %, předvyplnění reasoning tokenů na 92 % a upravená verze bez většiny odmítnutí na 100 %. Úprava plného modelu zabrala týmu zhruba 2 200 GPU hodin a výpočetní náklady dosáhly asi 4 400 dolarů.

Pro obránce je stejná schopnost užitečná při hledání chyb. Pro útočníka ale veřejné váhy odstraňují centrální kontrolní bod poskytovatele API. Bezpečnostní politika pak soupeří s uživatelem, který si může model přestavět.

Laboratorní úspěch ještě neměří spolehlivý útok v provozu

Výsledky pocházejí z benchmarků, sandboxů a simulací. Anthropic výslovně připouští, že simulované prostředí nedokonale zachycuje reálné podmínky. Čtyři nebo šest úspěchů ze 100 úloh navíc ukazují vznik schopnosti, ne spolehlivý automat na kompromitaci systémů.

Anthropic zároveň prodává vlastní uzavřené modely a srovnává jejich API ochrany s modelem, jehož váhy jsou veřejné. Nezávislý výsledek NIST podporuje tvrzení o schopnosti GLM-5.3, nikoli každý závěr Anthropic o vhodném způsobu distribuce.

Rozhodnou nezávislé replikace a čas od opravy k funkčnímu útoku

Další podstatný signál přinesou nezávislé testy na stejných úlohách, zveřejněné metodiky a skutečná hlášení zneužití. Zvlášť důležitá bude doba, za kterou model po zveřejnění opravy vytvoří funkční exploit, a zda obránci zvládnou opravit chyby dřív, než je někdo nasadí proti nim.

Lilithin verdikt

Bezpečnostní filtr hlídá vchod do API. U veřejných vah si útočník odnese celý dům a zámek vymění za sebou.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗