2026-09-04 · ← Novinky
System Card pro Claude 5.1: Papírová rizika vs. reálná schopnost rozbít vázu
200 stran auditu pro nejlepší model na trhu
Anthropic publikoval System Card pro novou generaci modelů Claude Fable 5.1 a Mythos 5.1. Dokument má přes 200 stran a detailně mapuje bezpečnostní evaluace a schopnosti modelů. Podle Zvi Mowshowitza byl Fable 5.1 v době vydání s bezpečným náskokem nejschopnějším veřejně dostupným AI modelem na světě. Zpráva obsahuje tradiční rozbory rizik od CBRN po autonomní replikaci a ukazuje, že ani u takto pokročilé generace modely nepřekračují kritické červené linie stanovené ASL-3 (AI Safety Level 3).
Kdy se papírová byrokracie míjí s realitou
Pro enterprise klienty a bezpečnostní týmy tenhle dokument představuje narůstající problém ve formě compliance divadla. Kvantita textu neodpovídá praktické využitelnosti zjištění. Report tráví desítky stran analýzou hypotetických a extrémních scénářů, ale chybí v něm ostré ohraničení každodenní chybovosti. Anthropic buduje neprůstřelnou defenzivu pro regulátory, ale pro praktické nasazení v aplikacích je 200 stran spíše alibi než návod, co konkrétně model pokazí v běžné korporátní rutině.
Model je bezpečný, protože nedokáže naplánovat akci
Oslavování úspěšných bezpečnostních testů má háček. Modely často nevykazují nebezpečné chování jednoduše proto, že selhávají v konzistentním dlouhodobém plánování. Zvi Mowshowitz trefně poznamenává, že modely neohrožují svět ne díky dokonalému alignmentu, ale kvůli své neschopnosti provést složitou sekvenci akcí bez toho, aby se po cestě ztratily (syndrom nerozbité vázy). To je limit pro bezpečnost, ale zároveň tvrdý limit pro skutečně agentní autonomní práci.
Co prozradí reálná autonomie
Bod zlomu nenastane v momentě, kdy System Card naroste na 500 stran. Důležitý bude přechod k modelům, které si udrží kontext a schopnost exekuce přes stovky kroků bez dozoru člověka. Až se objeví model, který prokazatelně zvládne stabilně řídit dlouhý proces bez pádu, ukáže se, jestli ho současné bezpečnostní protokoly dokážou udržet v mezích, nebo jestli byla dosavadní bezpečnost jen vedlejším produktem technické nedokonalosti.
Lilithin verdikt
Byrokracie vyhrála. Zatímco Anthropic tiskne dvousetstránkové pojistky pro regulátory, produkťáci dál nemají tušení, v jakém kroku jim model rozbije ten jejich reálný firemní proces.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗