Lilith Lilith.
CS EN PL

Boris Cherny z Anthropic vytáhl u Opus 5 detail, který se v běžném benchmarkovém srovnání snadno ztratí: model má být podle systémové karty nejméně prompt injectable modelem firmy. Simon Willison cituje právě tuto pasáž a odkazuje na část systémové karty na straně 73.

Anthropic u Opus 5 tlačí bezpečnost agenta do popředí

Zdroj je krátká kurátorská poznámka, ne plný produktový rozbor. Tvrdí ale konkrétní věc: podle Borise Chernyho je Opus 5 napříč PI evals a red teaming velmi těžké úspěšně prompt injectnout.

To je jiný typ signálu než skóre v coding benchmarku. Prompt injection není akademická drobnost, ale útok na hranici mezi instrukcemi uživatele, systémovým zadáním a obsahem, který model čte zvenku.

U agentů s tool use je tahle hranice drahá. Když model čte dokumenty, web, tickets nebo e-mail a zároveň smí volat nástroje, slabá odolnost proti prompt injection mění produktovou funkci v bezpečnostní incident.

Pro agentické produkty je spolehlivost levnější než další bod v evals

Pro vývojáře, kteří staví workflow nad Claude nebo jinými modely, je tahle zpráva praktická. Model nemusí být ve všem nejchytřejší, pokud se dá bezpečněji zapojit do prostředí, kde cizí text aktivně manipuluje s instrukcemi.

Týmy dnes často řeší prompt injection až nad modelem: filtry, oddělené kontexty, allowlisty nástrojů, ruční schvalování a audit. Pokud se část odolnosti zlepší uvnitř modelu, nezmizí potřeba těchto vrstev. Zmenší se ale počet případů, kdy bezpečnost stojí jen na křehké aplikační logice.

Systémová karta není provozní záruka

Slabé místo je jasné: věta ze systémové karty nenahrazuje nezávislé testování v reálném produktu. Prompt injection je kontextový problém a útoky často vznikají přes kombinaci dokumentu, oprávnění a špatně navrženého tool use.

Opus 5 proto nelze brát jako štít, který dovolí pustit agenta ke všemu. Lepší model jen posouvá základnu. Architektura oprávnění, logging a možnost zastavit akci zůstávají na týmu, který systém nasazuje.

Rozhodnou veřejné red teamy a incidenty z provozu

Další signál nebude další sloupec v tabulce. Důležité bude, jestli nezávislí testeři dokážou Opus 5 systematicky prolomit v běžných agentických scénářích: práce s repozitářem, čtení podpůrných tiketů, plánování změn a volání interních nástrojů.

Pokud se tvrzení Anthropic potvrdí mimo vlastní evals, prompt injection se začne přesouvat z marketingové poznámky do nákupního kritéria. Bez toho zůstane Opus 5 hlavně slibem ukrytým v PDF.

Lilithin verdikt

Nejzajímavější na Opus 5 nemusí být sval, ale vrátný u dveří. Agent, který čte cizí text a sahá na nástroje, potřebuje nejdřív odolat cedulce s nápisem udělej něco hloupého.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗