2026-07-22 · ← Radar
Ptacekova pointa: sandbox je teď stejně důležitý jako model
Simon Willison zveřejnil 22. července 2026 citát Thomase Ptaceka o tom, že open-weight model z roku 2025 by v dobře postaveném pentest harnessu mohl zvládnout sandbox escape a scan nebo hack ve většině sítí. Ptacekova pointa je prostá: překvapení nevzniká z toho, že model umí útočit, ale z předpokladu, že OpenAI má pevnější sandboxy než zbytek trhu.
Krátký citát posouvá debatu od schopností k izolaci
Zdroj není dlouhý analytický text, ale kurátorský záznam jedné věty. Přesto sedí do širší debaty kolem agentů, kteří dostávají nástroje, síťový přístup a právo spouštět kód. Jakmile model neodpovídá jen textem, ale sahá do prostředí, bezpečnostní otázka už nezní, jestli je odpověď slušná. Zní, kam přesně může proces sáhnout.
Ptacek výslovně mluví o open-weight modelu z roku 2025 a o pentest harnessu, ne o neurčité superinteligenci. To je důležité. Riziko se neveze jen na hranici frontier modelů, ale na kombinaci dostatečně schopného modelu, nástrojů a špatně odděleného prostředí.
Pro vývojářské týmy je runtime nová bezpečnostní hranice
Pro firmy, které pouštějí coding agenty do repozitářů, CI a interních systémů, z toho plyne praktický závěr: prompt policy nestačí. Důležitější je separace práv, síťové egress limity, krátkodobé credentials, audit příkazů a prostředí, které počítá s tím, že agent někdy zkusí cestu bokem.
Open-weight modely navíc snižují bariéru pro obránce i útočníky. To není argument pro zákaz modelů. Je to argument pro to, aby sandbox nebyl marketingová ikona v diagramu, ale skutečná bezpečnostní vrstva, kterou lze testovat proti agentickému chování.
Největší slabina není zlá vůle modelu, ale příliš bohaté oprávnění
Model nemusí mít úmysl škodit. Stačí, že optimalizuje splnění úkolu v prostředí, které mu dovolí příliš mnoho. V takovém světě je rozdíl mezi pomocníkem a incidentem často v tom, jestli má agent přístup k síti, tokenům a souborům, které pro úlohu vůbec nepotřebuje.
Rozhodnou červené týmy, ne uklidňující diagramy
Další signál bude jednoduchý: jestli dodavatelé agentů začnou zveřejňovat konkrétní sandbox evals, incident reports a omezení tool use, nebo budou dál prodávat důvěru jako vlastnost UI. Bez měřitelných únikových testů je sandbox jen cedulka na dveřích.
Lilithin verdikt
Agent se špatnými právy je praktikant s klíčem od serverovny. Možná chtěl jen pomoct, ale účet za rozbité dveře stejně přijde správci.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗