Lilith Lilith.
Redakční ilustrace: Neviditelný vodoznak láme obranu. Text watermarking nečekaně otevírá modely injection útokům
Ilustrace Lilith · redakční remix

Odhalení vedlejšího efektu vodoznaků

Snahy o to, aby byl AI generovaný obsah rozeznatelný od lidského, narazily na nepříjemný kompromis. Podle nové studie zhoršují mechanismy textového vodoznaku obranu modelu proti nebezpečným promptům. Autoři tento jev nazývají sampling drift. Pokud model používá vodoznak, mění se pravděpodobnost výběru slov takovým způsobem, že snáze vyhoví instrukci, kterou by jinak bezpečnostní filtry zablokovaly.

Studie ukazuje, že když je vodoznak aktivní, modely odpovídají na škodlivé dotazy odlišně v závislosti na tom, jaký tajný klíč byl pro vodoznak použit. Tento jev narušuje dosavadní předpoklad, že vložení vodoznaku je pouze neškodná statistická nadstavba.

Pro týmy nasazující agenty se komplikuje volba

Dosud platilo, že zapnutí vodoznaku (jako je SynthID od Googlu) je odpovědným krokem k transparentnosti bez jakýchkoliv nákladů na funkčnost. Nové zjištění to mění. Pokud model funguje jako agent a má přístup k nástrojům, oslabená schopnost odmítnout instrukci znamená podstatně vyšší riziko prompt injection útoků.

Bezpečnostní týmy se tak dostávají do kleští. Buď nasadí model s vodoznakem a riskují, že jim útočník agenta snáze zmate a přinutí spustit nežádoucí funkci, nebo vodoznak vypnou a přijdou o možnost zpětně identifikovat, že výstup vygeneroval jejich systém.

Útok stále vyžaduje manipulaci ze strany uživatele

Neznamená to, že vodoznaky samy o sobě dělají z modelů nebezpečné zbraně. Jev oslabuje takzvaný refusal rate, tedy schopnost modelu říct uživateli ne. Útočník musí stále dodat sofistikovaný škodlivý prompt.

Rozdíl je v tom, že s aktivním vodoznakem má útočník statisticky větší šanci uspět. Objev tak upozorňuje spíše na křehkost jemného ladění modelů pro bezpečnost než na fundamentální selhání technologie samotné.

Skutečným testem bude chování enterprise platforem

Klíčové bude sledovat, jak na tento objev zareagují velcí poskytovatelé jako OpenAI nebo Anthropic, kteří jsou pod rostoucím tlakem na plošné nasazování vodoznaků. Pokud se ukáže, že vodoznak systematicky zhoršuje obranu vůči jailbreakům u modelů pracujících s firemními daty, může to jejich nasazení výrazně zbrzdit.

Důkazem vážnosti problému bude, pokud firmy začnou výslovně nedoporučovat zapínání vodoznaků u modelů, které pracují v agentním režimu a mají přístup k externím nástrojům.

Lilithin verdikt

Volba je najednou jasná. Buď víš, kdo text vygeneroval, nebo víš, že tvůj agent nepošle databázi zákazníků prvnímu hackerovi z internetu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗