← Knihovna · Pojem
Souhlas s obsahem pro AI — kdo smí číst, trénovat a jednat
AI už nečte web jen jako vyhledávač. Crawler, tréninkový dataset a agentní prohlížeč mají různé dopady, takže vydavatelé a tvůrci potřebují jemnější pravidla než prosté povolit nebo zakázat.
Jeden web, různé účely použití
Dřív stačilo přibližně rozlišit, jestli stránku indexuje vyhledávač, nebo ne. U AI je to hrubé. Stejný text může skončit ve výsledku vyhledávání, v tréninkovém datasetu, v RAG odpovědi, v agentovi, který za uživatele projde stránku, nebo v produktu, který z původního obsahu vyrábí náhradu.
Souhlas s obsahem proto není jedna páčka. Vydavatel může chtít být vidět ve vyhledávání, ale odmítnout trénink modelu. Tvůrce může dovolit náhled a citaci, ale ne masové vytěžení archivu. Firma může pustit asistenta k dokumentaci, ale ne k zákaznickým datům.
„Souhlas“ zde znamená vyjádřené preference a oprávnění k použití obsahu, nikoli tvrzení, že každé použití vyžaduje individuální svolení. Například článek 4 unijní směrnice 2019/790 upravuje za určitých podmínek výjimku pro vytěžování textů a dat a možnost výhrady práv. Konkrétní právní posouzení se proto nevyčte z jedné technické značky. Směrnice, článek 4.
Robots.txt nestačí na ekonomiku AI
Robots.txt dává spolupracujícím crawlerům pravidla, které cesty smí navštěvovat. Sám ale nevynucuje přístup ani neuděluje licenci k obsahu; podle RFC 9309 nenahrazuje autentizaci. Rozlišení účelů závisí také na identitách a pravidlech konkrétního provozovatele. Robots Exclusion Protocol.
Konkrétní příklad nabízí Anthropic: odlišuje ClaudeBot pro potenciální tréninková data, Claude-SearchBot pro vyhledávání a Claude-User pro požadavky uživatele. Jejich pravidla lze nastavit odděleně; stejná jména a chování ale nelze předpokládat u jiného dodavatele. Dokumentace crawlerů.
Technický signál, smlouva a skutečný přístup
Praktické nastavení má rozlišit technické preference, licenční podmínky a skutečné řízení přístupu. Produktový tým potřebuje vědět, jaký obsah smí použít, pro jaký účel a na jakém základě. Záznam o zdroji a podmínkách použití pomůže vysvětlit konkrétní rozhodnutí; sám o sobě žádné oprávnění nevytváří.
Slabé místo je vynucování. Pokud crawler lže o účelu, míchá vyhledávání s tréninkem nebo schová čtení za běžného uživatele, pravidlo se mění v prosbu. Proto je důležitá i infrastruktura: CDN, access logy, identity botů a schopnost blokovat podle chování, ne jen podle názvu.
Proč na tom záleží produktům s agenty
Agentní prohlížeče a asistenti dělají problém ostřejší. Nejde jen o to, že model čte obsah. Agent může pod identitou uživatele procházet stránky, shrnovat placené materiály, kopírovat práci tvůrců nebo automatizovat kroky, které původní web navrhl pro člověka.
Pro produktové týmy to znamená jednoduchou disciplínu: oddělit čtení, citování, trénink a akci. Každá vrstva má mít vlastní oprávnění, logy a možnost vypnutí. Bez toho se souhlas rozmaže do jedné mlhy a spor začne až ve chvíli, kdy už je obsah dávno použitý.
Příklad: veřejná nápověda a zákaznický portál
Firma chce, aby vyhledávání našlo veřejnou nápovědu, ale smluvní dokumenty zpřístupňuje jen přihlášeným zákazníkům. U nápovědy nastaví preference pro jednotlivé roboty. Portál chrání přihlášením a oprávněním ke konkrétnímu účtu. Když asistent zákazníka shrnuje dokument, aplikace ověří přístup k tomuto dokumentu; přihlášení mu automaticky nedává právo exportovat celý archiv nebo měnit smlouvy.
Oddělené účely mohou znamenat i kompromis ve viditelnosti webu. A zákaz budoucího sběru neznamená, že se již použitý obsah automaticky odstraní z existujících modelů. Nejdřív si ujasni požadované chování, potom ověř, co konkrétní služba skutečně podporuje.
Zdroje
- RFC 9309 — pravidla robots.txt a jejich bezpečnostní omezení.
- Anthropic: dokumentace crawlerů — oddělené účely jednotlivých robotů.
- Směrnice EU 2019/790, článek 4 — vytěžování textů a dat a výhrada práv.