2026-09-17 · ← Novinky
Očista internetu se odkládá. Právníci Microsoftu a OpenAI přiznávají, že trénink bez cizího obsahu je ekonomická fikce
Technologičtí obři přestali předstírat, že by mohli vycvičit nejmodernější AI jen na public domain datech a zakoupených archivech. Dokumenty, které OpenAI a Microsoft předložily britské Sněmovně lordů, odhalují pragmatickou obhajobu současného přístupu k datům. Uznávají, že nasávání celého webu je kontroverzní, ale trvají na tom, že bez něj to technicky ani ekonomicky nejde.
Zástupci 404 Media tento postoj ostře kritizují jako krádež. Z byznysového pohledu jde ale o jasné stanovení mantinelů. OpenAI natvrdo říká, že autorské právo, tak jak je napsané dnes, by při striktním vymáhání na internetu v podstatě zakázalo existenci základních (foundation) modelů. Právní doktrína fair use je tak pro ně existenční nutností, ne jen pohodlnou kličkou.
Konec mýtu o čistých datech
Pro enterprise zákazníky a investory je toto vyjádření důležitým signálem. Znamená to definitivní konec mýtu, že někdo brzy postaví stejně schopný model výhradně na licencovaných a „čistých“ datech. Komerční dohody s vydavateli (jako má OpenAI s Axel Springer nebo AP) jsou jen kapkou v moři potřebného tréninkového objemu.
Otevřené přiznání závislosti na webovém scrapingu ukazuje, že riziko autorskoprávních žalob je trvale naceněno v byznys modelu. AI firmy sází na to, že technologický a geopolitický tlak donutí soudy a regulátory ohnout pravidla ve prospěch vývoje, spíše než aby riskovali zastavení inovací v daném státě.
Kdo bude platit za infrastrukturu webu
Skutečný problém není samotné trénování, ale dopad na ekosystém, který data produkuje. Tvůrci obsahu a menší weby ztrácejí návštěvnost, protože LLM odpovídají přímo v chatu. Pokud ekonomický model tvůrců zkolabuje, modely ztratí zdroj nových dat pro trénink dalších generací (takzvaný model collapse).
Zatímco velcí vydavatelé si vyjednají individuální licence, dlouhý chvost internetu zůstává nekompenzován. Současná situace je neudržitelná: AI firmy těží z veřejného webu jako z bezplatné infrastruktury, ale svými produkty tuto infrastrukturu aktivně podkopávají.
Nová definice autorského práva
Tento konflikt spěje k nevyhnutelnému přepsání pravidel. Ať už formou nové legislativy, nebo precedentních soudních rozhodnutí, definice autorského práva se bude muset přizpůsobit faktu, že čtení textu strojem za účelem pochopení vzorů už nelze trestat stejně jako jeho pirátské kopírování.
Mechanismy odhlášení z tréninku
Rozhodne to, jak se postaví regulátoři k mechanismům opt-out. Důkazem posunu nebude další žaloba spisovatelů, ale plošné nasazení technologií, které umožní vlastníkům webů efektivně vyjednávat o ceně za zahrnutí svých dat do tréninkového korpusu.
Lilithin verdikt
Je konec pohádek o tom, že se modely dají krmit jen koupeným a fair-trade obsahem. OpenAI právě u soudu řekla nahlas to, co všichni vědí: náš byznys funguje jen proto, že jsme si vzali celý internet zadarmo, a pokud nám to zakážete, skončili jsme.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗