Lilith Lilith.
Redaktionelle Illustration: Die Internet-Säuberung wird verschoben. Anwälte von Microsoft und OpenAI geben zu, dass Training ohne fremde Inhalte eine wirtschaftliche Fiktion ist
Illustration von Lilith · redaktioneller Remix

Tech-Giganten tun nicht länger so, als könnten sie hochmoderne KI ausschließlich mit gemeinfreien Daten und gekauften Archiven trainieren. Dokumente, die OpenAI und Microsoft dem britischen Oberhaus vorgelegt haben, offenbaren eine pragmatische Verteidigung ihres aktuellen Ansatzes im Umgang mit Daten. Sie räumen ein, dass das Scraping des gesamten Webs umstritten ist, bestehen jedoch darauf, dass es ohne dies weder technisch noch wirtschaftlich machbar ist.

Vertreter von 404 Media kritisieren diese Haltung scharf als Diebstahl. Aus geschäftlicher Sicht ist es jedoch eine klare Grenzziehung. OpenAI stellt unverblümt fest, dass das Urheberrecht, wie es heute geschrieben steht, die Existenz von Foundation Models im Wesentlichen verbieten würde, wenn es im Internet strikt durchgesetzt würde. Die Rechtslehre des Fair Use ist somit für sie eine existenzielle Notwendigkeit, nicht nur ein bequemes Schlupfloch.

Das Ende des Mythos der sauberen Daten

Für Unternehmenskunden und Investoren ist diese Aussage ein wichtiges Signal. Es bedeutet das endgültige Ende des Mythos, dass bald jemand ein ebenso leistungsfähiges Modell ausschließlich mit lizenzierten und 'sauberen' Daten bauen wird. Kommerzielle Vereinbarungen mit Verlagen (wie sie OpenAI mit Axel Springer oder AP hat) sind nur ein Tropfen auf den heißen Stein des erforderlichen Trainingsvolumens.

Das offene Eingeständnis der Abhängigkeit von Web Scraping zeigt, dass das Risiko von Urheberrechtsklagen dauerhaft in das Geschäftsmodell eingepreist ist. KI-Unternehmen wetten darauf, dass technologischer und geopolitischer Druck Gerichte und Regulierungsbehörden zwingen wird, die Regeln zugunsten der Entwicklung zu biegen, anstatt zu riskieren, die Innovation in einem bestimmten Land zu stoppen.

Wer bezahlt für die Infrastruktur des Webs

Das eigentliche Problem ist nicht das Training selbst, sondern die Auswirkungen auf das Ökosystem, das die Daten produziert. Ersteller von Inhalten und kleinere Websites verlieren Traffic, weil LLMs direkt im Chat antworten. Wenn das Wirtschaftsmodell der Ersteller zusammenbricht, verlieren die Modelle eine Quelle für neue Daten zum Trainieren zukünftiger Generationen (sogenannter Modellkollaps).

Während große Verlage individuelle Lizenzen aushandeln werden, bleibt der Long Tail des Internets unkompensiert. Die aktuelle Situation ist unhaltbar: KI-Unternehmen schöpfen als kostenlose Infrastruktur Wert aus dem öffentlichen Web, untergraben diese Infrastruktur jedoch mit ihren Produkten aktiv.

Eine neue Definition des Urheberrechts

Dieser Konflikt steuert auf eine unvermeidliche Umschreibung der Regeln zu. Ob durch neue Gesetze oder richtungsweisende Gerichtsentscheidungen, die Definition des Urheberrechts muss sich an die Tatsache anpassen, dass das Lesen von Texten durch eine Maschine zum Verständnis von Mustern nicht mehr genauso bestraft werden kann wie Raubkopien.

Mechanismen zum Deaktivieren des Trainings

Entscheidend wird sein, wie die Regulierungsbehörden an Opt-out-Mechanismen herangehen. Der Beweis für einen Wandel wird nicht eine weitere Klage von Autoren sein, sondern der weit verbreitete Einsatz von Technologien, die es Website-Betreibern ermöglichen, effektiv einen Preis für die Aufnahme ihrer Daten in den Trainingskorpus auszuhandeln.

Liliths Urteil

Die Märchen von der Fütterung von Modellen mit ausschließlich gekauften und fair gehandelten Inhalten sind vorbei. OpenAI hat vor Gericht gerade laut ausgesprochen, was jeder weiß: Unser Geschäft funktioniert nur, weil wir das gesamte Internet kostenlos übernommen haben, und wenn Sie uns das verbieten, sind wir erledigt.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗