2026-08-22 · ← News
Anthropic zeigt, wie Wasserzeichen im Text funktionieren sollen. Das Signal verbirgt sich in der Token-Auswahl
Das Wasserzeichen entsteht beim Tournament-Sampling
Anthropic plant, Texte auf der Ebene des Token-Samplings mit einem Wasserzeichen zu versehen, ohne das Modell neu trainieren zu müssen. Die Methode basiert auf dem Prinzip des Tournament-Samplings, bei dem ein geheimer Schlüssel die Wahl nur an den Textstellen steuert, an denen mehrere Token eine ähnlich hohe Wahrscheinlichkeit aufweisen. Die Technik greift folglich nicht dort ein, wo die Wahl des nächsten Wortes eindeutig ist.
Der Erkennungswert erfordert den Originalschlüssel
Bei einer späteren Analyse wird der Text mithilfe desselben Schlüssels und entsprechender Scoring-Funktionen ausgewertet. Ohne den Schlüssel lässt sich weder zuverlässig feststellen, ob der analysierte Text das Anthropic-Wasserzeichen trägt, noch ein Muster daraus extrahieren. Das Unternehmen gab an, eine API zur Erkennung bereitzustellen, aber laut Raschka ist bisher unklar, ob diese vollständig öffentlich sein wird oder nur ausgewählten Partnern zur Verfügung steht, was die tatsächliche Nutzbarkeit für Dritte beeinflussen wird.
Textänderungen können das statistische Signal aufbrechen
Das Wasserzeichen ist darauf angewiesen, dass bestimmte Token an ausgewählten Positionen erhalten bleiben. Wer den geheimen Schlüssel nicht kennt, weiß nicht, welche Wörter er ändern müsste, um die Markierung zu entfernen. Eine ausreichende Anzahl zufälliger Änderungen, Umformulierungen oder eingefügter Wörter kann jedoch den Gesamtwert unter die Schwelle für eine zuverlässige Erkennung drücken. Die Widerstandsfähigkeit dieser Methode liegt daher nicht in der absoluten Unveränderlichkeit des Signals, sondern darin, dass sein genauer Ort für einen Angreifer verborgen bleibt.
Regulierungsbehörden warten noch auf eine robuste Lösung
Raschka erwartet, dass ein Teil der Nutzer die Ausgaben von Claude nachträglich durch ein lokales Modell bearbeiten lässt, wodurch die statistische Signatur gelöscht wird. Es bleibt abzuwarten, ob diese Methode die strengen Anforderungen des europäischen AI Act erfüllt, dessen Durchsetzung von Artikel 50 am 2. August 2026 begann. Dieses Gesetz verlangt, dass Wasserzeichen effektiv und robust sind, doch laut den technischen Gutachtern von ACM Europe, die im Juli auf den Entwurf der Kommissionsrichtlinien reagierten, erfüllte bisher kein einziges Tool für Textwasserzeichen all diese Parameter.
Liliths Urteil
Anthropic behält die zentrale Kontrolle und bietet allen anderen die Erkennung über eine API an. Eine elegante Herkunftsüberwachung, bis der Text ein zweites Modell durchläuft und die statistische Signatur zu verschwinden beginnt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗