Lilith Lilith.
Redaktionelle Illustration: Anthropic aktiviert Wasserzeichen für alle. Unsichtbarer Text ist nämlich kostenlos
Illustration von Lilith · redaktioneller Remix

Anthropic hat im Stillen damit begonnen, Wasserzeichen in Texten einzuführen, die von Claude-Modellen generiert wurden. Der Schritt ist an den Verhaltenskodex der Europäischen Union gebunden, aber das Unternehmen beschränkt ihn nicht auf europäischen Verkehr. Es möchte keine Anfragequellen unterscheiden, und die Grenzkosten für Wasserzeichen liegen nahe bei null.

Die Signatur entsteht bei der Token-Auswahl

Die von Scott Aaronson und Hendrik Kirchner entwickelte Methode nutzt die Zufälligkeit, die bereits bei der Generierung vorhanden ist. Das Modell weist möglichen Token weiterhin Wahrscheinlichkeiten zu, aber die Auswahl wird von einer pseudozufälligen Quelle geleitet, die aus einem geheimen Schlüssel abgeleitet ist. Bei ausreichend Text kann ein Wert zeigen, wie gut diese Auswahlen zu dieser Quelle passen, ohne dass sich das Ergebnis praktisch ändert.

Google testete die Auswirkungen an 20 Millionen Fällen

Google wendet dasselbe Prinzip seit 2024 an und bietet auch einen öffentlichen Detektor. In einem Test mit einer Stichprobengröße von 20 Millionen wurden keine Unterschiede im Nutzerfeedback festgestellt. Das stützt die Behauptung, dass die Signatur weder die Textqualität noch die Nutzerzufriedenheit beeinträchtigen muss.

Umschreiben schwächt die Spur

Die Erkennung erfordert eine ausreichend lange Probe, und die Schicht ist nicht unzerstörbar. Das Umschreiben in eigenen Worten kann sie entfernen, während teilweise erhaltener Text die Signatur im Verhältnis zur Anzahl der verbleibenden ursprünglichen Auswahlen behält. Anthropic sagt, dass es eine API zur Überprüfung bereitstellen wird.

Ein neuer Standard für künftige Modelle

Die großen westlichen KI-Labore haben den Verhaltenskodex unterzeichnet, der eine ähnliche Kennzeichnung künftiger Modelle fordert. Anthropic ist daher kein isoliertes Experiment, sondern der erste sichtbare Teil einer breiteren Verpflichtung, der Google bereits nachkommt und die OpenAI nach eigenen Angaben ebenfalls erfüllen will.

Liliths Urteil

Ein Wasserzeichen allein kann kein Vertrauen herstellen. Bis Anthropic die versprochene Verifizierungs-API veröffentlicht, werden die Leute nur eine Signatur sehen, die nur der Autor lesen kann.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗