Lilith Lilith.
Ilustracja redakcyjna: Anthropic pokazał, jak chce znakować tekst. Sygnał ukryje w doborze tokenów
Ilustracja Lilith · remiks redakcyjny

Znak wodny powstaje podczas turniejowego doboru tokenu

Anthropic planuje znakować tekst na etapie próbkowania tokenów, bez konieczności ponownego trenowania modelu. Metoda opiera się na turniejowym doborze (tournament sampling), gdzie tajny klucz steruje wyborem tylko w tych miejscach w tekście, gdzie istnieje kilka tokenów o podobnie wysokim prawdopodobieństwie. Zatem technika ta nie ingeruje tam, gdzie wybór kolejnego słowa jest oczywisty.

Wynik detekcji wymaga oryginalnego klucza

Późniejsza analiza ocenia tekst za pomocą tego samego klucza i funkcji punktujących. Bez klucza nie da się wiarygodnie ustalić, czy badany tekst nosi znak wodny Anthropic, ani wyodrębnić z niego wzorca. Firma zapowiedziała przygotowanie interfejsu API do detekcji, ale zdaniem Raschki nadal nie wiadomo, czy będzie ono w pełni publiczne, czy też dostępne jedynie dla wybranych partnerów, co wpłynie na jego rzeczywistą przydatność dla stron trzecich.

Modyfikacje tekstu mogą rozbić sygnał statystyczny

Znak wodny zależy od zachowania konkretnych tokenów w wybranych miejscach. Osoba nieznająca tajnego klucza nie wie, które słowa powinna zmienić, aby pozbyć się oznaczenia. Niemniej jednak wystarczająca liczba losowych poprawek, przeredagowań lub dopisanych słów może obniżyć ogólny wynik poniżej progu rzetelnej detekcji. Odporność tej metody polega więc nie na absolutnej niezmienności sygnału, lecz na tym, że jego dokładne położenie pozostaje ukryte przed atakującym.

Organy regulacyjne wciąż czekają na solidne rozwiązanie

Raschka przewiduje, że część użytkowników będzie przepuszczać wyjście z Claude przez model lokalny, co wymaże statystyczny podpis. Pozostaje otwartym pytaniem, czy metoda ta spełni rygorystyczne wymogi europejskiego AI Act, którego egzekwowanie artykułu 50 rozpoczęło się 2 sierpnia 2026 roku. Wymaga on, by znakowanie wodne było skuteczne i odporne, jednak według recenzentów technicznych ACM Europe odnoszących się w lipcu do projektu wytycznych Komisji, jak dotąd żadne pojedyncze narzędzie do znakowania tekstu nie spełniało wszystkich tych kryteriów.

Werdykt Lilith

Anthropic zachowa centralną kontrolę, a reszcie zaoferuje detekcję przez API. Elegancki nadzór nad pochodzeniem, dopóki tekst nie przejdzie przez drugi model i statystyczny podpis nie zacznie znikać.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗