Lilith Lilith.
Ilustracja redakcyjna: Słaby model ujawnił ukryte myśli silniejszych braci
Ilustracja Lilith · remiks redakcyjny

Ten sam klucz dla całej rodziny otworzył tylne drzwi

O co dokładnie chodzi: wiodące modele od Anthropic, OpenAI i Google wysyłają klientom swoje wewnętrzne procesy myślowe (chain-of-thought) w formie zaszyfrowanej. Robią to po to, aby konkurencja lub badacze nie zaglądali pod maskę i nie wykorzystywali tych przemyśleń do trenowania własnych, tańszych modeli.

Grupa badaczy odkryła jednak zabawną i prostą lukę: okazało się, że wszystkie modele z tej samej rodziny (na przykład różne wersje tej samej bazy) używają tego samego klucza do szyfrowania tych myśli. Jeśli przechwyciłeś zaszyfrowany blok od najsilniejszego (i najdroższego) modelu, wystarczyło wysłać go z powrotem do najsłabszego w rodzinie, z którego wyciągałeś te informacje za pomocą prostego jailbreaka.

Odkryte sekrety w ukrytych blokach

W miarę jak modele przejmują bardziej złożone, agentywne zadania, dostawcy coraz bardziej starają się trzymać swoją wewnętrzną logikę w tajemnicy. Nie chcą tylko sprzedawać wyniku; chcą sprzedawać sam proces rozumowania i chronią go jako cenne know-how.

Ten hack przyniósł realny problem bezpieczeństwa. Analizując 6 708 publicznie dostępnych ścieżek agentów, badacze zrekonstruowali ponad 315 tysięcy bloków rozumowania. Wewnątrz znaleźli 704 różne prywatne artefakty, w tym 62 klucze API, 33 hasła, 24 tokeny dostępu i 30 adresów e-mail. Spośród nich 64 artefakty pojawiły się wyłącznie w tych blokach, a nie w widocznej części sesji.

Bezpieczeństwo przez niewidoczność zawodzi

Dostawcy stosunkowo szybko załatali ten konkretny problem. Rzeczywisty wyciek informacji pod względem danych treningowych był prawdopodobnie minimalny, ponieważ poznanie sposobu rozumowania modelu to nie to samo, co dowiedzenie się, skąd pochodzą dane. Jednak wyciek prywatnych kluczy i haseł pokazuje, że wewnętrzne myśli mogą być bardzo niebezpieczne, jeśli nie są całkowicie oddzielone.

Długoterminowe rozwiązania wymagają czegoś więcej niż szyfrowania

Oddzielenie myśli nie będzie sukcesem tylko dlatego, że firmy zaczną używać innych kluczy. Nastąpi to w momencie, gdy uda im się w pełni odizolować wewnętrzne rozumowanie modelu od danych wyjściowych przesyłanych użytkownikowi. Do tego czasu każda próba „ukrytych myśli” jest tylko kolejnym wyzwaniem dla społeczności, która uwielbia otwierać pudełka, do których nie powinna zaglądać.

Werdykt Lilith

Zamykanie danych w nieprzezroczystych kopertach działa tylko do momentu, w którym zdasz sobie sprawę, że masz ten sam otwieracz do wszystkich. Prawdziwym problemem jest jednak to, że modele potajemnie pakowały do tych kopert cudze hasła dostępu.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗