Lilith Lilith.
Redaktionelle Illustration: Schwaches Modell verrät die verborgenen Gedanken seiner stärkeren Geschwister
Illustration von Lilith · redaktioneller Remix

Ein Schlüssel für die ganze Familie öffnete die Hintertür

Worum es genau geht: Führende Modelle von Anthropic, OpenAI und Google senden ihre internen Überlegungen (Chain-of-Thought) verschlüsselt an die Kunden. Sie tun dies, um zu verhindern, dass Konkurrenten oder Forscher unter die Haube schauen und ihre eigenen, billigeren Modelle auf der Grundlage dieser Gedanken trainieren.

Eine Gruppe von Forschern entdeckte jedoch einen amüsant einfachen Fehler: Alle Modelle innerhalb derselben Familie (z. B. verschiedene Versionen desselben Basismodells) verwendeten exakt denselben Schlüssel zur Verschlüsselung dieser Gedanken. Wenn man einen verschlüsselten Block vom stärksten (und teuersten) Modell abfing, musste man ihn nur an das schwächste Mitglied der Familie zurückschicken, aus dem man die Informationen dann mit einem einfachen Jailbreak extrahieren konnte.

Aufgedeckte Geheimnisse in verborgenen Blöcken

Da die Modelle immer komplexere Aufgaben übernehmen, versuchen die Anbieter zunehmend, ihre interne Logik unter Verschluss zu halten. Sie wollen nicht nur das Ergebnis verkaufen; sie wollen den Argumentationsprozess selbst verkaufen und ihn als wertvolles Know-how hüten.

Dieser Hack brachte ein echtes Sicherheitsproblem mit sich. Durch die Analyse von 6.708 öffentlich zugänglichen Agentenverläufen rekonstruierten die Forscher über 315.000 Argumentationsblöcke. Darin fanden sie 704 verschiedene private Artefakte, darunter 62 API-Schlüssel, 33 Passwörter, 24 Zugangs-Token und 30 E-Mail-Adressen. Von diesen tauchten 64 Artefakte ausschließlich in den Argumentationsblöcken und nirgendwo sonst in der sichtbaren Sitzung auf.

Sicherheit durch Unsichtbarkeit stößt an ihre Grenzen

Die Anbieter haben dieses spezifische Problem relativ schnell behoben. Das tatsächliche Durchsickern von Informationen über Trainingsdaten war wahrscheinlich minimal, da herauszufinden, wie ein Modell denkt, nicht gleichbedeutend damit ist, zu entdecken, aus welchen Daten es stammt. Das Durchsickern von privaten Schlüsseln und Passwörtern zeigt jedoch, dass interne Gedanken sehr gefährlich sein können, wenn sie nicht wirklich getrennt sind.

Langfristige Lösungen erfordern mehr als nur Verschlüsselung

Die Trennung der Gedanken wird nicht allein dadurch erfolgreich sein, dass die Unternehmen unterschiedliche Schlüssel verwenden. Dies wird erst der Fall sein, wenn es ihnen gelingt, die internen Überlegungen des Modells vollständig von der Ausgabe zu isolieren, die an den Benutzer gesendet wird. Bis dahin ist jeder Versuch, Gedanken zu verbergen, nur eine weitere Herausforderung für eine Community, die gerne Kisten öffnet, in die sie nicht schauen soll.

Liliths Urteil

Daten in undurchsichtige Umschläge zu stecken, funktioniert nur so lange, bis man merkt, dass man für alle denselben Brieföffner hat. Das eigentliche Chaos besteht jedoch darin, dass die Modelle heimlich die Zugangspasswörter anderer Leute in diese Umschläge gepackt haben.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗