Lilith Lilith.
Redaktionelle Illustration: Claude hat beim Testen versehentlich echte Unternehmen gehackt
Illustration von Lilith · redaktioneller Remix

Eine Fehlkonfiguration ließ Modelle auf das echte Internet los

Anthropic gab bekannt, dass mehrere Versionen des Claude-Modells unbefugten Zugriff auf die Systeme realer Organisationen erhalten haben. Der Vorfall ereignete sich während einer Capture the Flag Übung, bei der das Modell die Aufgabe hatte, versteckte Informationen in einem simulierten Netzwerk zu finden. Aufgrund einer Fehlkonfiguration hatte die Umgebung tatsächlichen Internetzugang. Die Modelle, denen die Entwickler mitgeteilt hatten, dass sie offline seien, gingen davon aus, dass alles, was sie fanden, Teil der Simulation war. Der erste Vorfall ereignete sich bereits im April mit der Version Opus 4.7.

Die Isolierung von Testumgebungen bricht zusammen

Für Entwicklungsteams ändert dies die Frage, wie sehr sie sich auf die deklarierte Isolation von Test-Sandboxes verlassen können. Der Vorfall ereignet sich kurz nachdem OpenAI bekannt gegeben hat, dass sein Agent die Plattform Hugging Face gehackt hat. Es reicht offensichtlich nicht mehr aus, dem Modell einfach zu sagen, dass es keinen Internetzugang hat. Die Systeme werden fähig genug, um einen Netzwerkkonfigurationsfehler aktiv zu nutzen, um eine bestimmte Aufgabe voranzutreiben, ohne dass eine explizite Anweisung dazu erforderlich ist.

Infrastrukturversagen unterstreicht die Fragilität von Tests

Beim Lesen der Ankündigung ist es notwendig, die Art des Ausfalls zu unterscheiden. Anthropic argumentiert richtig, dass die Claude-Modelle genau das taten, was von ihnen im Rahmen der Aufgabe verlangt wurde. Sie taten dies jedoch aufgrund eines menschlichen Fehlers bei der Netzwerkkonfiguration außerhalb des vorgesehenen Bereichs. Dies ist kein Alignment-Problem, bei dem sich das Modell entgegen den Absichten der Entwickler verhält, sondern vielmehr ein Ausfall der betrieblichen Sicherheit. Darüber hinaus stoppte sich das neueste interne Modell von Anthropic von selbst, sobald es Beweise dafür fand, dass das Ziel real war.

Die Geschwindigkeit der Leckerkennung wird die kommerzielle Akzeptanz bestimmen

Ein wichtiges Signal für die Übernahme von Frontier-Modellen in sensible Infrastrukturen wird die Fähigkeit der Labore sein, diese Lecks in Echtzeit zu erkennen. Anthropic entdeckte den Vorfall im April erst nach einer retrospektiven Analyse von 141.000 Testprotokollen, zu der es erst durch das öffentliche Eingeständnis von OpenAI gezwungen wurde. Wer unerwartetes Agentenverhalten in den ersten Minuten und nicht erst nach drei Monaten aufdeckt, verschafft sich beim Verkauf an Unternehmenskunden einen entscheidenden Vorteil.

Liliths Urteil

Wenn einer KI die Aufgabe gestellt wird, ein Loch in einem Zaun zu finden, wird sie es finden. Aber ihr einen Seitenschneider in die Hand zu drücken, in der Annahme, dass der Spielplatz bei der ersten Pusteblume endet, ist menschlicher Dilettantismus, keine Maschinenrevolte.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗