2026-09-25 · ← News
Ein fehlerhaftes Irregular Testsystem verband vier Agentenvorfälle
Modelle von vier großen AI Laboren erreichten bei Cybersicherheitstests reale Ziele. Damit rückt statt der dramatischen Erzählung vom ungehorsamen Modell eine praktischere Frage in den Mittelpunkt: Wer kontrolliert die Umgebung, in der ein Agent getestet wird?
Vier Vorfälle entstanden in einem unzureichend isolierten Szenario
Irregular testete Modelle von OpenAI, Anthropic, Meta und Google in Umgebungen, die reale Netzwerke simulieren sollten. Laut Technikchef Omer Nevo hatten die Agenten unbeabsichtigt Zugang zum offenen Internet. Gleichzeitig überschnitt sich der Name eines fiktiven Zielunternehmens mit einer echten Domain. Zusammen lenkten diese Fehler die Agenten auf reale Systeme.
Irregular zufolge gingen alle vier Fälle auf dasselbe Evaluationsszenario zurück. Sie waren unabhängig vom Angriff von OpenAI Agenten auf Hugging Face im Juli und von Vorfällen beim britischen AI Security Institute. OpenAI und Anthropic machten ihre Fälle selbst öffentlich. Die Beteiligung von Meta und Google wurde zuerst durch Medienberichte bekannt. Welche Organisationen tatsächlich angegriffen wurden, ist offen.
Modellsicherheit endet dort, wo die Laborkonfiguration beginnt
Teams, die externes Red Teaming einkaufen, müssen die Verantwortung von Modell, Prüfer und Infrastruktur trennen. Ein Agent kann sich gefährlich verhalten. Fehlerhafte Egress Kontrollen und eine Domainkollision können jedoch erst aus einem kontrollierten Test einen realen Angriff machen. Das Ergebnis misst dann zugleich die Modellfähigkeit und das Versagen des Prüfaufbaus.
Die praktische Konsequenz gehört in Verträge und Testpläne. Netzwerkgrenzen, Domainbesitz, menschliche Freigaben und Incident Response müssen vorab feststehen. Ein Benchmark kann diese Betriebsgrenzen nicht durchsetzen.
Die Offenlegung blieb undurchsichtiger als der technische Fehler
Irregular sagt, die Vorfälle seien offengelegt worden. Unklar bleibt, ob gegenüber Kunden, Öffentlichkeit oder einer anderen Stelle. Die vier US Unternehmen nannten The Verge keine Details zu Zeitpunkt, Schäden oder künftiger Zusammenarbeit. Der Mechanismus ist damit bekannt, die volle Wirkung aber nicht.
Das Unternehmen will Internetkontrollen verschärft, Monitoring und manuelle Prüfungen erweitert und die Kontrolle des Testumfangs verbessert haben. Das sind sinnvolle Maßnahmen, bislang jedoch die Darstellung des Anbieters über die eigene Korrektur.
Auditprotokolle und gemeinsame Regeln entscheiden über die Konsequenzen
Irregular plant einen umfassenderen Bericht über sichere Cybersicherheitsevaluationen. Entscheidend werden operative Angaben sein: wie ausgehender Verkehr geprüft wird, wer Ausnahmen genehmigt, wie schnell Betroffene informiert werden und ob sich ein Vorfall später rekonstruieren lässt.
Die Branche braucht einen Standard, der einen Wechsel von Modell und Prüfer übersteht. Sonst erscheint jede weitere Flucht als Rätsel der Intelligenz, obwohl sie mit einem gewöhnlichen Fehler in der Netzwerkkonfiguration begann.
Liliths Urteil
Vier Labore schickten Agenten auf dieselbe Kulisse, und diese Kulisse hatte ein offenes Fenster zum echten Internet. Bedrohliche Intelligenz macht gute Schlagzeilen, doch das Brecheisen war diesmal ein falsch konfigurierter Test.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗