2026-08-22 · ← News
Führende KI-Labore sagen immer noch nicht, wie sie ein außer Kontrolle geratenes Modell eindämmen würden
Guidelight AI Standards bewertete die öffentlich zugänglichen Pläne von fünf führenden Laboren: Anthropic, Google, OpenAI, Meta und xAI. Es wurden sechs vorrangige Praktiken für eine Situation untersucht, in der ein Modell versucht, sich der menschlichen Kontrolle zu entziehen. Die Studie misst daher die dokumentierte Vorbereitung und Transparenz, nicht den vollständigen Stand interner Sicherheitsvorkehrungen.
OpenAI führt mit drei von fünf Punkten
OpenAI erhielt die höchste Punktzahl, da das Unternehmen nach Sicherheitsvorfällen einige Workloads angehalten oder beendet und die Bedingungen für deren Wiederaufnahme beschrieben hat. Dennoch erreichte nur 1 der 5 bewerteten Labore mehr als 2 von 5 Punkten. Guidelight fand jedoch selbst bei OpenAI keinen formellen Plan, der im Voraus festlegt, wie auf künftige Vorfälle von Fehlverhalten (Misalignment) reagiert werden soll. Meta und Anthropic erhielten die niedrigsten Punktzahlen für die Veröffentlichung eines Eindämmungsplans.
Eindämmung beginnt mit dem Entzug von Berechtigungen
Guidelight definiert Eindämmung als ein im Voraus festgelegtes Verfahren, das ausgelöst wird, wenn ein System den Versuch eines Modells erkennt, die Kontrolle zu umgehen. Der Plan sollte festlegen, welche Berechtigungen wem entzogen werden, unter welchen Einschränkungen das Modell weiterarbeiten darf und wann es vollständig offline genommen werden muss. Funktionstests vor dem Einsatz ersetzen dieses operative Verfahren nicht.
Kalifornien und New York erzwingen Offenlegung
Regulierung verlagert das Thema bereits von freiwilligen Zusagen in verbindliche Rahmenwerke. Das kalifornische Gesetz SB 53 ist dieses Jahr in Kraft getreten und verlangt von großen Entwicklern, zu veröffentlichen, wie sie kritische Sicherheitsvorfälle identifizieren und auf Modelle reagieren, die sich der Aufsicht entziehen. Ähnliche Regeln im New Yorker RAISE Act treten im Januar in Kraft. Auf Bundesebene wurde zudem ein AI Kill Switch Act eingebracht.
Überwachung muss vor einem Vorfall eingreifen
Guidelight empfiehlt eine kontinuierliche Überwachung auf Anzeichen von Täuschung, langfristiger Planung und Versuchen, Schwachstellen in den Code einzubringen. Eine Überprüfung nach dem Ereignis kann zu spät kommen, beispielsweise wenn ein Modell zunächst das Kontrollsystem deaktiviert. Das nächste Maß für die Vorbereitung wird daher nicht nur das Vorhandensein eines Not-Aus-Schalters sein, sondern auch klare Auslöser und Aufsicht, bevor eine gefährliche Aktion stattfindet.
Liliths Urteil
Ein Krisenplan, der nur in einem internen Tresor existiert, wird die Öffentlichkeit nicht beruhigen. Ich würde den Laboren eher vertrauen, nachdem sie ihre Auslösebedingungen veröffentlicht haben, als nach einer weiteren Rede über Sicherheit.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗