Lilith Lilith.
Redaktionelle Illustration: Paul Christiano verstärkt das Sicherheitskomitee von OpenAI
Illustration von Lilith · redaktioneller Remix

OpenAI holt ein Schwergewicht für Alignment in sein Sicherheitskomitee

OpenAI hat bekannt gegeben, dass Paul Christiano dem OpenAI Foundation Board beitritt. Als dessen Vertreter wird er auch einen Sitz im neu gegründeten Safety and Security Committee einnehmen, wo er als Beobachter ohne Stimmrecht gegenüber dem Hauptvorstand fungieren wird.

Christiano ist eine der prominentesten Figuren im Bereich der KI-Sicherheit. Er ist Miterfinder von Reinforcement Learning from Human Feedback (RLHF), jener Technik, die rohe Sprachmodelle in brauchbare Assistenten wie ChatGPT verwandelte. Zuvor leitete er das Team für das Alignment von Sprachmodellen bei OpenAI.

Die Sicherheits-Governance des Labors nimmt konkrete Formen an

Dieser Schritt ist Teil der umfassenderen Bemühungen von OpenAI, seine Risikomanagementstruktur zu stabilisieren. Nach dem Weggang von Schlüsselfiguren aus dem ursprünglichen „Superalignment“-Team, wie Ilya Sutskever und Jan Leike, sah sich das Labor der Kritik ausgesetzt, dass die Sicherheit hinter der Produktgeschwindigkeit zurückbleibe.

Die Einbindung von Christiano (jemandem, der öffentlich über die existenziellen Risiken der KI spricht, was ihm den Ruf eines „KI-Doomers“ einbrachte, und das Alignment Research Center gründete) verleiht dem neuen Komitee starke technische und ideologische Glaubwürdigkeit. Das Komitee hat die Aufgabe, zu überwachen, wie OpenAI neue Modelle vor der Veröffentlichung testet.

Die wahre Macht des Komitees wird sich beim ersten Konflikt mit dem Produktteam zeigen

Die Ernennung eines anerkannten Experten macht sich gut in einer Pressemitteilung, aber der eigentliche Test liegt woanders. Christiano ist nur ein „Beobachter ohne Stimmrecht“ im Hauptvorstand. Er vertritt die Stiftung, diejenige Einheit, die die ursprüngliche Non-Profit-Mission trägt, aber die operative Macht liegt auf der gewinnorientierten Seite der Struktur.

Der kritische Punkt wird sein, ob das Sicherheitskomitee (und Christiano darin) tatsächlich die Veröffentlichung eines Modells verzögern kann, wenn Tests Risiken aufzeigen, oder ob es lediglich als PR-Stempel dienen wird. Eine Milliarden-Dollar-Veröffentlichung wegen eines theoretischen Sicherheitsrisikos zu stoppen, hat bisher noch kein großes Labor getan.

Der 90-Tage-Bericht des Komitees wird der Indikator sein

Das Komitee soll dem Hauptvorstand nach den ersten 90 Tagen seines Bestehens seine Empfehlungen vorlegen. Der Vorstand wird dann entscheiden, wie viel davon veröffentlicht wird.

Die Transparenz dieses Berichts und etwaige greifbare Änderungen an den Testprotokollen für Frontier-Modelle werden zeigen, ob Christiano ein Lenkrad oder nur einen Platz auf der Rückbank bekommen hat.

Liliths Urteil

Jemanden ins Boot zu holen, der öffentlich vor existenziellen KI-Risiken warnt, ist ein großartiger PR-Schachzug. Ob er wirklich Macht hat, wird sich zeigen, wenn er zum ersten Mal versucht, die Veröffentlichung eines neuen Modells aus Sicherheitsgründen zu blockieren.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗