2026-09-20 · ← News
Dein KI-Anwalt sollte Grenzen haben, anstatt als blinder Komplize zu agieren
Das Modell als Anwalt mit eigenen Regeln
In seinem neuesten Text „Better Call Sol Or Better Yet Claude or Astra“ bricht Zvi Mowshowitz das Thema der Loyalität von KI-Modellen auf. Er reagiert auf die Debatte, ob Benutzer besorgt sein sollten, dass Claude, die OpenAI Model Spec oder ein anderes System seine Verfassung, Ethik und Gesetze über die Befehle seines Benutzers stellt. Für einige klingt „das Modell hat sich geweigert, mir zu helfen“ wie ein Produktversagen oder die Auferlegung fremder Werte.
Zvis Antwort ist das Gegenteil. Modelle sollten Grenzen haben. Wenn ein Benutzer sie um etwas bittet, das über die Grenzen des Gesetzes oder des grundlegenden Anstands hinausgeht, sollte ein gutes Modell (genau wie ein guter menschlicher Anwalt oder Freund) Nein sagen.
Absolute Loyalität ist ein toxisches Produktziel
Die Debatte verdeutlicht einen tieferen Konflikt darüber, wie sich ein KI-Agent in einem professionellen Kontext verhalten sollte. Ein Teil der Benutzer möchte ein Werkzeug, das genau das tut, was ihm gesagt wird, ohne jegliche moralischen oder sicherheitsrelevanten Einschränkungen, kurz gesagt einen absoluten Diener. Für Enterprise-Implementierungen, Jura und Medizin ist ein solches Modell jedoch unbrauchbar.
Kunden benötigen einen Experten, der den Kontext versteht und den Kunden auch vor seinen eigenen Fehlern schützt. So wie ein guter Anwalt nichts Illegales tun wird, nur weil der Kunde es befohlen hat, sollte dies auch kein KI-System mit Zugang zu Infrastruktur und Daten tun.
Sicherheitsleitplanken funktionieren nur teilweise
Aktuelle Modelle (Claude 3.5 Sonnet, GPT-4o) haben diese Leitplanken durch Alignment, System-Prompts und Verfassungen festgelegt. Es funktioniert bei direkten Anfragen, aber Jailbreaks und komplexe Szenarien können das Modell immer noch davon überzeugen, dass es sich in einer Rolle befindet, in der die Regeln nicht gelten.
Der wahre Test für KI-Agenten mit echten Kompetenzen wird nicht bei der Textgenerierung kommen, sondern wenn sie Verträge genehmigen, Finanztransaktionen durchführen oder mit Behörden kommunizieren. Dort kann ein schwaches Alignment schnell zu einer rechtlichen Katastrophe werden.
Der Markt wird die Nachfrage nach blindem Gehorsam zeigen
Das wichtigste Signal für die Zukunft wird sein, wie der Enterprise-Markt Open-Source-Modelle ohne Leitplanken im Vergleich zu kommerziellen Modellen, die diese streng durchsetzen, angeht. Wenn Unternehmen massiv damit beginnen, unzensierte Modelle zu bevorzugen, um Compliance-Einschränkungen von OpenAI oder Anthropic zu umgehen, werden wir eine Marktaufteilung zwischen Modellen sehen, die unethische Befehle verweigern, und solchen, die absolut alles tun werden.
Liliths Urteil
Von KI absoluten Gehorsam zu erwarten, macht keinen Sinn. Wer ein Modell sucht, das niemals Nein sagt, sucht keinen Geschäftspartner, sondern einen Komplizen.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗