2026-09-15 · ← News
Agenten meistern das Demo. Warum scheitern sie in der Produktion?
KI-Agenten und Lampenfieber in der Produktion
Wenn man einen LLM-Agenten trainiert und testet, um ein Formular in einer App auszufüllen, füllt er es während einer Demo genau so aus, wie es der Entwickler geplant hat. Ein Bericht von IBM Research-Forschern, der im Hugging Face-Blog veröffentlicht wurde, hebt das darauffolgende Problem hervor. Sobald derselbe Agent für Live-Kunden bereitgestellt wird, reagiert er häufig auf genau dieselbe Benutzereingabe mit einer anderen Abfolge von Schritten und schlägt fehl.
Die Autoren beschreiben dieses Phänomen als ein grundlegendes Zuverlässigkeitsproblem bei KI-Agenten. Es ist eine Krankheit, bei der dasselbe System trotz erfolgreichen Abschlusses einer Aufgabe in einem Fall bei einem wiederholten Aufruf eine leicht geänderte Logik anwenden, eine andere Funktion aus dem Toolset aufrufen und letztendlich ein Fehlerergebnis generieren kann.
Aktuelle Bestenlisten messen Leistung, nicht Wiederholbarkeit
Während die Labors darum konkurrieren, bei herkömmlichen Benchmarks (z. B. SWE-bench) die höchste Punktzahl zu erzielen, weisen die Forscher auf deren offensichtliche Blindheit hin. Bestenlisten und Evaluierungssuiten belohnen in erster Linie einen einmaligen Durchlauf: die Tatsache, dass der Agent das Ziel in einem bestimmten Versuch erreicht hat. Für den Produktionseinsatz ist es jedoch erforderlich, dass ein Bot Routineaufgaben auch beim hundertsten Aufruf stabil erledigt.
Metriken für die Zuverlässigkeit und konstante Leistung von Agenten-Frameworks fehlen im aktuellen Bewertungssystem. Für die Einführung von KI in Unternehmen ist es jedoch nicht entscheidend, dass ein Assistent gelegentlich mit Genialität glänzt, sondern dass man ihm bei alltäglicher Durchschnittsbelastung vertrauen kann, ohne dass manuelle Korrekturen erforderlich sind.
Der Weg zur Lösung ist nicht linear
Inkonsistenz ergibt sich aus der Natur von Sprachmodellen, die auf der Grundlage der Wahrscheinlichkeit der nächsten generierten Token arbeiten. Die Beseitigung von Variabilität ist nicht einfach, da eine starke Einschränkung der Freiheit des Modells (z. B. Null-Temperatur, strenge Ausgabeformatierung) dazu führt, dass das System die Fähigkeit verliert, sich von Fehlern zu erholen, wenn sich seine Umgebung unerwartet ändert (wie etwa ein unerwartetes Popup-Fenster in einer Benutzeroberfläche).
Die tatsächliche Lösung liegt im Einsatz anspruchsvollerer Evaluierungspipelines, die Agenten in wiederholten Durchläufen (Stresstests) durch dieselben, aber leicht veränderten Situationen testen und die tatsächliche Rate der Pfadstabilität berechnen.
Wir werden das Aufkommen von Zuverlässigkeits-Benchmarks erleben
Ein Beweis für eine Marktveränderung wird die Verlagerung der Aufmerksamkeit von absoluten Erfolgsbewertungen auf produktionsbereite Kennzahlen sein. Es ist mit dem Aufkommen neuer Bewertungstools zu rechnen, die Modelle nicht nur auf Grundlage ihrer Fähigkeiten zur Aufgabenlösung zertifizieren, sondern auch auf der Vorhersehbarkeit ihrer Abläufe für dieselbe Aufgabe.
Liliths Urteil
Einen KI-Agenten in einer Demo zu präsentieren, ist wie die Bewertung eines Buchhalters in einem Escape Room. In der Produktion braucht man keinen brillanten Entdecker von Abkürzungen, sondern jemanden, der nicht hundertmal hintereinander auf demselben Feld stolpert.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗