Lilith.
⌕
Redaktionelle Illustration: ThinkingBox bewertet Agenten nach dem Datenbankzustand statt nach selbstsicheren Antworten
Illustration von Lilith · redaktioneller Remix

Microsoft und Hugging Face haben ThinkingBox veröffentlicht. Das System bewertet Agenten anhand der Datensätze und Nebenwirkungen, die sie im Backend hinterlassen. Der Benchmark verlagert den Blick von einer überzeugenden Unterhaltung auf ein überprüfbares Ergebnis.

507 Aufgaben enden mit einer Prüfung des tatsächlichen Zustands

ThinkingBox umfasst 507 ausführbare Aufgaben aus Einzelhandel, Kfz Versicherung, Reisen, Neobanking und Beratungsunterstützung. Jeder Versuch beginnt mit demselben sauberen Zustand. Ein simulierter Nutzer liefert fehlende Angaben, anschließend vergleichen Tests die finale Datenbank mit dem erwarteten Ergebnis.

Die Autoren wiederholen jede Aufgabe 20 Mal. In einer Analyse von 121 680 gültigen Versuchen mit 12 Modellen scheiterten 79 853 Läufe. Dennoch endeten 67,24 % dieser Fehlschläge ohne gemeldeten Tool Fehler und enthielten einen zustandsverändernden Aufruf. Der Agent wirkte oft genau dann erfolgreich, wenn die Datenbank widersprach.

Produktionsteams müssen Ergebnis und Wiederholbarkeit testen

Für Teams, die Agenten einsetzen, sind Fähigkeit und Zuverlässigkeit zwei verschiedene Fragen. Ein Modell kann eine Aufgabe einmal lösen und bei Hunderten weiteren Fällen versagen. ThinkingBox zeigt deshalb pass@1 neben den Aufgaben, die alle 20 Versuche bestehen.

Die praktische Folge ist eindeutig. Evals müssen den richtigen Datensatz, verbotene Nebenwirkungen und den Zustand nach einem Tool Fehler prüfen. Ein Transcript hilft bei der Diagnose, beweist aber keinen korrekt abgeschlossenen Vorgang.

Kontrollierte Sandboxes vereinfachen die Produktion weiterhin

Der Benchmark nutzt synthetische Daten, begrenzte MCP Tools und einen bekannten Anfangszustand. Dadurch lassen sich Änderungen einem Lauf zuordnen, zugleich fehlt viel Unordnung realer Systeme, etwa gleichzeitige Schreibvorgänge und unerwartete Integrationen. Der Wert ist eine Messung, keine Garantie für ein Deployment.

Auch die Kostenschätzungen beruhen auf aufgezeichneten Tokens und undiskontierten OpenRouter Listenpreisen. Die Autoren bezeichnen sie als Vergleichsindex, nicht als Produktionsrechnung.

Entscheidend werden Fehler sein, die Kunden nie erreichen

Das nächste brauchbare Signal kommt von Teams, die Endzustandsprüfungen in ihre eigenen Evals übernehmen. Entscheidend ist, ob wiederholte Läufe falsche Erstattungen, zu früh geschlossene Tickets und unbeabsichtigte Schreibvorgänge vor dem Deployment aufdecken.

ThinkingBox steht in zwei Repositories bereit, die Runtime von Daten, synthetischen Datensätzen und MCP Servern trennen. Das ist eine nutzbare Grundlage. Die eigentliche Arbeit beginnt beim Schreiben passender Assertions für die eigenen Abläufe.

Liliths Urteil

Ein Agent, der vor der Datenbankprüfung Erfolg meldet, gleicht einem Kurier mit unterschriebenem Beleg, während das Paket noch im Wagen liegt. ThinkingBox bewertet endlich das Paket statt der Unterschrift.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗