2026-07-30 · ← News
Microsoft Echoverse baut evolutive Umgebungen fur Agenten, keine statischen Tests
Oberflachliche Demos schaden Agenten und bringen ihnen nur blindes Klicken bei
Der traditionelle Ansatz stutzt sich auf statische Benchmarks mit oberflachlichen App-Klonen. Microsoft Research zeigt, dass ein 9B-Modell, wenn es in diesen flachen Welten (shallow worlds) trainiert wird, auf realen Anwendungen wie Allrecipes tatsachlich von 80 % auf 75 % zuruckfallt. Der Agent lernt die Logik nicht, er klickt einfach auf das, was vorher funktioniert hat.
Trainingssimulationen mussen sich den realen Systemzustand merken
Der Unterschied zwischen einem erfolgreichen Klick und dem Losen eines Tickets liegt in den Konsequenzen. Das Echoverse-Projekt erschafft tiefe Welten (deep worlds), in denen jede Aktion Datenbanken, Berechtigungen und den Verlauf verandert. Es ist nicht nur ein visueller Test: Wenn ein Agent eine Buchung loscht, muss sie aus dem Kalender verschwinden. Das Training auf diesen vernetzten Systemen steigerte die durchschnittliche Punktzahl des getesteten Modells von 36.5 % auf 67.1 % und naherte sich damit den Fahigkeiten des massiven GPT-5.4 an.
Von der blinden Wiederholung zur spontanen Anpassung
Der schwierigste Teil fur Agenten sind nicht komplexe Aufgaben, sondern kaputte UI-Elemente oder veranderte Layouts (typischerweise Datumsauswahler). Echoverse trainiert Agenten gezielt auf den Widgets, an denen sie zuvor gescheitert sind, und generiert sie in Hunderten von visuellen Varianten. Der Agent folgt nicht mehr einem einzigen vorprogrammierten Pfad, sondern erlernt das zugrunde liegende Prinzip eines Kalenders, selbst in einem Design, das er noch nie zuvor gesehen hat.
Was uber die Fahigkeit entscheidet, einen Agenten in der Praxis einzusetzen
Der reale Nutzen wird davon abhangen, ob Agenten Reinforcement Learning beherrschen. Echoverse verzichtet auf die blose Nachahmung menschlicher Klicks und lasst Agenten aus ihren eigenen Fehlern lernen, da die Benutzeroberflache im Produktions-Web nicht in ihren ursprunglichen Zustand zuruckkehrt. Das auf diesem Feedback basierende Training hat die Punktzahlen bei Testaufgaben bereits von 58 % auf 69 % angehoben und zeigt, wie man von einer Forschungsdemo zur Produktionszuverlassigkeit gelangt.
Liliths Urteil
Ein statischer Benchmark fur einen Agenten ist wie eine Fahrstunde auf einem leeren Parkplatz. Bis man ihn in eine Umgebung versetzt, die ihm aktiv Hindernisse in den Weg legt und den Systemzustand andert, wird man nie wissen, ob er tatsachlich fahren kann oder sich nur die Route gemerkt hat.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗