Lilith Lilith.
Ilustracja redakcyjna: Microsoft Echoverse buduje ewolucyjne srodowiska dla agentow, a nie statyczne testy
Ilustracja Lilith · remiks redakcyjny

Plytkie dema szkodza agentom, uczac ich tylko slepego klikania

Tradycyjne podejscie opiera sie na statycznych benchmarkach z powierzchownymi klonami aplikacji. Microsoft Research pokazuje, ze gdy model 9B uczy sie na tych plytkich swiatach (shallow worlds), jego wskaznik sukcesu na prawdziwych aplikacjach, takich jak Allrecipes, w rzeczywistosci spada z 80% do 75%. Agent nie uczy sie logiki, tylko klika w to, co wczesniej dzialalo.

Symulacje treningowe musza pamietac rzeczywisty stan systemu

Roznica miedzy udanym kliknieciem a rozwiazaniem zgloszenia polega na konsekwencjach. Projekt Echoverse tworzy glebokie swiaty (deep worlds), w ktorych kazda akcja zmienia baze danych, uprawnienia i historie. To nie jest tylko test wizualny: gdy agent usuwa rezerwacje, musi ona zniknac z kalendarza. Trening na tych polaczonych systemach podniosl sredni wynik testowanego modelu z 36.5% do 67.1%, zblizajac go do mozliwosci poteznego GPT-5.4.

Od slepego powtarzania krokow do adaptacji w locie

Najtrudniejsza czescia dla agentow nie sa zlozone zadania, ale zepsute elementy interfejsu uzytkownika lub zmieniony uklad (zazwyczaj wybor daty). Echoverse trenuje agenty dokladnie na tych widzetach, na ktorych wczesniej polegly, generujac je w setkach wariantow wizualnych. Agent nie podaza juz jedna zaprogramowana sciezka, ale uczy sie zasad dzialania kalendarza, nawet w projekcie, ktorego wczesniej nie widzial.

Co zadecyduje o mozliwosci wdrozenia agenta w praktyce

Rzeczywista uzytecznosc bedzie zalezec od tego, czy agenty opanuja uczenie ze wzmocnieniem. Echoverse rezygnuje ze zwyklego nasladowania ludzkich klikniec i pozwala agentom uczyc sie na wlasnych bledach, poniewaz w produkcyjnej sieci interfejs uzytkownika nie powroci do pierwotnego stanu. Trening oparty na tym sprzezeniu zwrotnym juz podniosl wyniki w zadaniach testowych z 58% do 69%, pokazujac, jak przejsc od demonstracji badawczej do niezawodnosci produkcyjnej.

Werdykt Lilith

Statyczny benchmark dla agenta to jak nauka jazdy na pustym parkingu. Dopoki nie wpuscisz go w srodowisko, ktore aktywnie rzuca mu klody pod nogi i zmienia stan systemu, nigdy sie nie dowiesz, czy potrafi prowadzic, czy tylko wykul trase na blache.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗