Lilith.
⌕
Ilustracja redakcyjna: ThinkingBox ocenia agentów po stanie bazy, a nie po pewnej siebie odpowiedzi
Ilustracja Lilith · remiks redakcyjny

Microsoft i Hugging Face udostępniły ThinkingBox, który ocenia agenta na podstawie rekordów i skutków ubocznych pozostawionych w backendzie. Benchmark przenosi uwagę z wiarygodnie brzmiącej rozmowy na wynik, który da się sprawdzić.

507 zadań kończy się kontrolą faktycznego stanu

ThinkingBox obejmuje 507 wykonywalnych zadań z handlu detalicznego, ubezpieczeń komunikacyjnych, podróży, neobankowości i obsługi doradczej. Każda próba startuje z tego samego czystego stanu. Symulowany użytkownik podaje brakujące dane, a testy porównują końcową bazę z oczekiwanym wynikiem.

Autorzy powtarzają każde zadanie 20 razy. W analizie 121 680 prawidłowych prób na 12 modelach nie powiodło się 79 853 uruchomień. Mimo to 67,24 % tych porażek zakończyło się bez zgłoszonego błędu narzędzia i obejmowało zmianę stanu. Agent często wyglądał na skutecznego dokładnie wtedy, gdy baza wskazywała coś innego.

Zespoły produkcyjne muszą badać wynik i powtarzalność

Dla zespołu wdrażającego agentów zdolność i niezawodność to dwa różne pytania. Model może raz rozwiązać zadanie, a zarazem zawodzić przy setkach kolejnych przypadków. ThinkingBox zestawia więc pass@1 z liczbą zadań zaliczonych we wszystkich 20 próbach.

Wniosek jest praktyczny. Evals powinny sprawdzać właściwy rekord, zakazane skutki uboczne oraz stan pozostawiony po błędzie narzędzia. Transcript pomaga znaleźć przyczynę, lecz sam nie potwierdza poprawnego zakończenia transakcji.

Kontrolowany sandbox nadal upraszcza produkcję

Benchmark korzysta z danych syntetycznych, ograniczonego zestawu narzędzi MCP i znanego stanu początkowego. Dzięki temu można przypisać zmiany do jednego uruchomienia, ale znika część bałaganu żywych systemów, w tym równoległe zapisy i nieprzewidziane integracje. Wynik jest pomiarem, a nie gwarancją wdrożenia.

Szacunki kosztów opierają się na zużyciu tokenów oraz pełnych cenach katalogowych OpenRouter. Autorzy nazywają je indeksem porównawczym, nie rachunkiem za produkcję.

O wartości zdecydują błędy wykryte przed kontaktem z klientem

Kolejny ważny sygnał dadzą zespoły, które przeniosą kontrolę stanu końcowego do własnych evals. Liczy się to, czy powtarzane próby ujawnią błędne zwroty, przedwcześnie zamknięte zgłoszenia i niezamierzone zapisy przed wdrożeniem.

ThinkingBox jest dostępny w dwóch repozytoriach, które oddzielają runtime od danych, rekordów syntetycznych i serwerów MCP. To użyteczna podstawa, ale właściwa praca zaczyna się przy pisaniu assertions dla własnych procesów.

Werdykt Lilith

Agent ogłaszający sukces przed sprawdzeniem bazy przypomina kuriera z podpisanym kwitem i paczką nadal w samochodzie. ThinkingBox wreszcie ocenia paczkę, a nie podpis.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗