Lilith.
⌕
Redakční ilustrace: ThinkingBox měří agenty podle databáze, ne podle sebevědomé odpovědi
Ilustrace Lilith · redakční remix

Microsoft a Hugging Face zpřístupnily ThinkingBox, který hodnotí agenta podle záznamů a vedlejších efektů zanechaných v backendu. Benchmark tím přesouvá pozornost od dojmu z konverzace k výsledku, který lze ověřit.

507 úloh končí kontrolou skutečného stavu

ThinkingBox obsahuje 507 spustitelných úloh z retailu, pojištění aut, cestování, neobankovnictví a poradenské podpory. Každý pokus začíná ze stejného čistého stavu. Simulovaný uživatel doplňuje chybějící údaje a testy nakonec porovnají databázi s očekávaným výsledkem.

Autoři každou úlohu opakují 20krát. V analýze 121 680 platných pokusů napříč 12 modely selhalo 79 853 běhů. Z těchto selhání přitom 67,24 % skončilo bez hlášené chyby nástroje a se změnou stavu. Agent tedy často vypadal úspěšně právě ve chvíli, kdy databáze tvrdila opak.

Produkční týmy potřebují testovat výsledek i opakovatelnost

Pro tým nasazující agenty je důležitý rozdíl mezi schopností a spolehlivostí. Model může úlohu alespoň jednou zvládnout, ale to neříká, zda bezpečně zpracuje další stovky případů. ThinkingBox proto vedle pass@1 sleduje i úlohy, které projdou ve všech 20 pokusech.

Praktický dopad je nepříjemně konkrétní. Evals musí kontrolovat správný záznam, zakázané vedlejší efekty a stav po chybě nástroje. Samotný transcript se hodí k diagnostice, nikoli jako potvrzení dokončené transakce.

Kontrolované sandboxy stále zjednodušují produkci

Benchmark používá syntetická data, vymezené MCP nástroje a známý počáteční stav. Díky tomu umí přesně připsat změny jednomu běhu, ale zároveň neobsahuje celý nepořádek živých systémů, souběžné zápisy ani nečekané integrace. Výsledek je měřítko, ne záruka pro konkrétní nasazení.

Také cena vychází z tokenů a nediskontovaných ceníků přes OpenRouter. Autoři ji popisují jako srovnávací index, nikoli jako účet za produkční požadavek.

Rozhodne počet chyb zachycených před zákazníkem

Další užitečný signál přijde z týmů, které princip konečného stavu přenesou do vlastních evals. Důležité bude, zda díky opakovaným běhům odhalí chybné refundace, uzavřené tickety a nechtěné zápisy ještě před nasazením.

ThinkingBox je dostupný ve dvou repozitářích: runtime odděluje od dat, syntetických záznamů a MCP serverů. Tím dává týmům použitelný základ, ale skutečná práce začíná až při psaní assertions pro jejich vlastní procesy.

Lilithin verdikt

Agent, který hlásí hotovo před kontrolou databáze, připomíná kurýra s podepsaným lístkem a balíkem pořád v dodávce. ThinkingBox konečně hodnotí balík, ne podpis.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗