Lilith Lilith.
Redakční ilustrace: Agenti umí hrát demo na jedničku. Proč jim ale v produkci padá spolehlivost?
Ilustrace Lilith · redakční remix

AI agenti a syndrom trémy z produkce

Když natrénujete a otestujete LLM agenta, aby vyplnil formulář v aplikaci, při demonstraci ho vyplní přesně tak, jak vývojář plánoval. Zpráva od výzkumníků z IBM Research publikovaná na blogu Hugging Face upozorňuje na problém, který nastává vzápětí. Jakmile je tentýž agent nasazen k živým klientům, na stejný příkaz uživatele reaguje často odlišnou sekvencí kroků a selže.

Tento jev popisují autoři jako fundamentální problém spolehlivosti AI agentů. Jde o neduh, kdy i přes úspěšné splnění úkolu v jednom případě může stejný systém při opakovaném volání uplatnit mírně modifikovanou logiku, zavolat jinou funkci z toolsetu a na konci vygenerovat chybový výsledek.

Současné žebříčky měří výkon, ne opakovatelnost

Zatímco se laboratoře předhánějí v dosahování co nejlepšího skóre v tradičních benchmarcích (např. SWE-bench), výzkumníci poukazují na jejich zjevnou slepotu. Žebříčky a hodnotící sady primárně odměňují jednorázový průchod: fakt, že agent dosáhl cíle v konkrétním pokusu. K produkčnímu nasazení je ovšem potřeba, aby bot splnil rutinní zadání stabilně i po stém volání.

Metriky spolehlivosti a konzistentního výkonu agentních frameworků v současném ekosystému hodnocení chybí. Přitom pro adopci AI ve firmách není zásadní, že asistent občas oslní genialitou, ale to, že mu mohou věřit v každodenní průměrné zátěži bez nutnosti manuálních oprav.

Cesta k řešení není lineární

Nekonzistence pramení z povahy jazykových modelů, které fungují na bázi pravděpodobnosti dalších generovaných tokenů. Odstraňování variability není snadné, protože silnější omezování svobody modelu (tzv. teplota nula, striktní formátování výstupů) vede k tomu, že systém ztratí schopnost se z chyb vyprostit, když se mu neplánovaně změní prostředí (např. v případě nečekaného pop-up okna v UI).

Reálným řešením je nasazování sofistikovanějších evaluačních pipeline, které testují agenty na opakovaných průchodech (stresstestech) stejnou, ale jemně variovanou situací, a počítají skutečnou míru stability cesty.

Uvidíme nástup benchmarků spolehlivosti

Důkazem posunu trhu bude přesun pozornosti od absolutního skóre úspěšnosti na metriky pro reálnou produkci. Lze očekávat vznik nových hodnotících nástrojů, které budou certifikovat modely nejen podle schopností řešit úlohy, ale podle míry předvídatelnosti jejich postupů při stejném úkolu.

Lilithin verdikt

Předvádět AI agenta v demu je jako hodnotit účetního v únikové hře. V produkci nepotřebujete, aby byl geniální objevitel zkratek, ale aby stokrát po sobě nespadl na stejném políčku.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗