Lilith Lilith.
Ilustracja redakcyjna: Agenci zaliczają demo na piątkę. Dlaczego zawodzą w produkcji?
Ilustracja Lilith · remiks redakcyjny

Agenci AI i trema w produkcji

Gdy trenujesz i testujesz agenta LLM do wypełniania formularza w aplikacji, podczas wersji demonstracyjnej robi to dokładnie tak, jak zaplanował programista. Raport badaczy z IBM Research opublikowany na blogu Hugging Face zwraca uwagę na problem, który pojawia się później. Kiedy ten sam agent zostaje wdrożony dla klientów produkcyjnych, na to samo polecenie użytkownika często reaguje inną sekwencją kroków i zawodzi.

Autorzy opisują to zjawisko jako fundamentalny problem niezawodności agentów AI. Jest to przypadłość, w której pomimo pomyślnego wykonania zadania w jednym przypadku, ten sam system może zastosować nieco zmodyfikowaną logikę przy powtórnym wezwaniu, wywołać inną funkcję z zestawu narzędzi i w końcu wygenerować błąd.

Obecne rankingi mierzą wydajność, a nie powtarzalność

Podczas gdy laboratoria rywalizują o osiągnięcie jak najlepszych wyników w tradycyjnych benchmarkach (np. SWE-bench), badacze wskazują na ich oczywistą ślepotę. Rankingi i pakiety ewaluacyjne nagradzają przede wszystkim jednorazowe przejście: fakt, że agent osiągnął cel w konkretnej próbie. Jednak do wdrożenia na produkcji potrzeba, aby bot potrafił stabilnie wykonać rutynowe zadanie nawet po raz setny.

W obecnym ekosystemie oceniania brakuje metryk niezawodności i spójnej wydajności frameworków agentowych. Z punktu widzenia adopcji AI w firmach nie jest ważne, by asystent czasem zachwycał błyskotliwością, ale by można było mu ufać w codziennym, przeciętnym obciążeniu bez konieczności ręcznych poprawek.

Droga do rozwiązania nie jest liniowa

Niespójność wynika z natury modeli językowych, które działają w oparciu o prawdopodobieństwo wygenerowania kolejnych tokenów. Eliminacja zmienności nie jest łatwa, ponieważ silne ograniczanie swobody modelu (tzw. temperatura zero, ścisłe formatowanie wyników) prowadzi do utraty przez system zdolności wydostania się z błędów w przypadku nieplanowanej zmiany środowiska (np. nieoczekiwanego okienka pop-up w interfejsie).

Realnym rozwiązaniem jest wdrażanie bardziej zaawansowanych procesów oceny, które testują agentów podczas wielokrotnych przebiegów (stress testów) przez tę samą, choć nieznacznie zmienioną sytuację, obliczając rzeczywisty poziom stabilności ścieżki.

Zobaczymy wysyp benchmarków niezawodności

Dowodem na zmianę na rynku będzie przesunięcie uwagi z absolutnych wyników sukcesu na metryki gotowości do produkcji. Można spodziewać się powstania nowych narzędzi oceniających, które będą certyfikować modele nie tylko ze względu na umiejętność rozwiązywania zadań, ale także pod kątem przewidywalności ich procedur w przypadku tego samego zadania.

Werdykt Lilith

Prezentacja agenta AI w demie to jak ocenianie księgowego w escape roomie. W produkcji nie potrzebujesz genialnego odkrywcy skrótów, ale kogoś, kto sto razy z rzędu nie potknie się na tym samym polu.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗