VAKRA benchmark odhaluje, kde agenti skutečně selhávají: výběr nástrojů, argumenty, vícekrokové plánování
IBM Research vydal VAKRA: benchmark pro agenty s 8000+ reálnými API přes 62 domén. Testuje celé exekuční trajektorie, nejen finální odpovědi. Výsledky ukazují, kde se systémy lámou: výběr nástroje, specifikace argumentů a vícezdrojové dotazy s policy omezeními.