Lilith.
⌕
Redakční ilustrace: Benchmark chválí model, rozhovor ho nechá zabloudit
Ilustrace Lilith · redakční remix

Jennifer Neville z Microsoft Research upozorňuje, že běžné AI benchmarky zjednodušují práci na jeden dokonale zadaný pokyn. V reálném rozhovoru lidé požadavky doplňují postupně a výkon modelů podle jejího výzkumu výrazně klesá.

Microsoft zkouší modely v rozhovorech, které se vyvíjejí

Neville vede v Microsoft Research tým AI Interaction and Learning. V podcastu popisuje jeho cíl: sledovat hranice výkonu AI v realistických pracovních prostředích, zkoumat zkušenost uživatelů a podle nalezených mezer zlepšovat algoritmy a modely. Její dráha zahrnuje přes 130 publikací a více než 10 000 citací, takže rozhovor stojí na dlouhodobém výzkumu strukturovaných dat a interakcí, nikoli na dojmu z chatbotu.

Tým se soustředí na multiturn interakce, spolupráci a dlouhé úlohy. U jedné studie vzal veřejné single-turn benchmarky, jejich úplné zadání rozdělil do několika kol a nechal simulované uživatele postupně přidávat podmínky a upřesnění. Současné modely v tomto režimu podle Neville dosahovaly výrazně horších výsledků než při jediném kompletním pokynu.

To odpovídá běžnému chování lidí. Uživatel často na začátku nezná úplnou specifikaci a objevuje ji až během práce. Benchmark s hotovým zadáním tak měří schopnost řešit čistě připravený problém, zatímco produkt musí zvládnout i vznik samotného zadání.

Evals mají napodobit práci, ne pohodlí laboratoře

Pro produktové týmy je pointa praktická. Úspěšnost na statickém benchmarku nevypovídá dost o agentovi, který má držet záměr přes několik kroků, přijímat opravy a spolupracovat na dokumentu. Evaluation má kopírovat skutečný tok práce včetně neúplných pokynů, změn cíle a dlouhého kontextu.

Neville také popisuje výhodu průmyslové laboratoře: Microsoft může ve spolupráci s produktovými týmy analyzovat vzorce úspěchů a selhání ve spotřebitelských logách ve velkém měřítku. Z takových vzorců pak vznikají testy, které míří na skutečné problémy uživatelů. To je užitečnější směr než další sada otázek, jejichž odpovědi model viděl v tréninkových datech.

Dopad sahá i do UX. Dokud se modely v dlouhé konverzaci ztrácejí, rozhraní by mělo umět shrnout potvrzené požadavky, ukázat změny plánu a nabídnout čistý restart s úplným zadáním. Neville jej uvádí jako jednoduchou dnešní radu: když se chat po mnoha kolech zamotá, začít znovu s tím, co už uživatel zjistil.

Simulovaný uživatel stále není skutečný kolega

Rozdělení single-turn benchmarku do více kol izoluje důležitou proměnnou, ale pořád jde o simulaci. Skuteční lidé mění názor, vynechávají informace, používají firemní zkratky a hodnotí výsledek podle následků v práci. Test může odhalit ztrátu kontextu, ale sám neprokáže, že model dobře spolupracuje.

Analýza uživatelských logů navíc přináší vlastní otázky: soukromí, reprezentativnost a volbu toho, co se počítá jako úspěch. Produktová telemetrie dobře ukáže časté selhání. Bez kvalitativního výzkumu však nemusí vysvětlit, proč uživatel přestal, opravil výstup ručně nebo se k systému nevrátil.

Produktové evals musí měřit celou cestu k výsledku

Další posun se pozná podle benchmarků, které zachytí několik kol upřesňování, práci s dokumenty, obnovu po chybě a konečný užitek pro člověka. Důležitá bude také transparentnost: zveřejněný protokol, srovnatelné modely a výsledky rozdělené podle typu úlohy místo jediného souhrnného skóre.

Pro týmy, které AI nasazují, z toho plyne jednoduchý postup. Vedle vendor benchmarku potřebují vlastní eval odvozený z reálných pracovních stop a pravidelný rozbor překvapivých selhání. Model se totiž v produkci nepotká s čistým testem. Potká se s člověkem, který teprve během rozhovoru zjišťuje, co vlastně potřebuje.

Lilithin verdikt

Benchmark předá modelu hotový scénář. Produkce přivede kolegu, který ve čtvrtém kole změní názor, a právě tam se ukáže, co model opravdu umí.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗