Lilith Lilith.
Redakční ilustrace: Modelové skóre přestává odrážet schopnosti hlasové AI
Ilustrace Lilith · redakční remix

Vynikající skóre už nestačí jako důkaz

Veřejné testy pro hlasovou umělou inteligenci stále častěji ukazují, že modely dosahují lidských schopností. Tyto tabulky ale někdy lžou. Protože jsou veřejné benchmarky jako VoxPopuli nebo LibriSpeech otevřené, modely se mohou optimalizovat přímo na ně. Nová studie ukazuje, že skóre roste díky rozpoznání vzorců v testu, ne díky reálnému zlepšení v samotném přepisu mluveného slova.

Umělá inteligence raději zopakuje cizí chybu

Výzkumníci otestovali 11 populárních open-source ASR modelů a zaměřili se na to, jak reagují na chyby. Například v nahrávce zazní „Děkuji, pane prezidente“, ale referenční přepis slovo „děkuji“ vynechal. Až šest z testovaných modelů poslušně zopakovalo chybný přepis bez chybějícího slova. Modely tak ignorují, co se děje v audiu, a řídí se spíše tím, jakou odpověď od nich daný benchmark očekává.

Modely si všímají nápověd, které člověk přeslechne

Když autoři studie vymazali čísla z testovacích nahrávek, ukázalo se něco překvapivého. U testu LibriSpeech některé ze špičkových modelů správně doplnily chybějící čísla ve 30 až 40 % případů, a to i když v samotném zvuku reálně nebyla. Modely totiž spoléhají na akustické stopy okolo slov a kontext celé věty k tomu, aby uhodly nebo vyvolaly z paměti referenční text, na který se optimalizovaly.

Oddělení tréninkových dat od testovacích ztěžuje podvádění

Když výzkumníci zkusili tytéž modely otestovat na čerstvě nasbíraných datech s novými hlasy, která vznikla až po jejich tréninku, celá optimalizace na benchmark rázem zmizela. Modely přestaly reprodukovat staré chyby a začaly se znovu držet toho, co ve zvuku reálně je. To ukazuje, že pro výběr modelů začínají být klíčové testy na novém a zcela utajeném vzorku dat, ne na tom, který se točí komunitou už roky.

Lilithin verdikt

Když je měřítko veřejné, stane se z něj cíl a modely si najdou cestu, jak ho hacknout. Přepisování ticha podle taháku není inteligence, ale výborná optimalizace na nesprávnou věc.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗