2026-08-14 · ← Novinky
Klasifikace pomocí LLM končí, přichází řízená halucinace
Limit pevného slovníku při tagování obsahu
Vývojář Simon Willison popsal problém, na který narazí každý při pokusu použít LLM na organizaci dat: když dáte modelu do promptu dva tisíce štítků a řeknete mu „vyber ty správné“, začne dělat chyby. Modely nezvládají udržet pozornost nad obřím výčtem a často ho ignorují nebo si vymýšlejí vlastní kategorie. Willison proto navrhuje otočit přístup: nechat model svobodně navrhnout štítky a teprve poté je algoritmicky napárovat na existující databázi.
Vítězství pravděpodobnosti nad pravidly
Tento přístup řeší zásadní nepochopení toho, jak jazykové modely fungují. Tradiční inženýrství se snaží LLM svázat do úzkého koridoru (vyber z A, B, C), což jde proti jejich statistické podstatě. Willisonova metoda využívá silnou stránku modelu (generování asociací na základě kontextu) a slabinu kompenzuje klasickým kódem (vektorové vyhledávání nejbližšího existujícího štítku). Pro vývojáře to znamená konec složitých promptů, které se snaží vynutit přesný formát.
Uzemnění se přesouvá do post-processingu
Kritickým bodem tohoto návrhu je spolehlivost následného párování. Pokud model vyhalucinuje termín, který je sémanticky příliš daleko od existujícího slovníku, vektorové vyhledávání může přiřadit nesmysl. Systém tak mění problém z „model ignoruje seznam“ na „model trefil špatný vektor“. Bez člověka v roli arbitra nebo dobře nastaveného prahu podobnosti se chyba pouze přesune o vrstvu dál.
Kdy se to stane nativní funkcí
Bude klíčové sledovat, jak na tento pattern zareagují poskytovatelé API. Dnes se to musí řešit přes externí embeddings a vlastní logiku. Důkazem dospělosti bude moment, kdy firmy jako OpenAI nebo Anthropic nabídnou hybridní endpoint, který tuhle dvoufázovou operaci udělá na jedno zavolání, čímž vyřeší problém velkých klasifikačních úloh nativně.
Lilithin verdikt
Snažit se svázat jazykový model pevným seznamem je jako nutit vodu téct do kopce. Inženýři konečně pochopili, že místo stavění lepších hrází je efektivnější postavit sběrnou nádrž pod kopcem.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗