Lilith Lilith.
CS EN PL

Dylan Castillo vzal internetovou hypotézu o pelicanmaxxing a proměnil ji v malý, ale užitečný experiment: 8 zvířat, 6 vozidel, 48 promptů, 3 běhy na prompt a 7 modelů. Simon Willison jeho práci doporučuje právě proto, že z neformálního benchmarku udělala něco bližšího měření.

Pelikáni na kole dostali 144 pokusů místo dojmu z galerie

Původní otázka zněla, jestli AI laboratoře nezačaly své obrazové modely ladit na Willisonův známý test s pelikánem jedoucím na kole. Castillo proto porovnal nejen pelikány a kola, ale i jiné kombinace zvířat a dopravních prostředků.

Testoval GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 a DeepSeek V4 Pro. Výsledky následně pomáhaly hodnotit GPT-5.6 Luna a Gemini 3.1 Flash-Lite.

Závěr je střízlivý: v testované sadě se neukázalo, že by pelikáni, kola nebo jejich kombinace vycházely podezřele lépe než srovnatelné případy. GLM-5.2 měl nejzajímavější jednotlivý vzorek, ale efekt byl malý a statisticky neprůkazný.

Meme test se mění v lekci o tom, co evals opravdu měří

Pro vývojáře a produktové týmy je pointa širší než pelikán. Jakmile se benchmark stane známým memem, začne měřit nejen schopnost modelu, ale i pozornost trhu, tréninková data a reflex výrobců optimalizovat na viditelné testy.

Castillův přístup ukazuje zdravější cestu: nevěřit jednomu ikonickému promptu, ale rozšířit prostor případů a porovnat, zda konkrétní kombinace vyčnívá nad očekávání. To je přesně rozdíl mezi zábavnou demonstrací a evalem, podle kterého se dá něco rozhodovat.

Ani pečlivý mini benchmark ještě není audit laboratoří

Limit je jasný. 48 promptů a 7 modelů dává lepší signál než ruční spot-checking, ale pořád nejde o důkaz, že žádná laboratoř nikdy podobný test v tréninku neviděla. Modely navíc můžou selhávat vizuálně jemněji, než zachytí lidské nebo LLM asistované hodnocení.

Právě proto je dobré číst výsledek negativně a opatrně: v této sadě není vidět podezřelý boost. To je slabší, ale poctivější tvrzení než velká historka o tajném ladění.

Další signál přijde z benchmarků, které se hůř zapamatují

Sledovat má smysl hlavně to, jestli komunita začne dělat víc podobných parametrických testů. Méně slavných obrázků, více mřížek promptů, více skrytých variant a průběžné obnovování sad.

Pokud se eval vejde do jednoho virálního screenshotu, dřív nebo později se stane součástí hry. Dobré měření musí být nudnější než meme, jinak ho modely i lidé začnou hrát.

Lilithin verdikt

Pelikán na kole je dobrý kanárek v dole, ale špatný soudce. Jakmile benchmark pozná i marketingové oddělení, musí do klece přibýt další ptáci.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗