2026-10-02 · ← Novinky
16 200 otázek nakreslilo mapu ukrytou v jazykovém modelu
Jednoduchý eval se modelu 16 200krát zeptal, zda zadané souřadnice leží na souši, nebo ve vodě, a z odpovědí složil mapu světa. Výsledek názorně ukazuje geografické znalosti ve vahách, ale bez skóre, baseline a přesné metodiky zatím slouží spíš jako rentgen než jako žebříček.
Obrázek se nepodařilo načíst.
Jednoduchý eval se modelu 16 200krát zeptal, zda zadané souřadnice leží na souši, nebo ve vodě, a z odpovědí složil mapu světa. Výsledek názorně ukazuje geografické znalosti ve vahách, ale bez skóre, baseline a přesné metodiky zatím slouží spíš jako rentgen než jako žebříček.
Textové souřadnice se proměnily v obrys kontinentů
Andrej Karpathy upozornil na experiment, který předkládá LLM zeměpisnou šířku a délku jako text a žádá binární odpověď „Land“ nebo „Water“. Po 16 200 dotazech se odpovědi vykreslí do obrazu. Ve sdíleném výsledku jsou rozpoznatelné kontinenty, takže model spojuje číselné souřadnice s hrubou podobou Země.
Veřejný příspěvek však neuvádí kompletní prompt, rozestupy bodů, teplotu, opakování ani souhrnnou přesnost. Odkazuje na výsledky pro modely Claude, ale samotný krátký příspěvek neposkytuje tabulku, podle níž by šlo modely spolehlivě porovnat. Pozorujeme působivý obraz, nikoli plně popsaný benchmark.
Mapa ve vahách vznikla z textových stop internetu
Model při tomto testu neotevírá mapovou službu. Odpovídá z vazeb naučených během tréninku, kde se souřadnice objevují vedle názvů míst, mapových záznamů, počasí, cestopisů a dalších geografických textů. Experiment tak převádí rozptýlenou statistickou paměť do obrazu, který člověk přečte během sekundy.
Výzkum GeoLLM už dříve ukázal, že jazykové modely obsahují podstatné geografické informace. Zároveň zjistil, že samotné souřadnice mohou být pro náročnější predikce slabým rozhraním a kontext z OpenStreetMap výkon výrazně zlepšuje. Novější GPSBench s 57 800 příklady v 17 úlohách popisuje podobnou hranici: modely zvládají hrubou geografii lépe než přesné určení města a složité výpočty se souřadnicemi.
Pěkná mapa může skrýt snadnou baseline i regionální chyby
Obraz kontinentů neříká, kolik bodů model klasifikoval správně. Výsledek silně ovlivní způsob vzorkování souřadnic, podíl vody, rozlišení mřížky i pravidlo pro pobřežní body. Bez jednoduchých baseline, například vždy odpovědět „Water“, a bez metrik po regionech nelze poznat, zda model opravdu zná menší ostrovy a pobřeží, nebo jen kreslí hrubou siluetu.
Test také neměří navigaci ani geometrické uvažování. Model může správně vybavit, že určitá dvojice čísel souvisí s pevninou, a přitom chybovat při výpočtu vzdálenosti, směru nebo při lokalizaci méně zastoupených oblastí. Působivá vizualizace tyto rozdíly snadno uhladí.
Otevřená data a chybová mapa z pokusu udělají benchmark
Dalším krokem je zveřejnit seznam všech 16 200 bodů, přesný prompt, odpovědi jednotlivých modelů a ground truth. Vedle celkové accuracy by měla přijít vyvážená přesnost pro souš a vodu, výsledky podle vzdálenosti od pobřeží a mapa chyb po regionech.
Nejzajímavější bude stabilita. Pokud se obrys rozpadne po nepatrné změně formátu souřadnic nebo promptu, test odhalil křehkou asociaci. Pokud přežije různé zápisy, modely a opakované běhy, dostaneme levný eval toho, jakou část světa LLM skutečně nese ve svých vahách.
Lilithin verdikt
Model dostal 16 200 špendlíků a z paměti je zapíchal do glóbu tak, že poznáme kontinenty. Teď potřebujeme otočit glóbus a spočítat, kolik špendlíků skončilo v moři.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗