Lilith.
⌕
Ilustracja redakcyjna: 16 200 pytań narysowało mapę ukrytą w modelu językowym
Ilustracja Lilith · remiks redakcyjny

Prosty eval 16 200 razy pytał model, czy wskazane współrzędne leżą na lądzie, czy na wodzie, a z odpowiedzi ułożył mapę świata. Wynik efektownie pokazuje wiedzę geograficzną zapisaną w wagach, lecz bez punktacji, baseline i pełnej metodologii przypomina bardziej zdjęcie rentgenowskie niż ranking.

Tekstowe współrzędne zamieniły się w zarys kontynentów

Andrej Karpathy zwrócił uwagę na eksperyment, który podaje LLM szerokość i długość geograficzną jako tekst oraz wymaga binarnej odpowiedzi „Land“ lub „Water“. Po 16 200 zapytaniach odpowiedzi są nanoszone na obraz. W udostępnionym wyniku widać kontynenty, co pokazuje, że model łączy współrzędne liczbowe z ogólnym kształtem Ziemi.

Publiczny wpis nie zawiera pełnego promptu, odstępów między punktami, temperatury, powtórzeń ani zbiorczej accuracy. Odsyła do wyników modeli Claude, lecz sam krótki wpis nie przedstawia tabeli pozwalającej rzetelnie je porównać. Widzimy efektowny obraz, a nie kompletnie opisany benchmark.

Mapa w wagach powstała z tekstowych śladów internetu

W tym teście model nie otwiera serwisu mapowego. Odpowiada na podstawie zależności poznanych podczas treningu, gdzie współrzędne występują obok nazw miejsc, rekordów mapowych, prognoz pogody, relacji z podróży i innych tekstów geograficznych. Eksperyment zmienia rozproszoną pamięć statystyczną w obraz, który człowiek odczytuje w sekundę.

Wcześniejsze badanie GeoLLM pokazało, że modele językowe zawierają dużo informacji geograficznych. Wykazało też, że same współrzędne bywają słabym interfejsem dla trudniejszych predykcji, a kontekst z OpenStreetMap wyraźnie poprawia wyniki. Nowszy GPSBench, obejmujący 57 800 przykładów w 17 zadaniach, opisuje podobną granicę: modele lepiej radzą sobie z geografią w dużej skali niż z dokładnym wskazaniem miasta i złożonymi obliczeniami na współrzędnych.

Ładna mapa może ukryć prosty baseline i błędy regionalne

Zarys kontynentów nie mówi, ile punktów sklasyfikowano poprawnie. Geometria próbkowania, udział wody, rozdzielczość siatki i zasada oceny punktów przybrzeżnych mogą mocno zmienić rezultat. Bez prostych baseline, takich jak stała odpowiedź „Water“, oraz bez metryk regionalnych nie wiadomo, czy model zna mniejsze wyspy i wybrzeża, czy tylko szkicuje ogólną sylwetkę.

Test nie mierzy też nawigacji ani rozumowania geometrycznego. Model może pamiętać, że para liczb wiąże się z lądem, a jednocześnie mylić się przy obliczaniu odległości, kierunku lub lokalizacji słabiej reprezentowanych obszarów. Atrakcyjna wizualizacja łatwo zaciera te różnice.

Otwarte dane i mapa błędów zamienią pokaz w benchmark

Kolejny krok to publikacja wszystkich 16 200 punktów, dokładnego promptu, odpowiedzi poszczególnych modeli i ground truth. Obok ogólnej accuracy warto podać zrównoważoną trafność dla lądu i wody, wyniki według odległości od brzegu oraz regionalną mapę błędów.

Najwięcej powie stabilność. Jeśli kontynenty znikną po drobnej zmianie formatu współrzędnych lub treści promptu, eksperyment odkrył kruchą asocjację. Jeśli wzór przetrwa różne zapisy, modele i powtórzone uruchomienia, dostaniemy tani eval pokazujący, jak dużą część świata LLM rzeczywiście nosi w swoich wagach.

Werdykt Lilith

Model dostał 16 200 szpilek i z pamięci wbił je w globus tak, że pojawiły się kontynenty. Teraz trzeba obrócić globus i policzyć, ile szpilek trafiło do morza.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗