2026-10-02 · ← ニュース
1万6200問が言語モデル内部の地図を描き出した
モデルに緯度経度を与え、陸か水かを1万6200回尋ねた結果から世界地図を描くシンプルなevalが注目を集めた。重みに埋め込まれた地理知識を視覚化できる一方、score、baseline、完全な手法がない段階では順位表よりX線写真に近い。
画像を読み込めませんでした。
モデルに緯度経度を与え、陸か水かを1万6200回尋ねた結果から世界地図を描くシンプルなevalが注目を集めた。重みに埋め込まれた地理知識を視覚化できる一方、score、baseline、完全な手法がない段階では順位表よりX線写真に近い。
テキストの座標から大陸の輪郭が現れた
Andrej Karpathyが紹介した実験では、緯度と経度をテキストでLLMに渡し、「Land」か「Water」の二択で答えさせる。1万6200回の回答を画像として配置すると、共有された結果には認識できる大陸が現れた。モデルが数値座標と地球の大まかな形を結び付けていることが分かる。
ただし公開投稿には、prompt全文、点の間隔、temperature、反復回数、総合accuracyが記載されていない。Claude各モデルの結果への言及はあるものの、短い投稿自体には信頼できる比較表がない。確認できるのは印象的な画像であり、仕様が揃ったbenchmarkではない。
重みの中の地図はインターネット上の文章から生まれた
このテスト中、モデルは地図サービスを開かない。訓練データでは、座標が地名、地図記録、天気情報、旅行記などの地理的な文章と並んでいる。モデルはそこで学んだ関係から答える。実験は分散した統計的記憶を、人間が一瞬で読める画像へ変換した。
以前のGeoLLM研究も、言語モデルが相当量の地理情報を持つことを示している。同時に、難しい予測では座標だけの入力が弱く、OpenStreetMapの文脈を加えると性能が大きく向上すると報告した。17タスク、5万7800例からなる新しいGPSBenchにも似た境界がある。モデルは大まかな地理には強いが、都市の正確な特定や複雑な座標計算には弱い。
美しい地図は簡単なbaselineと地域別の誤りを隠す
大陸の形が見えても、正しく分類した点の数は分からない。座標のsampling方法、水域の比率、grid解像度、海岸上の点をどう扱うかで結果は大きく変わる。常に「Water」と答えるような単純なbaselineや地域別指標がなければ、小島や海岸線まで把握しているのか、粗い輪郭だけを描いているのかを判定できない。
このテストはnavigationや幾何学的推論も測っていない。ある数値の組が陸地に関係すると正しく想起できても、距離や方角の計算、訓練データで手薄な地域の特定には失敗し得る。魅力的なvisualizationは、その差を見えにくくする。
公開データと誤差地図がdemoをbenchmarkへ変える
次の段階では、1万6200地点、正確なprompt、各モデルの回答、ground truthを公開する必要がある。全体accuracyに加え、陸と水を均等に扱う指標、海岸からの距離別の結果、地域別の誤差地図も欲しい。
最も重要なのは安定性だ。座標表記やpromptを少し変えただけで大陸が崩れるなら、見つかったのは脆い関連付けである。異なる表記、モデル、反復実行でも形が残るなら、LLMが重みの中にどれだけ世界を保持しているかを測る安価なevalになる。
Lilithの判定
モデルは1万6200本のピンを渡され、記憶だけで大陸が見える位置に刺した。次は地球儀を回し、海に落ちたピンを数える番だ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗