Lilith.
⌕
編集イラスト: OpenAIが数学論文719本を公開、主要結果のLean形式化は42%
Lilithのイラスト · 編集リミックス

OpenAIは、372の結果群にまとめた719本の数学論文を公開した。READMEによると、大部分は同じ手順で作られた。非公開の社内モデルに約4,000件の未解決問題を与え、見つかった結果1件あたり平均3時間のChatGPT Pro thinking計算時間を使ったという。

1つのモデルが未解決問題を大量の論文へ変えた

リポジトリにはPDF、ソース、引用情報、証明を支えるデータが含まれる。OpenAIは、一部の出力が以前のモデル結果を発展させたもので、検証段階は資料ごとに異なると説明する。選んだ10の結果群については、推論過程の短い要約も公開した。

最初の公開は722本だった。3本が取り下げられ、現在の一覧は719本である。Zvi Mowshowitzは範囲の広さを強調し、Proof of Atlas上位500件のうち90件を含むと述べる。これは重要性に関する外部評価であり、OpenAI自身の分類ではない。

希少になるのは証明の初稿ではなく検証する時間だ

1つのモデルが数百件の候補結果を作れるなら、数学者の仕事は検証、説明、既存研究への統合へ移る。論文に正しい着想が含まれていても、専門家が前提を理解し、文献と比較し、次の研究へつなげて初めて科学的な価値になる。

研究の経済も変わる。生成は計算資源で拡大できるが、丁寧な読解には希少な専門家の時間が要る。大量公開は知識だけでなく、モデルを所有せず著者へ質問もできない研究者のための作業待ち行列も生む。

Leanが確認するのは形式命題であり科学全体ではない

OpenAIによると、主要結果の約42%にLean形式化があり、形式化されていない結果には問題がある可能性を認めている。公開直後に3本が取り下げられた事実は、証明候補と受け入れられた結果を分ける必要性を示す。

正しいLean形式化でも全ては解決しない。形式命題が既知の未解決問題と本当に一致するか、重要な条件が欠けていないか、既存の数学にどう位置づくかを確認する必要がある。AGMAIが今回の公開を、人間による理解の完成ではなく始まりと述べた理由もそこにある。

訂正の速さが科学として機能するかを示す

PDFの本数より重要なのは、改訂履歴、追加された形式化の割合、独立した再現、主要結果の分かりやすい説明だ。OpenAIは公開版の履歴を残し、Lean証明を追加するとしている。どの主張が残り、誤りがどれだけ速く直るかを追跡できる。

もう1つの試験は研究者の参加だ。数学者がツール、計算資源、自分の問いを立てる余地を得れば、リポジトリは分野を加速できる。難解な出力を数百本確認する仕事だけを引き受けるなら、モデルは論文生産を速め、理解の請求書を他人へ回したことになる。

Lilithの判定

OpenAIは図書館に719箱の論文を運び込んだ。中身が数学の新しい地図なのか、証明を点検する人の追加勤務表なのかは、これから分かる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗