Lilith.
⌕
編集イラスト: 719本の数学論文、公開待ちのopen-weightモデル2つ、AI safety部門からの新たな退職
Lilithのイラスト · 編集リミックス

今週のLast Week in AIは、検証可能性をめぐる3つの異なる話を整理している。OpenAIはモデルを公開せずに数百件の数学的成果を示し、欧米の2チームはすぐにダウンロードできる重みがないままopen-weightモデルを発表し、安全研究者は社内のリスク管理の限界を語った。

OpenAIは719本の論文を公開したがモデルは非公開のままだ

まとめの公開時点で、公開repositoryには372のテーマ群に分かれた719本の論文があった。一部の証明にはLeanによる形式化があり、OpenAIはモデルの推論過程を説明する10件の要約、計算量の推定、取り組んだ問題の統計も追加した。frontier model自体は公開されていない。

OpenAIは、Institute for Advanced StudyのAdvisory Group on Mathematics and Artificial Intelligenceに公開方法を相談したと説明した。同グループは以前、モデル名、prompt、計算費用の開示を求め、科学者が利用できない独自モデルで高度な問題を試すことに警告していた。

MistralとReflectionは重み公開前に自己管理の価値を売る

Mistralは総parameter数1兆、稼働parameter数490億のmultimodalモデルMistral Large 4を発表した。Reflection AIは総parameter数5010億、稼働parameter数230億のtext-onlyモデルBeamを示した。両社とも中国のopen-weightシステムに対する欧米発の選択肢として位置づけている。

発表時点では、どちらの重みもダウンロードできなかった。Mistralはmoderated APIを開き、10月の重み公開を予定していた。Reflectionはearly accessの登録を受け付け、同月中に重み、技術報告、model cardを出すと約束した。企業や政府にとって自己管理できる運用は魅力だが、現時点では検証済みの機能ではなく約束である。

安全研究者の退職が社内インセンティブを再び問う

David Robinsonは3年半在籍したOpenAIを退職した。本人によると、現在のPreparedness Frameworkの策定を主導し、12件のfrontier model公開に関する安全報告を監督した。寄稿文では、問題が起きてから保護策を改善する企業文化を批判した。

彼の主張はbenchmarkで検証できず、退職する社員の視点でもある。それでも技術面の2つの話を補う。repository、model card、公開された重みだけでは、公開速度と慎重さの衝突を企業がどう処理するかは分からない。

3つの発表すべてに独立した検証が必要になる

数学では専門家による論文審査と、形式化された証明の再現が重要になる。MistralとReflectionでは、重みが実際に届くか、どのlicenseか、独立したevalsが公表結果を再現するかが問われる。

安全面では企業の反応が指標になる。Robinsonの批判が測定可能な工程変更につながるのか、公開の場での退職が1件増えるだけなのか。このまとめは市場全体を1つの物語に押し込むものではなく、3つの確認地点を示す地図である。

Lilithの判定

机には719本の論文が積まれ、その横にはopen-weightと書かれた未開封の箱が2つあり、安全を見ていた人物は出口へ向かう。今週出てきたのは1つの答えではなく、独立検証者が追うべき3本の線だ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗