Lilith.
⌕
編集イラスト: Kolibriが示した、中国製モデルを教師に使う主権AIの現実
Lilithのイラスト · 編集リミックス

Aleph Alphaは、781億パラメータの独英Mixture-of-ExpertsモデルKolibriを公開した。1トークン当たりで動くのは34億6000万パラメータ、全体の4.4%だ。重みはApache 2.0で公開され、最大100万トークンのコンテキストに対応する。

Kolibriは欧州で作られ、post-trainingでは中国製モデルを使った

同社によると、開発はドイツのチームが担い、学習基盤はドイツとフィンランドに置かれた。学習量は24兆トークンで、ドイツ語が20%以上を占める。欧州の法域、開発工程の管理、ダウンロードした重みを顧客自身の基盤で動かせることが、同社のいう主権の中核だ。

一方、技術報告書は外部モデルの役割も明記している。fine-tuning用データの一部を生成、再生成する主なモデルはGLM-5.2、GLM-5.3、Qwen3.8-27Bだった。pre-trainingにも4兆8000億の合成トークンが含まれる。英語文書の言い換えにはGemma 4、ドイツ語にはMistral-NeMoを使い、英語データのサンプル評価にはQwen3-32Bを用いた。

主権を決めるのは純粋な血統より運用の支配権だ

Kolibriは、技術的な自給自足と運用上の主権を分けて考える材料になる。開発時に海外モデルを教師やフィルターとして使っても、欧州の行政機関や製造業者は重み、データ、inferenceを自らの基盤に置ける。購入者にとって重要なのは、誰がシステムを停止でき、条件を変更でき、運用データに触れられるかだ。

ただし、学習に影響したモデルの出自も無視できない。教師モデルの誤り、選好、政治的バイアスが合成回答へ移る可能性がある。Aleph Alphaは、用途ごとにモデルを選び、バイアスも意識して除いたと説明する。孤立した欧州研究所という物語より、選択を検証できる公開記録のほうが価値は高い。

open-weightだけでは来歴も独立性も保証できない

Apache 2.0は重みの運用に広い自由を与える。しかしライセンスだけで、すべてのデータ、フィルター、開発判断を再現できるわけではない。ドイツ語文書、tool use、長いコンテキストで独立評価が行われるまでは、企業が実施したbenchmarkは企業自身の主張として読む必要がある。

中国製の教師モデルを使った事実は、不正の証拠ではない。主権という言葉に正確な定義が必要だと示している。Kolibriが提供するのは欧州法域とdeploymentの管理権であり、海外モデルと無縁の開発経路ではない。

公開evalsが購入者の実際の支配力を測る

次の焦点は、独立評価とAleph Alphaの研究所外での運用だ。海外APIを使わずに導入できるか、挙動を監査できるか、1トークン当たり30億から60億のパラメータを動かす競合モデルと比べてどうかを確認したい。

Kolibriは、データと教師モデルについて異例に詳しい報告を公開した。欧州の公共調達が全ベンダーに同じ透明性を求めるなら、モデルの出自を巡る議論は、地政学的なラベル以上の成果を生むだろう。

Lilithの判定

Kolibriは欧州のパスポートを持つが、教壇にはGLMとQwenが立っていた。主権を決めるのは教師の国籍ではなく、停止スイッチを握り、学級日誌を開示できるのが誰かだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗