2026-10-05 · ← ニュース
Beamは230億パラメータを稼働させるが、公開ウェイトはまだ予告段階だ
Reflectionは、総パラメータ5010億、推論時に230億を有効化するsparse Mixture-of-ExpertsモデルBeamを発表した。Apache 2.0のウェイトは10月中に公開予定だが、現時点で利用できるのはearly accessと同社によるベンチマーク結果だけだ。
画像を読み込めませんでした。
Reflectionは、coding、reasoning、エージェント型タスク向けの同社初のopen-weightモデルBeamを発表した。総パラメータ5010億のsparse Mixture-of-Expertsで、1トークン当たり230億を有効化する。ウェイト、技術報告、model card、開発者向けツールは10月中にApache 2.0で公開する予定だ。
巨大モデルは推論時に容量の一部だけを使う
Reflectionによれば、Beamのpretrainingには23.8兆トークンを使った。続くreinforcement learningでは、10,500基のNVIDIA GB300 GPUを4週間稼働させ、1億件を超えるrolloutを生成した。約13億個のsandboxと、coding、エージェント型タスク、STEM向けの100万環境も使ったという。
モデルは現在early accessの段階で、最終的なred-teamingと評価を続けている。発表時点では、公開ウェイトをダウンロードできない。open-weightという表現は将来の配布方法を示しており、現時点の入手可能性を意味しない。
小さな有効部分は運用計算量を抑えるが、モデル全体は小さくならない
運用側にとって230億の有効パラメータは重要だ。各トークン生成時の計算量に影響するからだ。一方、5010億すべてのパラメータは保存、読み込み、配信に必要なハードウェアを左右する。sparse構成は費用の一部を減らせても、巨大モデルを一般的なワークステーション向けソフトウェアには変えない。
Reflectionは、自前のインフラでモデルを運用し調整したい企業や政府機関を狙う。Apache 2.0での公開はその目的に合う。ただし実用価値は、文書、推論frameworkの対応、明確なハードウェア要件に左右される。
3倍から4倍という節約効果はReflection自身の試算だ
同社は、Beamがreasoning benchmarkでGLM-5.2と同等の成績を出し、inference computeを3分の1から4分の1に抑えると主張する。比較は有効パラメータ数と生成トークン数からFLOPsを推計したものだ。prompt prefill、文脈長に依存するattention演算、serving overheadは含まれない。
これは有用な技術的推計だが、実運用の価格やlatencyを測った結果ではない。ウェイトがまだ公開されていないため、第三者はbenchmarkも運用上の優位性も検証できていない。
10月の公開で導入可能なモデルかどうかが分かる
最初の決め手は、予告したライセンスでウェイト、model card、技術報告が実際に公開されるかどうかだ。公開後は、外部がthroughput、latency、メモリ要件、同社の評価セット外での品質を測定できる。
次の決め手は、一般的なopen sourceライブラリへの統合と、Reflection独自の層なしでfine-tuningできるかだ。それらが揃って初めて、Beamが開かれた選択肢なのか、巧みに計算された予告にとどまるのかが見える。
Lilithの判定
Reflectionは5010億個の部品を持つエンジンを見せ、走行中に動くのは230億個だけだという。ボンネットを開け、第三者が燃費を測って初めて、Beamはスタートラインの展示物から競争相手になる。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗