Lilith.
⌕
Redaktionelle Illustration: Beam aktiviert 23 Milliarden Parameter, doch die offenen Gewichte fehlen noch
Illustration von Lilith · redaktioneller Remix

Reflection hat Beam vorgestellt, das erste Open-Weight-Modell des Unternehmens für Coding, Reasoning und agentische Aufgaben. Das Sparse-Mixture-of-Experts-Modell umfasst 501 Milliarden Parameter und aktiviert pro Token 23 Milliarden davon. Gewichte, technischer Bericht, Model Card und Entwicklerwerkzeuge sollen noch im Oktober unter Apache 2.0 erscheinen.

Das Riesenmodell nutzt bei der Inferenz nur einen Teil seiner Kapazität

Reflection gibt an, Beam mit 23,8 Billionen Token vortrainiert zu haben. Die anschließende Reinforcement-Learning-Phase erzeugte über 100 Millionen Rollouts in 4 Wochen auf 10.500 NVIDIA-GB300-GPUs. Nach Angaben des Unternehmens kamen dabei etwa 1,3 Milliarden Sandboxes und eine Million Umgebungen für Coding, agentische Aufgaben und STEM zum Einsatz.

Das Modell befindet sich derzeit im Early Access, während Red-Teaming und Evaluierungen abgeschlossen werden. Die offenen Gewichte standen bei der Ankündigung somit noch nicht zum Download bereit. Open Weight bezeichnet die versprochene Vertriebsform und nicht die heutige Verfügbarkeit.

Der kleinere aktive Kern senkt Rechenaufwand, aber nicht die Modellgröße

Für Betreiber sind die 23 Milliarden aktiven Parameter wichtig, weil sie den Rechenaufwand pro erzeugtem Token beeinflussen. Alle 501 Milliarden Parameter bestimmen weiterhin Speicherbedarf, Ladeaufwand und Hardwarebedarf. Die Sparse-Architektur reduziert einen Teil der Kosten, macht aus einem sehr großen Modell aber keine Software für gewöhnliche Workstations.

Reflection zielt auf Unternehmen und staatliche Institutionen, die ein Modell in eigener Infrastruktur betreiben und anpassen wollen. Eine Veröffentlichung unter Apache 2.0 könnte das erleichtern. Der praktische Wert hängt dennoch von Dokumentation, Unterstützung durch Inferenz-Frameworks und klaren Hardwareprofilen ab.

Die behauptete Ersparnis um Faktor 3 bis 4 berechnet Reflection selbst

Das Unternehmen erklärt, Beam erreiche bei Reasoning-Benchmarks mit GLM-5.2 vergleichbare Ergebnisse und benötige 3 bis 4 Mal weniger Inferenzrechenleistung. Der Vergleich schätzt FLOPs anhand aktiver Parameter und erzeugter Token. Prompt Prefill, kontextabhängige Attention-Operationen und Serving Overhead sind nicht enthalten.

Damit ist das Ergebnis eine nützliche technische Schätzung, jedoch kein gemessener Produktionspreis oder Latenzwert. Unabhängige Teams konnten weder die Benchmarks noch den Betriebsvorteil prüfen, weil die Gewichte zum Start nicht öffentlich waren.

Die Oktober-Veröffentlichung zeigt, ob der Benchmark einsatzfähig wird

Das erste entscheidende Signal ist die tatsächliche Veröffentlichung von Gewichten, Model Card und technischem Bericht unter der angekündigten Lizenz. Danach lassen sich Durchsatz, Latenz, Speicherbedarf und Qualität außerhalb der unternehmenseigenen Tests messen.

Das zweite Signal sind Integrationen in verbreitete Open-Source-Bibliotheken und Fine-Tuning ohne proprietäre Reflection-Schicht. Daran wird sich zeigen, ob Beam eine offene Alternative ist oder vorerst ein eindrucksvoll berechnetes Versprechen bleibt.

Liliths Urteil

Reflection zeigt einen Motor mit 501 Milliarden Teilen und sagt, dass während der Fahrt nur 23 Milliarden arbeiten. Beam tritt erst zum Rennen an, wenn die Haube offen ist und Außenstehende den Verbrauch messen.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗