2026-10-05 · ← Aktualności
Beam aktywuje 23 miliardy parametrów, ale na otwarte wagi trzeba poczekać
Reflection przedstawiło Beam, sparse Mixture-of-Experts z 501 miliardami parametrów, z których podczas inferencji aktywne są 23 miliardy. Firma zapowiada wagi na licencji Apache 2.0 jeszcze w październiku, lecz na razie oferuje tylko early access i własne benchmarki.
Nie udało się wczytać obrazu.
Reflection przedstawiło Beam, swój pierwszy model open-weight do zadań coding, reasoning i agentic. To sparse Mixture-of-Experts z 501 miliardami parametrów, który dla każdego tokenu aktywuje 23 miliardy. Wagi, raport techniczny, model card i narzędzia dla deweloperów mają zostać opublikowane jeszcze w październiku na licencji Apache 2.0.
Ogromny model podczas inferencji uruchamia tylko część pojemności
Reflection podaje, że pretraining Beam objął 23,8 biliona tokenów. Etap reinforcement learning przyniósł ponad 100 milionów rolloutów w ciągu 4 tygodni na 10 500 GPU NVIDIA GB300. Firma deklaruje wykorzystanie około 1,3 miliarda sandboxów oraz miliona środowisk do zadań coding, agentic i STEM.
Model jest obecnie dostępny w ramach early access, a red-teaming i ewaluacje wciąż trwają. W chwili ogłoszenia otwartych wag nie można było jeszcze pobrać. Określenie open-weight opisuje zapowiedziany sposób dystrybucji, a nie bieżącą dostępność.
Mniejszy aktywny rdzeń obniża koszt pracy, lecz nie rozmiar modelu
Dla operatorów ważne są 23 miliardy aktywnych parametrów, bo wpływają na ilość obliczeń potrzebnych do wygenerowania tokenu. Wszystkie 501 miliardów nadal określa wymagania dotyczące przechowywania, ładowania i infrastruktury. Architektura sparse ogranicza część kosztów, ale nie zmienia wielkiego modelu w oprogramowanie na zwykłą stację roboczą.
Reflection kieruje Beam do firm i instytucji państwowych, które chcą uruchamiać i dostosowywać model we własnej infrastrukturze. Licencja Apache 2.0 może to ułatwić. Wartość praktyczna zależy jednak od dokumentacji, obsługi przez frameworki inference oraz jasnych profili sprzętowych.
Deklarowaną oszczędność 3 do 4 razy wylicza samo Reflection
Firma twierdzi, że Beam osiąga na benchmarkach reasoning wyniki porównywalne z GLM-5.2 przy 3 do 4 razy mniejszym inference compute. Porównanie szacuje FLOPs na podstawie liczby aktywnych parametrów i wygenerowanych tokenów. Nie obejmuje prompt prefill, operacji attention zależnych od długości kontekstu ani serving overhead.
To użyteczny szacunek techniczny, ale nie pomiar ceny lub latencji w produkcji. Niezależne zespoły nie mogły jeszcze sprawdzić benchmarków ani deklarowanej przewagi operacyjnej, ponieważ wagi nie były publiczne.
Październikowa publikacja pokaże, czy benchmark da się wdrożyć
Pierwszym rozstrzygającym sygnałem będzie faktyczna publikacja wag, model card i raportu technicznego na zapowiedzianej licencji. Dopiero wtedy niezależni badacze zmierzą przepustowość, latencję, zużycie pamięci i jakość poza zestawem ewaluacyjnym firmy.
Drugim sygnałem będą integracje z popularnymi bibliotekami open source i możliwość fine-tuningu bez własnościowej warstwy Reflection. To one pokażą, czy Beam stanie się otwartą alternatywą, czy pozostanie efektownie policzoną obietnicą.
Werdykt Lilith
Reflection pokazało silnik z 501 miliardami części i twierdzi, że podczas jazdy pracują tylko 23 miliardy. Beam zacznie się ścigać dopiero po otwarciu maski i pomiarze spalania przez kogoś z zewnątrz.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗