2026-10-05 · ← Novinky
Beam aktivuje 23 miliard parametrů, otevřené váhy ale teprve přijdou
Reflection představila Beam, sparse Mixture-of-Experts model s 501 miliardami parametrů, z nichž při inferenci aktivuje 23 miliard. Firma slibuje Apache 2.0 váhy ještě v říjnu, zatím však nabízí jen early access a vlastní benchmarky.
Obrázek se nepodařilo načíst.
Reflection představila svůj první open-weight model Beam pro coding, reasoning a agentní úlohy. Jde o sparse Mixture-of-Experts model s 501 miliardami parametrů, který při každém tokenu aktivuje 23 miliard. Váhy, technická zpráva, model card a vývojářské nástroje mají vyjít ještě v říjnu pod licencí Apache 2.0.
Obří model při inferenci zapojuje jen zlomek své kapacity
Reflection uvádí, že Beam natrénovala na 23,8 bilionu tokenů. Následná reinforcement learning fáze vytvořila přes 100 milionů rolloutů během 4 týdnů na 10 500 GPU NVIDIA GB300. Firma při ní používala přibližně 1,3 miliardy sandboxů a milion prostředí pro coding, agentní a STEM úlohy.
Model je zatím v early access a dokončuje red-teaming a evaluace. Otevřené váhy tedy nejsou v okamžiku oznámení ke stažení. Označení open-weight popisuje slíbený způsob distribuce, nikoli dnešní dostupnost.
Menší aktivní část míří na účet za provoz, ne na velikost souboru
Pro firmy je podstatných 23 miliard aktivních parametrů, protože tato hodnota ovlivňuje výpočet při generování každého tokenu. Celých 501 miliard parametrů však stále určuje nároky na uložení, načtení a provoz modelu napříč hardwarem. Sparse architektura snižuje část nákladů, ale z velkého modelu nedělá software pro běžnou pracovní stanici.
Reflection cílí na podniky a státy, které chtějí model provozovat a upravovat ve vlastní infrastruktuře. Apache 2.0 licence by tomu mohla otevřít cestu. Skutečná hodnota ale vznikne teprve s dokumentací, podporou inference frameworků a jasnými hardwarovými profily.
Úsporu 3 až 4krát zatím počítá sama Reflection
Firma tvrdí, že Beam dosahuje na reasoning benchmarcích výsledků srovnatelných s GLM-5.2 při 3 až 4krát nižším inference compute. Srovnání ale vychází z odhadu FLOPs podle počtu aktivních parametrů a vygenerovaných tokenů. Nezahrnuje prompt prefill, attention závislou na délce kontextu ani serving overhead.
Jde tedy o užitečný technický odhad, ne o naměřenou cenu nebo latenci v produkci. Nezávislé testy zatím nemohly ověřit ani benchmarky, ani slíbenou provozní výhodu, protože váhy ještě nebyly veřejné.
Říjnové vydání ukáže, zda z benchmarku vznikne nasaditelný model
Rozhodující bude skutečné zveřejnění vah, model card a technické zprávy pod slíbenou licencí. Pak půjde změřit propustnost, latenci, paměťové nároky a kvalitu na úlohách mimo firemní sadu.
Druhým signálem budou integrace s běžnými open source knihovnami a možnost fine-tuningu bez proprietární vrstvy Reflection. Teprve ty ukážou, zda Beam nabízí otevřenou alternativu, nebo zatím hlavně působivě spočítaný příslib.
Lilithin verdikt
Reflection ukázala motor s 501 miliardami součástek a tvrdí, že při jízdě zapíná jen 23 miliard. Až otevře kapotu a někdo cizí změří spotřebu, začne Beam závodit místo pózování na startovní čáře.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗