DiffusionGemma zkouší obejít nejpomalejší zvyk LLM: token po tokenu
Google DeepMind představil DiffusionGemma, experimentální open model pro textovou generaci, který podle stránky modelu dosahuje na NVIDIA GPU až 4x až 5x rychlejšího výstupu a přes 1 000 tokenů za sekundu na H100. Důležitější než samotné číslo je směr: textové modely začínají útočit na sekvenční bottleneck.