DiffusionGemma uderza w najwolniejszy nawyk LLM: token po tokenie
Google DeepMind pokazał DiffusionGemma, eksperymentalny open model do generowania tekstu, który według strony modelu osiąga na NVIDIA GPU do 4x do 5x szybszy output i ponad 1 000 tokenów na sekundę na H100. Ważniejszy od samej liczby jest kierunek: modele tekstowe zaczynają atakować sekwencyjny bottleneck.