2026-09-24 · ← Aktualności
DSpark przyspiesza model wizyjny nawet 3,13 raza, lecz nie skraca drogi do pierwszego tokenu
Liquid AI opublikowało eksperymentalny drafter DSpark dla modelu vision-language LFM2.5-VL-3B. Mniejszy model proponuje bloki kolejnych tokenów, a model docelowy je sprawdza i przyjmuje wyłącznie poprawne propozycje. Przy tych samych ustawieniach sampling rozkład wyników pozostaje taki sam jak dla samego modelu docelowego.
Narzut 8,9 % parametrów wielokrotnie przyspiesza dekodowanie
DSpark ma 279,5 mln parametrów, cztery warstwy i zalecany blok 8 lub 9 tokenów. W zestawie z modelem docelowym o 3 mld parametrów zwiększa liczbę wdrożonych parametrów o 8,9 %. Liquid AI zapewnia obsługę w llama.cpp, MLX-VLM i SGLang oraz udostępnia wagi w formatach Safetensors i GGUF.
Na M5 Max dekodowanie przyspieszyło od 2,30 do 3,13 raza zależnie od zadania, a cały przebieg od 1,56 do 2,62 raza. Na jednym H100 80 GB wzrost wyniósł od 2,04 do 2,66 raza dla dekodowania oraz od 1,64 do 2,27 raza dla całego procesu.
Edge zyskuje szybszą odpowiedź bez wymiany głównego modelu
Dla zespołów korzystających już z LFM2.5-VL-3B atrakcyjny jest ograniczony zakres zmiany. Drafter nie zastępuje modelu docelowego i nie obniża jakości przez kwantyzację. Proponuje kandydatów sprawdzanych przez pierwotny model. Integracja może więc skrócić generowanie opisów obrazów, odpowiedzi na dokumenty i dialogów wizualnych bez przebudowy logiki aplikacji.
Korzyść rośnie wraz z liczbą tokenów wyjściowych. W długim opisie lub wieloetapowej rozmowie szybszy decode działa przez dłuższy czas. Przy krótkiej odpowiedzi może dominować praca, której DSpark nie przyspiesza.
Vision encoder i prefill nadal wystawiają rachunek za opóźnienie
Obraz najpierw przechodzi przez vision encoder, a model główny musi później przetworzyć setki tokenów wizualnych. Speculative decoding nie skraca tego etapu ani czasu do pierwszego tokenu. Dlatego najlepszy wynik end-to-end jest niższy od liczby dotyczącej decode. Opublikowane testy używają też wag 16-bitowych, batch size 1 i sześciu zadań MMSpec. Kwantyzowane warianty nie zostały objęte tym wydaniem.
Krótkie odpowiedzi i ruch wielu użytkowników dadzą właściwy test
O wyniku zdecydują profile prawdziwych aplikacji: udział kodowania obrazu, długość promptu, długość odpowiedzi i liczba równoległych żądań. Liquid AI zmierzyło przewagę również przy większej współbieżności, choć różnica malała wraz z obciążeniem. Zespoły powinny mierzyć latencję end-to-end i czas do pierwszego tokenu, zamiast przypinać do dashboardu samo 3,13 raza.
Werdykt Lilith
DSpark posadził małego suflera obok 3 mld parametrów i główny model rzeczywiście biegnie szybciej. Kamera nadal obrabia obraz na linii startu, więc stoper trzeba włączyć na cały wyścig, a nie dopiero na finisz.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗