2026-09-24 · ← Novinky
DSpark zrychluje obrazový model až 3,13krát, první token ale neurychlí
Liquid AI vydal experimentální drafter DSpark pro obrazově jazykový model LFM2.5-VL-3B. Malý model navrhuje bloky dalších tokenů, velký model je ověří a přijme jen správné návrhy. Při shodném nastavení sampling zůstává výsledné rozdělení stejné jako u samotného cílového modelu.
Drafter přidává 8,9 % parametrů a násobí rychlost dekódování
DSpark má 279,5 milionu parametrů, čtyři vrstvy a doporučený blok o velikosti 8 nebo 9 tokenů. Vedle třímiliardového cílového modelu zvyšuje počet nasazených parametrů o 8,9 %. Liquid AI uvádí podporu v llama.cpp, MLX-VLM a SGLang a nabízí váhy ve formátech Safetensors a GGUF.
Na M5 Max dosáhlo dekódování podle úlohy zrychlení 2,30krát až 3,13krát. Celková latence klesla 1,56krát až 2,62krát. Na jednom H100 80 GB se dekódování zrychlilo 2,04krát až 2,66krát a celý běh 1,64krát až 2,27krát.
Edge získává rychlejší odpověď bez výměny hlavního modelu
Pro týmy, které už LFM2.5-VL-3B nasadily, je přitažlivá přesnost změny. Drafter nenahrazuje cílový model ani nesnižuje kvalitu kvantizací. Navrhuje kandidáty, které původní model kontroluje. Integrace tak může zkrátit generování popisů obrázků, odpovědí nad dokumenty nebo vizuálních dialogů bez změny aplikační logiky.
Přínos je největší tam, kde odpověď obsahuje dost výstupních tokenů. U dlouhého popisu nebo vícekrokového dialogu se rychlejší decode nasčítá. U krátké odpovědi může dominovat práce, kterou DSpark vůbec neurychluje.
Kamera a prefill dál vybírají účet za latenci
Obraz musí nejprve projít vision encoderem a stovky obrazových tokenů musí zpracovat hlavní model. Speculative decoding tuto část ani čas do prvního tokenu nezrychluje. Proto je maximální zisk celého běhu nižší než špičkové číslo pro decode. Publikované testy navíc používají 16bitové váhy, batch size 1 a šest úloh z MMSpec. Zrychlení kvantizovaných variant zatím release nepokrývá.
Reálné nasazení prověří krátké odpovědi a souběh uživatelů
Rozhodnou profily z konkrétních aplikací: podíl vision encodingu, délka promptu, délka odpovědi a konkurence požadavků. Liquid AI naměřil výhodu i při vyšším souběhu, rozdíl se však s rostoucí konkurencí zmenšoval. Týmům se vyplatí měřit end-to-end latenci a čas do prvního tokenu, ne vystavit na dashboard samotné 3,13krát.
Lilithin verdikt
DSpark posadil vedle tří miliard parametrů malého našeptávače a hlavní model díky němu běží rychleji. Kamera však dál stojí u startovní čáry a zpracovává obraz, takže stopky patří nad celý závod, ne jen nad cílovou rovinku.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗