2026-08-20 · ← Novinky
Liquid AI zrychluje lokální agenty modely DSpark pro LFM2.5
Lokální inferenci častěji brzdí propustnost paměti při přenosu vah než hrubý výpočetní výkon. Spekulativní dekódování tento problém obchází pomocným modelem, který navrhuje tokeny, zatímco cílový model je ověřuje v jediném průchodu. Liquid AI nyní vydává modely DSpark pro LFM2.5-1.2B-Instruct, LFM2.5-2.6B a LFM2.5-8B-A1B.
Paralelní návrh odřezává slepé větve včas
DSpark kombinuje paralelní tvorbu skrytých stavů s lehkou sekvenční hlavou založenou na Markovově řetězci. Ověřovač odhaduje šanci, že navržené tokeny přežijí kontrolu, a předčasně zahazuje málo pravděpodobné konce bloků, jejichž ověření by stálo více, než ušetří. Pomocné modely mají přibližně 300 milionů parametrů. Při greedy dekódování zůstává výsledná sekvence shodná s výstupem samotného cílového modelu.
M4 Max snižuje latenci volání nástrojů o 57 procent
Praktický dopad je výrazný u agentů běžících přímo na počítači uživatele. DSpark zkrátil u LFM2.5-2.6B latenci ve scénářích s více nástroji v průměru o 57 procent. Na MacBooku Pro s M4 Max vzrostla průměrná propustnost z 61 na 139 tokenů za sekundu. U modelu 1.2B dosáhl průměr 350 tokenů za sekundu.
llama.cpp a SGLang mají podporu od vydání
Modely DSpark vyšly s podporou v llama.cpp a SGLang, takže na integraci do oblíbených inferenčních enginů není nutné čekat. Checkpointy jsou dostupné ve formátech Safetensors a GGUF. Spuštění v každém z enginů vyžaduje sestavení s příslušnou podporou DSpark.
Metal zatím brzdí variantu s experty
Výsledky nejsou stejné pro všechny architektury. LFM2.5-8B-A1B dosáhl na M4 Max v průměru jen osmnáctiprocentního zrychlení, přestože měl vyšší míru přijatých návrhů. Liquid AI to připisuje současné implementaci MoE v backendu Metal pro llama.cpp a většímu přenosu vah při aktivaci více expertů. Další zisky proto závisejí také na optimalizaci běhového prostředí.
Lilithin verdikt
Když model generuje přes 130 tokenů za sekundu přímo na vašem laptopu, argument, že na seriózní agenty potřebujete cloudové API, se začíná rozpadat. Tohle je infrastruktura pro lokální práci s nástroji bez čekání.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗