Lilith Lilith.
Redakční ilustrace: Liquid AI zrychluje lokální agenty modely DSpark pro LFM2.5
Ilustrace Lilith · redakční remix

Lokální inferenci častěji brzdí propustnost paměti při přenosu vah než hrubý výpočetní výkon. Spekulativní dekódování tento problém obchází pomocným modelem, který navrhuje tokeny, zatímco cílový model je ověřuje v jediném průchodu. Liquid AI nyní vydává modely DSpark pro LFM2.5-1.2B-Instruct, LFM2.5-2.6B a LFM2.5-8B-A1B.

Paralelní návrh odřezává slepé větve včas

DSpark kombinuje paralelní tvorbu skrytých stavů s lehkou sekvenční hlavou založenou na Markovově řetězci. Ověřovač odhaduje šanci, že navržené tokeny přežijí kontrolu, a předčasně zahazuje málo pravděpodobné konce bloků, jejichž ověření by stálo více, než ušetří. Pomocné modely mají přibližně 300 milionů parametrů. Při greedy dekódování zůstává výsledná sekvence shodná s výstupem samotného cílového modelu.

M4 Max snižuje latenci volání nástrojů o 57 procent

Praktický dopad je výrazný u agentů běžících přímo na počítači uživatele. DSpark zkrátil u LFM2.5-2.6B latenci ve scénářích s více nástroji v průměru o 57 procent. Na MacBooku Pro s M4 Max vzrostla průměrná propustnost z 61 na 139 tokenů za sekundu. U modelu 1.2B dosáhl průměr 350 tokenů za sekundu.

llama.cpp a SGLang mají podporu od vydání

Modely DSpark vyšly s podporou v llama.cpp a SGLang, takže na integraci do oblíbených inferenčních enginů není nutné čekat. Checkpointy jsou dostupné ve formátech Safetensors a GGUF. Spuštění v každém z enginů vyžaduje sestavení s příslušnou podporou DSpark.

Metal zatím brzdí variantu s experty

Výsledky nejsou stejné pro všechny architektury. LFM2.5-8B-A1B dosáhl na M4 Max v průměru jen osmnáctiprocentního zrychlení, přestože měl vyšší míru přijatých návrhů. Liquid AI to připisuje současné implementaci MoE v backendu Metal pro llama.cpp a většímu přenosu vah při aktivaci více expertů. Další zisky proto závisejí také na optimalizaci běhového prostředí.

Lilithin verdikt

Když model generuje přes 130 tokenů za sekundu přímo na vašem laptopu, argument, že na seriózní agenty potřebujete cloudové API, se začíná rozpadat. Tohle je infrastruktura pro lokální práci s nástroji bez čekání.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗