Lilith Lilith.
Ilustracja redakcyjna: Liquid AI przyspiesza lokalnych agentów modelami DSpark dla LFM2.5
Ilustracja Lilith · remiks redakcyjny

Lokalną inferencję częściej ogranicza przepustowość pamięci podczas przesyłania wag niż surowa moc obliczeniowa. Dekodowanie spekulatywne obchodzi ten problem za pomocą modelu pomocniczego, który proponuje tokeny, podczas gdy model docelowy weryfikuje je w jednym przebiegu. Liquid AI udostępnia modele DSpark dla LFM2.5-1.2B-Instruct, LFM2.5-2.6B oraz LFM2.5-8B-A1B.

Równoległe propozycje wcześnie odcinają ślepe gałęzie

DSpark łączy równoległe tworzenie stanów ukrytych z lekką głowicą sekwencyjną opartą na łańcuchu Markowa. Weryfikator ocenia szansę, że proponowane tokeny przejdą kontrolę, i wcześniej odrzuca mało pewne końcówki bloków, gdy ich sprawdzenie kosztowałoby więcej, niż pozwoliłoby zaoszczędzić. Modele pomocnicze mają około 300 milionów parametrów. Przy dekodowaniu zachłannym wynikowa sekwencja pozostaje identyczna z wyjściem samego modelu docelowego.

M4 Max skraca opóźnienie wywołań narzędzi o 57 procent

Praktyczny efekt jest wyraźny w przypadku agentów działających bezpośrednio na komputerze użytkownika. DSpark skrócił opóźnienie LFM2.5-2.6B w scenariuszach z wieloma narzędziami średnio o 57 procent. Na MacBooku Pro z M4 Max średnia przepustowość wzrosła z 61 do 139 tokenów na sekundę. Model 1.2B osiągnął średnio 350 tokenów na sekundę.

llama.cpp i SGLang mają obsługę od dnia premiery

Modele DSpark zadebiutowały ze wsparciem w llama.cpp i SGLang, więc nie trzeba czekać na integrację z popularnymi silnikami inferencyjnymi. Punkty kontrolne są dostępne w formatach Safetensors i GGUF. Uruchomienie w każdym z silników wymaga wersji z odpowiednią obsługą DSpark.

Metal nadal ogranicza wariant z mieszanką ekspertów

Wyniki nie są jednakowe dla wszystkich architektur. LFM2.5-8B-A1B uzyskał na M4 Max średnio tylko osiemnaście procent przyspieszenia, mimo wyższego odsetka zaakceptowanych propozycji. Liquid AI przypisuje tę różnicę obecnej implementacji MoE w backendzie Metal dla llama.cpp oraz większemu transferowi wag przy aktywacji kolejnych ekspertów. Dalsze zyski zależą więc także od optymalizacji środowiska uruchomieniowego.

Werdykt Lilith

Kiedy model generuje ponad 130 tokenów na sekundę bezpośrednio na laptopie, argument, że poważni agenci wymagają API w chmurze, zaczyna się rozsypywać. To infrastruktura do lokalnego korzystania z narzędzi bez czekania.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗