Lilith Lilith.
⌕
Redaktionelle Illustration: DSpark beschleunigt ein Vision-Modell um bis zu 3,13-mal, aber nicht das erste Token
Illustration von Lilith · redaktioneller Remix

Liquid AI hat einen experimentellen DSpark-Drafter für das Vision-Language-Modell LFM2.5-VL-3B veröffentlicht. Das kleinere Modell schlägt Blöcke kommender Tokens vor, das Zielmodell prüft sie und übernimmt nur gültige Vorschläge. Bei gleichen Sampling-Einstellungen entspricht die Ergebnisverteilung weiterhin dem Zielmodell allein.

8,9 Prozent mehr Parameter vervielfachen die Decoding-Geschwindigkeit

DSpark besitzt 279,5 Millionen Parameter, vier Schichten und eine empfohlene Blockgröße von 8 oder 9 Tokens. Neben dem Zielmodell mit 3 Milliarden Parametern steigt die bereitgestellte Parameterzahl um 8,9 Prozent. Liquid AI unterstützt llama.cpp, MLX-VLM und SGLang und bietet Gewichte in Safetensors und GGUF an.

Auf einem M5 Max wurde das Decoding je nach Aufgabe um das 2,30- bis 3,13-Fache schneller, die Gesamtlatenz um das 1,56- bis 2,62-Fache. Auf einer H100 mit 80 GB lagen die Faktoren bei 2,04 bis 2,66 für das Decoding und 1,64 bis 2,27 für den gesamten Ablauf.

Edge-Systeme werden schneller, ohne das Zielmodell auszutauschen

Für Teams, die LFM2.5-VL-3B bereits betreiben, ist der begrenzte Eingriff attraktiv. Der Drafter ersetzt das Zielmodell nicht und tauscht Qualität nicht gegen Quantisierung. Er schlägt Kandidaten vor, die das ursprüngliche Modell kontrolliert. Bildbeschreibungen, Dokumentantworten oder visuelle Dialoge lassen sich so ohne Änderung der Anwendungslogik beschleunigen.

Der Nutzen wächst mit der Zahl der Ausgabetokens. Bei einer langen Beschreibung oder einem mehrstufigen Dialog summiert sich schnelleres Decoding. Bei einer kurzen Antwort kann die Arbeit dominieren, die DSpark nicht beschleunigt.

Bildkodierung und Prefill bestimmen weiter die Startlatenz

Ein Bild durchläuft zuerst einen Vision Encoder, danach verarbeitet das Hauptmodell Hunderte visuelle Tokens. Speculative Decoding beschleunigt weder diese Phase noch die Zeit bis zum ersten Token. Deshalb bleibt der beste End-to-End-Gewinn unter der Spitzenzahl für das Decoding. Die veröffentlichten Tests verwenden zudem 16-Bit-Gewichte, Batch Size 1 und sechs MMSpec-Aufgaben. Quantisierte Varianten sind nicht Teil dieses Releases.

Kurze Antworten und parallele Anfragen liefern den Praxistest

Entscheidend sind reale Profile: Anteil der Bildkodierung, Promptlänge, Antwortlänge und Gleichzeitigkeit. Liquid AI maß auch bei höherer Parallelität einen Vorteil, doch der Abstand schrumpfte mit wachsender Last. Teams sollten End-to-End-Latenz und Zeit bis zum ersten Token messen, statt nur den Faktor 3,13 auf ein Dashboard zu schreiben.

Liliths Urteil

DSpark setzt einen kleinen Souffleur neben 3 Milliarden Parameter und das Hauptmodell läuft tatsächlich schneller. Die Kamera verarbeitet das Bild weiter an der Startlinie, deshalb gehört die Stoppuhr an das ganze Rennen und nicht nur an die Zielgerade.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗