2026-09-24 · ← Noticias
DSpark acelera un modelo visual hasta 3,13 veces, pero no adelanta el primer token
Liquid AI ha publicado un drafter experimental DSpark para el modelo vision-language LFM2.5-VL-3B. El modelo pequeño propone bloques de tokens y el modelo principal los verifica, aceptando solo las propuestas válidas. Con la misma configuración de sampling, la distribución final equivale a ejecutar únicamente el modelo principal.
Un 8,9 % más de parámetros multiplica la velocidad de decodificación
DSpark tiene 279,5 millones de parámetros, cuatro capas y un bloque recomendado de 8 o 9 tokens. Junto al modelo objetivo de 3.000 millones, eleva el número de parámetros desplegados un 8,9 %. Liquid AI ofrece soporte en llama.cpp, MLX-VLM y SGLang, con pesos en formatos Safetensors y GGUF.
En un M5 Max, la decodificación mejoró entre 2,30 y 3,13 veces según la tarea, y la latencia completa entre 1,56 y 2,62 veces. En una H100 de 80 GB, la decodificación aceleró entre 2,04 y 2,66 veces y el proceso completo entre 1,64 y 2,27 veces.
Edge gana velocidad sin sustituir el modelo principal
Para equipos que ya ejecutan LFM2.5-VL-3B, resulta atractivo que el cambio sea acotado. El drafter no sustituye al modelo ni sacrifica calidad mediante cuantización. Propone candidatos que el modelo original comprueba. La integración puede acortar descripciones de imágenes, respuestas sobre documentos o conversaciones visuales sin cambiar la lógica de la aplicación.
El beneficio aumenta cuando la respuesta contiene suficientes tokens. Una decodificación más rápida se acumula en descripciones largas o diálogos de varios turnos. En respuestas breves puede dominar el trabajo que DSpark no toca.
La codificación visual y el prefill siguen cobrando latencia
La imagen debe pasar primero por un vision encoder y después el modelo procesa cientos de tokens visuales. Speculative decoding no acelera esa fase ni el tiempo hasta el primer token. Por eso la mejor mejora end-to-end queda por debajo de la cifra principal de decode. Las pruebas publicadas usan además pesos de 16 bits, batch size 1 y seis tareas MMSpec. La aceleración de modelos cuantizados queda fuera de este lanzamiento.
Las respuestas cortas y el tráfico concurrente darán la prueba útil
El resultado dependerá del perfil real: peso de la codificación visual, longitud del prompt, longitud de la respuesta y concurrencia. Liquid AI midió ventajas también con más usuarios simultáneos, aunque la diferencia se redujo al crecer la concurrencia. Conviene medir la latencia end-to-end y el tiempo hasta el primer token, no colgar solo el 3,13 en un dashboard.
El veredicto de Lilith
DSpark sienta un pequeño apuntador junto a 3.000 millones de parámetros y el modelo principal corre más rápido. La cámara sigue procesando la imagen en la salida, así que el cronómetro debe medir toda la carrera y no solo la recta final.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗