Lilith.
⌕
Ilustración editorial: Open d1 decide en el edge en 16 ms, pero aún faltan pruebas multimodales
Ilustración de Lilith · remezcla editorial

Liquid AI ha publicado con open weights d1-3B y el experimental d1-omni-600M. Ambos devuelven elecciones estructuradas, puntuaciones o respuestas sí o no en un solo forward pass, sin generar tokens de texto. En Jetson AGX Thor, d1-3B respondió a una pregunta en 16 ms.

Dos modelos pequeños devuelven decisiones en lugar de texto

d1-3B deriva de LFM2.5-VL-3B y acepta texto e imágenes. d1-omni-600M combina un bidirectional encoder de 350 millones de parámetros con encoders de vision y audio. Procesa texto más imagen o texto más audio, y Liquid AI lo presenta como un release de investigación temprano.

En siete datasets públicos sobre comprensión lectora, toxicidad, clasificación de intención, medical QA y comprensión multilingüe, d1-3B obtuvo una media de 82,9 y d1-omni-600M un 78,4. d1-3B respondió en 8 ms en RTX 4090 y en 50 ms en Jetson Orin Nano.

La clasificación en el dispositivo puede evitar el rodeo generativo

Muchas aplicaciones usan un LLM generativo solo para extraer al final una etiqueta, una puntuación o una respuesta binaria. Un decision model elimina la generación y el parseo de texto. Resulta útil para routing, filtros, moderación y control en el dispositivo, donde importan el formato estable, la latencia y la privacidad.

Los open weights también permiten mantener imágenes y audio fuera de una API de terceros. A cambio, el desarrollador debe adoptar la interfaz System One y, en el ejemplo publicado, cargar código específico del modelo con trust_remote_code=True.

La promesa multimodal todavía carece de un benchmark público

Vision y audio en el edge son la promesa más potente, pero los autores no publican ningún benchmark de vision o audio en este release. Explican que Decision Index v0.3 solo tiene una sección privada de vision y que los benchmarks de decisiones con audio siguen siendo un problema abierto. La tabla publicada valida principalmente tareas de texto.

Las cifras de velocidad también corresponden solo a d1-3B. El equipo no ofrece ninguna para el experimental d1-omni-600M. Las comparaciones proceden del fabricante, y una media de siete datasets no muestra la calibración de probabilidades en una inspección industrial o un filtro de seguridad.

El hardware real debe confirmar la calidad y la calibración

El siguiente paso son pruebas independientes de imagen y audio, medidas de memoria y energía y calibración bajo cambios de datos. También importa la latencia con estados largos: una entrada de 3400 tokens tardó 1640 ms en Jetson Orin Nano, mucho más que una pregunta corta.

Si los pequeños modelos d1 conservan la precisión con datos multimodales de dispositivos reales, podrían sustituir modelos generativos sobredimensionados en bucles de decisión estrechos. Un resultado de 16 ms no basta para cerrar el caso.

El veredicto de Lilith

d1-3B resuelve una pregunta corta en 16 ms, mientras la cámara y el micrófono siguen esperando fuera de la sala de pruebas. Un modelo edge se acredita en el terreno, no en una recta vacía.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗