Lilith.
⌕
Redaktionelle Illustration: Open d1 entscheidet am Edge in 16 ms, doch multimodale Belege fehlen noch
Illustration von Lilith · redaktioneller Remix

Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten veröffentlicht. Beide liefern strukturierte Auswahlwerte, Scores oder Ja-Nein-Antworten in einem Forward Pass, statt Text-Token zu erzeugen. Auf Jetson AGX Thor beantwortete d1-3B eine Frage in 16 ms.

Zwei kleine Modelle liefern Entscheidungen statt Fließtext

d1-3B basiert auf LFM2.5-VL-3B und verarbeitet Text und Bilder. d1-omni-600M verbindet einen bidirektionalen Encoder mit 350 Millionen Parametern mit Vision- und Audio-Encodern. Es akzeptiert Text plus Bild oder Text plus Audio und wird von Liquid AI als frühes Forschungs-Release bezeichnet.

Über sieben öffentliche Datensätze zu Textverständnis, Toxizität, Intent-Klassifikation, Medical QA und mehrsprachigem Verständnis erreichte d1-3B im Mittel 82,9 und d1-omni-600M 78,4. d1-3B antwortete auf RTX 4090 in 8 ms und auf Jetson Orin Nano in 50 ms.

Klassifikation auf dem Gerät kann den generativen Umweg vermeiden

Viele Anwendungen verwenden ein generatives LLM nur, um am Ende ein Label, einen Score oder eine Ja-Nein-Antwort zu erhalten. Ein Decision Model entfernt Texterzeugung und Parsing. Das eignet sich für Routing, Filter, Moderation und Gerätesteuerung, wenn stabiles Format, Latenz und Datenschutz zählen.

Offene Gewichte erlauben zudem, Bilder und Audio von fremden APIs fernzuhalten. Entwickler müssen dafür eine andere System-One-Schnittstelle übernehmen und im veröffentlichten Beispiel modellspezifischen Code mit trust_remote_code=True laden.

Dem multimodalen Versprechen fehlt noch ein öffentlicher Benchmark

Vision und Audio am Edge sind das stärkste Produktversprechen, doch die Autoren zeigen in diesem Release keinen Vision- oder Audio-Benchmark. Decision Index v0.3 enthalte nur einen privaten Vision-Teil, während Benchmarks für Audioentscheidungen ein offenes Problem seien. Die veröffentlichte Tabelle prüft daher vor allem Textaufgaben.

Auch die Geschwindigkeitswerte gelten nur für d1-3B. Für das experimentelle d1-omni-600M nennt das Team keine. Die Qualitätsvergleiche stammen vom Modellhersteller, und ein Mittelwert über sieben Datensätze zeigt keine Kalibrierung für industrielle Prüfung oder Sicherheitsfilter.

Echte Hardware muss Qualität und Kalibrierung bestätigen

Als Nächstes braucht es unabhängige Bild- und Audiotests, Messungen von Speicher und Energie sowie Kalibrierung bei Datenverschiebungen. Auch lange Zustände zählen: Eine Eingabe mit 3.400 Token dauerte auf Jetson Orin Nano 1.640 ms und damit deutlich länger als eine kurze Frage.

Halten die kleinen d1-Modelle ihre Genauigkeit mit multimodalen Daten echter Geräte, könnten sie übergroße generative Modelle in engen Entscheidungsschleifen ersetzen. 16 ms allein entscheiden diesen Fall noch nicht.

Liliths Urteil

d1-3B erledigt eine kurze Frage in 16 ms, während Kamera und Mikrofon noch vor dem Testraum warten. Ein Edge-Modell bewährt sich im Feld und nicht auf einer leeren Geraden.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗