2026-10-07 · ← News
Open d1 entscheidet am Edge in 16 ms, doch multimodale Belege fehlen noch
Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten für strukturierte Entscheidungen ohne Token-Generierung veröffentlicht. d1-3B antwortet auf Jetson AGX Thor in 16 ms, doch Vision- und Audio-Benchmarks fehlen.
Das Bild konnte nicht geladen werden.
Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten veröffentlicht. Beide liefern strukturierte Auswahlwerte, Scores oder Ja-Nein-Antworten in einem Forward Pass, statt Text-Token zu erzeugen. Auf Jetson AGX Thor beantwortete d1-3B eine Frage in 16 ms.
Zwei kleine Modelle liefern Entscheidungen statt Fließtext
d1-3B basiert auf LFM2.5-VL-3B und verarbeitet Text und Bilder. d1-omni-600M verbindet einen bidirektionalen Encoder mit 350 Millionen Parametern mit Vision- und Audio-Encodern. Es akzeptiert Text plus Bild oder Text plus Audio und wird von Liquid AI als frühes Forschungs-Release bezeichnet.
Über sieben öffentliche Datensätze zu Textverständnis, Toxizität, Intent-Klassifikation, Medical QA und mehrsprachigem Verständnis erreichte d1-3B im Mittel 82,9 und d1-omni-600M 78,4. d1-3B antwortete auf RTX 4090 in 8 ms und auf Jetson Orin Nano in 50 ms.
Klassifikation auf dem Gerät kann den generativen Umweg vermeiden
Viele Anwendungen verwenden ein generatives LLM nur, um am Ende ein Label, einen Score oder eine Ja-Nein-Antwort zu erhalten. Ein Decision Model entfernt Texterzeugung und Parsing. Das eignet sich für Routing, Filter, Moderation und Gerätesteuerung, wenn stabiles Format, Latenz und Datenschutz zählen.
Offene Gewichte erlauben zudem, Bilder und Audio von fremden APIs fernzuhalten. Entwickler müssen dafür eine andere System-One-Schnittstelle übernehmen und im veröffentlichten Beispiel modellspezifischen Code mit trust_remote_code=True laden.
Dem multimodalen Versprechen fehlt noch ein öffentlicher Benchmark
Vision und Audio am Edge sind das stärkste Produktversprechen, doch die Autoren zeigen in diesem Release keinen Vision- oder Audio-Benchmark. Decision Index v0.3 enthalte nur einen privaten Vision-Teil, während Benchmarks für Audioentscheidungen ein offenes Problem seien. Die veröffentlichte Tabelle prüft daher vor allem Textaufgaben.
Auch die Geschwindigkeitswerte gelten nur für d1-3B. Für das experimentelle d1-omni-600M nennt das Team keine. Die Qualitätsvergleiche stammen vom Modellhersteller, und ein Mittelwert über sieben Datensätze zeigt keine Kalibrierung für industrielle Prüfung oder Sicherheitsfilter.
Echte Hardware muss Qualität und Kalibrierung bestätigen
Als Nächstes braucht es unabhängige Bild- und Audiotests, Messungen von Speicher und Energie sowie Kalibrierung bei Datenverschiebungen. Auch lange Zustände zählen: Eine Eingabe mit 3.400 Token dauerte auf Jetson Orin Nano 1.640 ms und damit deutlich länger als eine kurze Frage.
Halten die kleinen d1-Modelle ihre Genauigkeit mit multimodalen Daten echter Geräte, könnten sie übergroße generative Modelle in engen Entscheidungsschleifen ersetzen. 16 ms allein entscheiden diesen Fall noch nicht.
Liliths Urteil
d1-3B erledigt eine kurze Frage in 16 ms, während Kamera und Mikrofon noch vor dem Testraum warten. Ein Edge-Modell bewährt sich im Feld und nicht auf einer leeren Geraden.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗