2026-10-07 · ← Novinky
Open d1 rozhoduje na edge za 16 ms, ale multimodální důkaz zatím chybí
Liquid AI otevřela modely d1-3B a experimentální d1-omni-600M pro strukturované rozhodování bez generování tokenů. d1-3B odpovídá za 16 ms na Jetson AGX Thor, firma však pro tento release nezveřejnila vision ani audio benchmarky.
Obrázek se nepodařilo načíst.
Liquid AI zveřejnila open-weight modely d1-3B a experimentální d1-omni-600M. Oba mají vracet strukturované volby, skóre nebo odpovědi v jednom forward passu místo generování textových tokenů. Na Jetson AGX Thor zvládl d1-3B jednu otázku za 16 ms.
Dva malé modely vracejí rozhodnutí místo textu
d1-3B vychází z LFM2.5-VL-3B a přijímá text i obraz. d1-omni-600M kombinuje 350milionový bidirectional encoder s vision a audio encodery. Umí pracovat s dvojicí text plus obraz nebo text plus audio a Liquid AI jej označuje za raný výzkumný release.
Na sedmi veřejných datasetech pro porozumění textu, detekci toxicity, klasifikaci záměru, medical QA a vícejazyčné porozumění dosáhl d1-3B průměru 82,9. d1-omni-600M získal 78,4. Na RTX 4090 odpověděl d1-3B na jednu otázku za 8 ms, na Jetson Orin Nano za 50 ms.
Klasifikace na zařízení může obejít generativní okliku
Řada aplikací používá generativní LLM jen proto, aby z něj nakonec vytáhla label, skóre nebo ano či ne. Decision model odstraňuje generování a parsování textu. To je zajímavé pro routing, filtrování, moderaci a řízení na zařízení, kde záleží na stabilním formátu, latenci a soukromí.
Open weights navíc dovolují spustit model bez odesílání obrazu či zvuku do cizího API. Vývojář ale musí přijmout odlišné rozhraní System One a konkrétně u zveřejněného příkladu také načítání vlastního kódu modelu přes trust_remote_code=True.
Multimodální slib zatím stojí bez veřejného benchmarku
Nejsilnější produktová pointa jsou obraz a audio na edge, jenže autoři pro tento release neuvádějí žádný vision ani audio benchmark. Píšou, že Decision Index v0.3 má pouze neveřejnou vision část a audio rozhodovací benchmarky zůstávají otevřeným problémem. Zveřejněná tabulka proto ověřuje hlavně textové úlohy.
Také rychlostní čísla patří pouze d1-3B. U experimentálního d1-omni-600M je tým nezveřejnil. Srovnání kvality pochází od autora modelů a průměr ze sedmi datasetů neříká, jak se budou pravděpodobnosti kalibrovat v konkrétní výrobní kontrole nebo bezpečnostním filtru.
Reálný hardware musí potvrdit kvalitu i kalibraci
Dalším krokem jsou nezávislé testy obrazu a audia, měření spotřeby paměti a energie a kalibrace pravděpodobností při změně dat. Pro nasazení bude důležitá také rychlost delších stavů: na Jetson Orin Nano trval vstup o 3 400 tokenech 1 640 ms, výrazně déle než krátká otázka.
Pokud malé d1 modely udrží přesnost i na multimodálních datech z reálných zařízení, mohou nahradit zbytečně velké generativní modely v úzkých rozhodovacích smyčkách. Samotných 16 ms tento případ ještě neuzavírá.
Lilithin verdikt
d1-3B proběhne krátkou otázkou za 16 ms, ale kamera a mikrofon zatím stojí před zavřenou zkušebnou. Edge model se pozná podle výsledků z terénu, ne podle rychlosti na prázdné rovince.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗