Lilith.
⌕
Redakční ilustrace: Open d1 rozhoduje na edge za 16 ms, ale multimodální důkaz zatím chybí
Ilustrace Lilith · redakční remix

Liquid AI zveřejnila open-weight modely d1-3B a experimentální d1-omni-600M. Oba mají vracet strukturované volby, skóre nebo odpovědi v jednom forward passu místo generování textových tokenů. Na Jetson AGX Thor zvládl d1-3B jednu otázku za 16 ms.

Dva malé modely vracejí rozhodnutí místo textu

d1-3B vychází z LFM2.5-VL-3B a přijímá text i obraz. d1-omni-600M kombinuje 350milionový bidirectional encoder s vision a audio encodery. Umí pracovat s dvojicí text plus obraz nebo text plus audio a Liquid AI jej označuje za raný výzkumný release.

Na sedmi veřejných datasetech pro porozumění textu, detekci toxicity, klasifikaci záměru, medical QA a vícejazyčné porozumění dosáhl d1-3B průměru 82,9. d1-omni-600M získal 78,4. Na RTX 4090 odpověděl d1-3B na jednu otázku za 8 ms, na Jetson Orin Nano za 50 ms.

Klasifikace na zařízení může obejít generativní okliku

Řada aplikací používá generativní LLM jen proto, aby z něj nakonec vytáhla label, skóre nebo ano či ne. Decision model odstraňuje generování a parsování textu. To je zajímavé pro routing, filtrování, moderaci a řízení na zařízení, kde záleží na stabilním formátu, latenci a soukromí.

Open weights navíc dovolují spustit model bez odesílání obrazu či zvuku do cizího API. Vývojář ale musí přijmout odlišné rozhraní System One a konkrétně u zveřejněného příkladu také načítání vlastního kódu modelu přes trust_remote_code=True.

Multimodální slib zatím stojí bez veřejného benchmarku

Nejsilnější produktová pointa jsou obraz a audio na edge, jenže autoři pro tento release neuvádějí žádný vision ani audio benchmark. Píšou, že Decision Index v0.3 má pouze neveřejnou vision část a audio rozhodovací benchmarky zůstávají otevřeným problémem. Zveřejněná tabulka proto ověřuje hlavně textové úlohy.

Také rychlostní čísla patří pouze d1-3B. U experimentálního d1-omni-600M je tým nezveřejnil. Srovnání kvality pochází od autora modelů a průměr ze sedmi datasetů neříká, jak se budou pravděpodobnosti kalibrovat v konkrétní výrobní kontrole nebo bezpečnostním filtru.

Reálný hardware musí potvrdit kvalitu i kalibraci

Dalším krokem jsou nezávislé testy obrazu a audia, měření spotřeby paměti a energie a kalibrace pravděpodobností při změně dat. Pro nasazení bude důležitá také rychlost delších stavů: na Jetson Orin Nano trval vstup o 3 400 tokenech 1 640 ms, výrazně déle než krátká otázka.

Pokud malé d1 modely udrží přesnost i na multimodálních datech z reálných zařízení, mohou nahradit zbytečně velké generativní modely v úzkých rozhodovacích smyčkách. Samotných 16 ms tento případ ještě neuzavírá.

Lilithin verdikt

d1-3B proběhne krátkou otázkou za 16 ms, ale kamera a mikrofon zatím stojí před zavřenou zkušebnou. Edge model se pozná podle výsledků z terénu, ne podle rychlosti na prázdné rovince.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗