Lilith.
⌕
編集イラスト: Open d1はedgeで16ミリ秒の判断、ただしmultimodal評価はまだない
Lilithのイラスト · 編集リミックス

Liquid AIは、open-weightのd1-3Bと実験版d1-omni-600Mを公開した。どちらもtext tokenを生成せず、1回のforward passで構造化された選択、score、yesかnoの回答を返す。Jetson AGX Thorでは、d1-3Bが1問に16ミリ秒で答えた。

二つの小型モデルは文章ではなく判断を返す

d1-3BはLFM2.5-VL-3Bを基盤とし、textとimageを入力できる。d1-omni-600Mは3億5000万parameterのbidirectional encoderにvision encoderとaudio encoderを加えた。textとimage、またはtextとaudioを扱い、Liquid AIは初期の研究releaseと位置付ける。

読解、toxicity検出、intent classification、medical QA、多言語理解を含む七つの公開datasetで、平均はd1-3Bが82.9、d1-omni-600Mが78.4だった。d1-3BはRTX 4090で8ミリ秒、Jetson Orin Nanoで50ミリ秒で1問に回答した。

端末内classificationは生成処理の遠回りを省ける

多くのapplicationは、最後にlabel、score、yesかnoを得るためだけにgenerative LLMを使っている。decision modelならtext生成とparsingを省ける。安定した形式、latency、privacyが重要なrouting、filtering、moderation、端末制御に向く。

open weightsならimageやaudioを外部APIへ送らずに済む。一方、開発者はSystem Oneという別のinterfaceを採用し、公開例ではtrust_remote_code=Trueでモデル固有codeを読み込む必要がある。

multimodalという主張には公開benchmarkがまだない

edgeでのvisionとaudioは最も強い訴求点だが、今回のreleaseにvisionやaudioのbenchmarkはない。著者によると、Decision Index v0.3のvision部分は非公開で、audio decision benchmarkは未解決の課題だ。公開表が主に確認しているのはtext taskである。

速度の数値もd1-3Bだけが対象だ。実験版d1-omni-600Mについては公表されていない。品質比較はモデル開発元によるもので、七つのdatasetの平均だけでは、工場検査や安全filterで確率が正しくcalibrationされるか分からない。

実機で品質とcalibrationの両方を確かめる必要がある

次に必要なのは、独立したvisionとaudioのtest、memoryと消費電力の測定、data shift時のprobability calibrationだ。長いstateのlatencyも重要になる。Jetson Orin Nanoでは3400 tokenの入力に1640ミリ秒かかり、短い質問より大幅に遅い。

小型d1モデルが実機由来のmultimodal dataでも精度を保てれば、狭い判断loopで過大なgenerative modelを置き換えられる。16ミリ秒という数字だけでは、まだ結論にならない。

Lilithの判定

d1-3Bは短い質問を16ミリ秒で駆け抜けたが、カメラとマイクはまだ試験室の外で待っている。edge modelの実力は空いた直線の速度ではなく、現場の結果で決まる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗