2026-08-20 · ← ニュース
Liquid AIがLFM2.5用DSparkモデルでローカルエージェントを高速化
ローカル推論は、生の計算能力よりも重みの転送時のメモリ帯域幅によってボトルネックになることが多くあります。投機的デコーディングは、ターゲットモデルが1回のパスでトークンを検証する間に、ドラフトモデルがトークンを提案することでこの問題を回避します。Liquid AIは今回、LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けのDSparkモデルをリリースしました。
並行ドラフト作成により不要な分岐を早期に剪定
DSparkは、並列の隠れ状態生成と、マルコフ連鎖に基づく軽量のシーケンシャルヘッドを組み合わせています。ベリファイアは、提案されたトークンがチェックを通過する確率を推定し、検証コストが節約分を上回る場合は、確信度の低いブロック末尾を早期に破棄します。ドラフトモデルは約3億のパラメータを持っています。貪欲なデコーディングでは、結果のシーケンスはターゲットモデル単独の出力と同一のままです。
M4 Maxでツール呼び出しのレイテンシが57%削減
この実用的な効果は、ユーザーのコンピュータで直接実行されるエージェントにとって大きな意味を持ちます。DSparkは、LFM2.5-2.6Bのマルチツールシナリオにおいて、レイテンシを平均57%削減しました。M4 Max搭載MacBook Proでは、平均スループットが毎秒61トークンから139トークンに向上しました。1.2Bモデルは毎秒平均350トークンに達しました。
リリース時点からllama.cppとSGLangをサポート
DSparkモデルはllama.cppとSGLangをサポートした状態でリリースされたため、人気のある推論エンジンへの統合を待つ必要はありません。チェックポイントはSafetensorsおよびGGUF形式で利用可能です。いずれかのエンジンで実行するには、関連するDSparkサポートを備えたビルドが必要です。
Metalがエキスパートモデルのパフォーマンスを制限
結果はすべてのアーキテクチャで均一ではありません。LFM2.5-8B-A1Bはドラフトの承認率が高いにもかかわらず、M4 Maxでの速度向上は平均18%にとどまりました。Liquid AIは、このギャップの原因をllama.cppのMetalバックエンドにおける現在のMoE実装と、より多くのエキスパートのアクティブ化によって引き起こされる余分な重みトラフィックにあるとしています。したがって、さらなるパフォーマンス向上はランタイムの最適化にも依存します。
Lilithの判定
モデルがノートPC上で直接毎秒130トークン以上を生成するようになると、本格的なエージェントにはクラウドAPIが必要であるという主張は崩れ始めます。これは、待ち時間なしでローカルのツールを使用するためのインフラストラクチャです。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗