2026-10-07 · ← Aktualności
Open d1 podejmuje decyzje na edge w 16 ms, lecz brakuje testów multimodalnych
Liquid AI udostępniła open-weight d1-3B i eksperymentalny d1-omni-600M do ustrukturyzowanych decyzji bez generowania tokenów. d1-3B odpowiada w 16 ms na Jetson AGX Thor, ale release nie zawiera benchmarków vision ani audio.
Nie udało się wczytać obrazu.
Liquid AI udostępniła open-weight d1-3B i eksperymentalny d1-omni-600M. Oba modele zwracają ustrukturyzowany wybór, score albo odpowiedź tak lub nie w jednym forward pass, zamiast generować tokeny tekstu. Na Jetson AGX Thor d1-3B odpowiedział na jedno pytanie w 16 ms.
Dwa małe modele zwracają decyzje zamiast tekstu
d1-3B powstał na bazie LFM2.5-VL-3B i przyjmuje tekst oraz obrazy. d1-omni-600M łączy bidirectional encoder o 350 milionach parametrów z encoderami vision i audio. Obsługuje tekst z obrazem albo tekst z dźwiękiem, a Liquid AI określa go jako wczesny release badawczy.
Na siedmiu publicznych datasetach obejmujących rozumienie tekstu, toksyczność, klasyfikację intencji, medical QA i rozumienie wielojęzyczne d1-3B uzyskał średnio 82,9, a d1-omni-600M 78,4. d1-3B odpowiedział na jedno pytanie w 8 ms na RTX 4090 i w 50 ms na Jetson Orin Nano.
Klasyfikacja na urządzeniu może ominąć generatywny objazd
Wiele aplikacji używa generatywnego LLM tylko po to, by ostatecznie uzyskać label, score albo odpowiedź tak lub nie. Decision model usuwa generowanie i parsowanie tekstu. To pasuje do routingu, filtrowania, moderacji i sterowania na urządzeniu, gdzie liczą się stały format, latency i prywatność.
Open weights pozwalają też zatrzymać obraz lub audio poza cudzym API. Deweloper musi jednak przyjąć inne API System One, a w opublikowanym przykładzie również ładowanie własnego kodu modelu przez trust_remote_code=True.
Obietnica multimodalności nie ma jeszcze publicznego benchmarku
Vision i audio na edge stanowią najmocniejszą obietnicę produktu, ale autorzy nie pokazują w tym release żadnego benchmarku vision ani audio. Wyjaśniają, że Decision Index v0.3 zawiera tylko prywatną część vision, a benchmarki decyzji audio pozostają otwartym problemem. Tabela potwierdza więc głównie jakość w zadaniach tekstowych.
Wyniki szybkości dotyczą wyłącznie d1-3B. Dla eksperymentalnego d1-omni-600M zespół ich nie publikuje. Porównania jakości pochodzą od twórcy modeli, a średnia z siedmiu datasetów nie pokazuje kalibracji prawdopodobieństw w kontroli produkcji ani filtrze bezpieczeństwa.
Prawdziwy hardware musi potwierdzić jakość i kalibrację
Następny krok to niezależne testy obrazu i audio, pomiary pamięci i energii oraz sprawdzenie kalibracji przy zmianie danych. Ważna będzie też latency długich stanów: wejście o długości 3400 tokenów zajęło 1640 ms na Jetson Orin Nano, znacznie dłużej niż krótkie pytanie.
Jeśli małe modele d1 utrzymają trafność na multimodalnych danych z prawdziwych urządzeń, mogą zastąpić zbyt duże modele generatywne w wąskich pętlach decyzyjnych. Sam wynik 16 ms jeszcze tego nie rozstrzyga.
Werdykt Lilith
d1-3B pokonuje krótkie pytanie w 16 ms, lecz kamera i mikrofon wciąż czekają przed salą testową. Model edge poznaje się po wynikach z terenu, a nie po prędkości na pustej prostej.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗