Lilith.
⌕
Ilustracja redakcyjna: EmbeddingGemma 2 łączy tekst, obraz, dźwięk i wideo w 768 wymiarach na urządzeniu
Ilustracja Lilith · remiks redakcyjny

Google udostępnił EmbeddingGemma 2, otwarty model embeddingowy z 740 milionami parametrów na licencji Apache 2.0. Model umieszcza tekst, kod, obrazy, dźwięk i wideo we wspólnej przestrzeni o 768 wymiarach. Wagi są dostępne na Hugging Face i Kaggle.

Jeden model obsługuje pięć typów danych bez pośrednictwa chmury

Architektura jest modułowa. Do tekstu i kodu wystarcza baza z 270 milionami parametrów, encoder obrazu dodaje 170 milionów, a encoder dźwięku 300 milionów. Według Google skwantyzowane wagi tekstowe zajmują na Pixelu 11 Pro około 191 MB aktywnej pamięci RAM, a pełny model multimodalny około 567 MB.

Kontekst ma 8 192 tokeny. Dokumentacja podaje, że model przetwarza do 5,5 minuty dźwięku, 29 obrazów albo 58 klatek wideo. Matryoshka Representation Learning pozwala skrócić wektor z 768 do 512, 256 lub 128 wymiarów, co może nawet sześciokrotnie zmniejszyć rozmiar bazy wektorowej.

Lokalny retrieval zyskuje wspólny indeks dla całego urządzenia

Najważniejsza zmiana praktyczna polega na tym, że aplikacja nie potrzebuje osobnych pipeline dla zdjęć, notatek głosowych, dokumentów i wideo. Jeden indeks może znaleźć fragment filmu na podstawie tekstu lub dźwięku, bez wysyłania prywatnych materiałów do chmury.

To pasuje do mobilnego wyszukiwania, offline RAG i indeksowania lokalnego repozytorium kodu. Obsługa transformers, llama.cpp, Ollama, MLX i LiteRT ułatwia integrację. Korzyść utrzyma się jednak tylko wtedy, gdy jakość pozostanie wystarczająca po kwantyzacji i skróceniu wektorów.

Benchmark producenta nie przewidzi zachowania na twoim archiwum

Google podaje wzrost MTEB Code z 68,76 do 78,68 punktu oraz czołowe wyniki wśród modeli multimodalnych poniżej miliarda parametrów. To nadal pomiary producenta. Decyzja o wdrożeniu wymaga testów na własnych danych, językach, rodzajach mediów oraz docelowym telefonie lub laptopie.

Wspólna przestrzeń wektorowa nie gwarantuje też, że zapytanie tekstowe znajdzie właściwą sekundę w zaszumionym nagraniu. Multimodalny retrieval upraszcza pipeline, ale dodaje nowe miejsca, w których trafność może zawieść.

Wynik rozstrzygną małe indeksy i zwykły sprzęt

Warto obserwować recall na prawdziwych archiwach po skróceniu do 128 wymiarów, zużycie energii oraz opóźnienia poza Pixelem 11 Pro. Liczy się również jakość w ponad 100 obsługiwanych językach, zwłaszcza przy wyszukiwaniu między różnymi mediami.

Jeśli przy bazie 270 milionów parametrów i małym lokalnym indeksie wyniki pozostaną użyteczne, chmurowa usługa embeddingowa przestanie być obowiązkowym elementem każdej aplikacji. W przeciwnym razie EmbeddingGemma 2 pozostanie efektownym pokazem na starannie dobranych danych.

Werdykt Lilith

EmbeddingGemma 2 przenosi archiwum z powrotem do telefonu, gdzie zdjęcie, notatka głosowa i film spotykają się w jednym indeksie. Test nadejdzie po utracie zasięgu, gdy wyszukiwarka nadal ma trafić we właściwą klatkę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗