Lilith.
⌕
Redakční ilustrace: EmbeddingGemma 2 skládá text, obraz, zvuk a video do 768 rozměrů přímo v zařízení
Ilustrace Lilith · redakční remix

Google vydal EmbeddingGemma 2, otevřený embedding model se 740 miliony parametrů a licencí Apache 2.0. Text, kód, obraz, zvuk a video převádí do společného prostoru o 768 rozměrech. Váhy jsou dostupné na Hugging Face a Kaggle.

Jeden model obslouží pět typů vstupu bez cloudového mezikroku

Architektura je modulární. Pro samotný text a kód stačí základ se 270 miliony parametrů, obrazový encoder přidává 170 milionů a zvukový 300 milionů. Google uvádí, že kvantizované textové váhy na Pixelu 11 Pro zabírají přibližně 191 MB aktivní RAM, celý multimodální model asi 567 MB.

Kontext má 8 192 tokenů. Model podle dokumentace zpracuje až 5,5 minuty zvuku, 29 obrázků nebo 58 snímků videa. Výstup lze pomocí Matryoshka Representation Learning zkrátit ze 768 na 512, 256 nebo 128 rozměrů, což může snížit velikost vektorové databáze až šestkrát.

Lokální retrieval dostává společný index pro celé zařízení

Praktická změna spočívá v tom, že aplikace nemusí pro fotky, hlasové poznámky, dokumenty a video provozovat oddělené embedding pipeline. Jeden index může najít úsek videa podle textu nebo zvukového dotazu a fungovat bez odesílání soukromých dat do cloudu.

To se hodí pro mobilní vyhledávání, offline RAG a indexování lokální codebase. Podpora nástrojů jako transformers, llama.cpp, Ollama, MLX a LiteRT zároveň snižuje integrační tření. Skutečná výhoda ale vznikne jen tehdy, když kvalita zůstane přijatelná i po kvantizaci a zkrácení vektorů.

Firemní benchmarky neukazují chování na vašem archivu

Google hlásí zlepšení MTEB Code z 68,76 na 78,68 bodu a vedoucí výsledky mezi multimodálními modely pod jednu miliardu parametrů. Jde však o měření vydavatele. Rozhodnutí o nasazení musí stát na vlastních datech, jazycích, typech médií a na latenci cílového telefonu či notebooku.

Ani společný vektorový prostor nezaručuje, že textový dotaz spolehlivě najde správnou sekundu v hlučné nahrávce. Multimodální retrieval přidává pohodlí, ale také další místa, kde se relevance může rozpadnout.

O úspěchu rozhodnou malé indexy a obyčejný hardware

Sledovat je potřeba recall na reálných archivech po zkrácení na 128 rozměrů, spotřebu energie a latenci mimo Pixel 11 Pro. Důležitá bude také kvalita ve více než 100 podporovaných jazycích, zejména při hledání napříč různými médii.

Pokud vývojáři udrží použitelné výsledky při 270 milionech parametrů a malém lokálním indexu, cloudová embedding služba přestane být automatickou součástí každé aplikace. Pokud ne, EmbeddingGemma 2 zůstane působivým demem na pečlivě vybraných datech.

Lilithin verdikt

EmbeddingGemma 2 posílá archiv zpátky do telefonu: fotka, hlasová poznámka i video se potkají v jednom indexu. Rozhodne chvíle, kdy uživatel vypne signál a vyhledávání přesto trefí správný záběr.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗