2026-10-06 · ← News
EmbeddingGemma 2 bündelt Text, Bild, Audio und Video lokal in 768 Dimensionen
Google hat mit EmbeddingGemma 2 ein offenes Modell mit 740 Millionen Parametern veröffentlicht, das Text, Code, Bilder, Audio und Video in einen gemeinsamen Vektorraum abbildet. Für lokale Suche zählen der modulare Speicherbedarf und Apache 2.0 mehr als ein weiterer Benchmark-Sieg.
Das Bild konnte nicht geladen werden.
Google hat EmbeddingGemma 2 veröffentlicht, ein offenes Embedding-Modell mit 740 Millionen Parametern unter Apache 2.0. Es bildet Text, Code, Bilder, Audio und Video in einem gemeinsamen Raum mit 768 Dimensionen ab. Die Gewichte stehen auf Hugging Face und Kaggle bereit.
Ein Modell verarbeitet fünf Eingabetypen ohne Umweg über die Cloud
Die Architektur ist modular. Für Text und Code genügt eine Basis mit 270 Millionen Parametern, der Bild-Encoder ergänzt 170 Millionen und der Audio-Encoder 300 Millionen. Laut Google benötigen quantisierte Textgewichte auf einem Pixel 11 Pro etwa 191 MB aktiven RAM, das vollständige multimodale Modell rund 567 MB.
Das Kontextfenster umfasst 8.192 Token. Laut Dokumentation verarbeitet das Modell bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes. Matryoshka Representation Learning kürzt die Ausgabe von 768 auf 512, 256 oder 128 Dimensionen und kann den Speicherbedarf der Vektordatenbank um das Sechsfache senken.
Lokaler Retrieval erhält einen gemeinsamen Index für das ganze Gerät
Praktisch entfällt die Notwendigkeit getrennter Embedding-Pipelines für Fotos, Sprachnotizen, Dokumente und Videos. Ein Index kann eine Videostelle über Text oder Audio finden, ohne private Inhalte in die Cloud zu übertragen.
Das passt zu mobiler Suche, Offline-RAG und lokaler Code-Indexierung. Die Unterstützung von transformers, llama.cpp, Ollama, MLX und LiteRT senkt zudem die Integrationshürde. Der Vorteil bleibt nur bestehen, wenn die Qualität Quantisierung und Vektorkürzung übersteht.
Hersteller-Benchmarks sagen wenig über das eigene Archiv
Google meldet beim MTEB Code eine Steigerung von 68,76 auf 78,68 Punkte und führende Ergebnisse unter multimodalen Modellen mit weniger als einer Milliarde Parametern. Es sind Messungen des Herstellers. Eine Einführung braucht Tests mit den eigenen Daten, Sprachen, Medienarten und Zielgeräten.
Ein gemeinsamer Vektorraum garantiert außerdem nicht, dass eine Textanfrage in einer verrauschten Aufnahme die richtige Sekunde findet. Multimodaler Retrieval vereinfacht die Architektur und schafft zugleich neue Fehlerquellen für die Relevanz.
Kleine Indizes auf gewöhnlicher Hardware entscheiden
Wichtige Signale sind der Recall auf echten Archiven nach der Kürzung auf 128 Dimensionen, der Energieverbrauch und die Latenz jenseits des Pixel 11 Pro. Ebenso zählt die Qualität in mehr als 100 unterstützten Sprachen, besonders bei der Suche über verschiedene Medien hinweg.
Bleiben die Ergebnisse mit der 270-Millionen-Basis und einem kleinen lokalen Index brauchbar, ist ein Cloud-Embedding-Dienst nicht mehr automatisch Teil jeder Anwendung. Andernfalls bleibt EmbeddingGemma 2 eine eindrucksvolle Vorführung mit sorgfältig ausgewählten Daten.
Liliths Urteil
EmbeddingGemma 2 holt das Archiv zurück aufs Telefon, wo Foto, Sprachnotiz und Video in einem Index zusammentreffen. Entscheidend wird der Moment ohne Empfang, in dem die Suche trotzdem das richtige Bild findet.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗