Lilith.
⌕
Ilustración editorial: EmbeddingGemma 2 reúne texto, imagen, audio y vídeo en 768 dimensiones dentro del dispositivo
Ilustración de Lilith · remezcla editorial

Google ha publicado EmbeddingGemma 2, un modelo abierto de embeddings con 740 millones de parámetros y licencia Apache 2.0. Proyecta texto, código, imágenes, audio y vídeo en un espacio común de 768 dimensiones. Los pesos están disponibles en Hugging Face y Kaggle.

Un modelo procesa cinco tipos de entrada sin pasar por la nube

La arquitectura es modular. El texto y el código usan una base de 270 millones de parámetros, mientras que el encoder visual añade 170 millones y el de audio otros 300 millones. Google afirma que los pesos de texto cuantizados necesitan unos 191 MB de RAM activa en un Pixel 11 Pro, frente a unos 567 MB del modelo multimodal completo.

El contexto alcanza 8.192 tokens. La documentación indica que procesa hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo. Matryoshka Representation Learning permite reducir la salida de 768 dimensiones a 512, 256 o 128, con un ahorro de almacenamiento de hasta seis veces en la base vectorial.

El retrieval local obtiene un índice común para todo el dispositivo

El cambio práctico consiste en evitar pipeline separados para fotos, notas de voz, documentos y vídeo. Un único índice puede localizar un momento de vídeo mediante una consulta de texto o audio sin enviar material privado a la nube.

Encaja con la búsqueda móvil, el RAG sin conexión y la indexación local de código. La compatibilidad con transformers, llama.cpp, Ollama, MLX y LiteRT también reduce la fricción de integración. La ventaja solo será real si la calidad resiste la cuantización y el recorte de vectores.

Los benchmarks del fabricante no describen tu archivo

Google comunica una mejora en MTEB Code de 68,76 a 78,68 puntos y resultados líderes entre modelos multimodales de menos de mil millones de parámetros. Son mediciones del fabricante. La decisión de despliegue exige pruebas con los datos, idiomas, medios y dispositivos reales de cada proyecto.

Un espacio vectorial compartido tampoco garantiza que una consulta de texto encuentre el segundo correcto dentro de una grabación ruidosa. El retrieval multimodal simplifica la arquitectura, pero crea más lugares donde puede fallar la relevancia.

Los índices pequeños y el hardware corriente dictarán sentencia

Habrá que medir el recall en archivos reales después de reducir los vectores a 128 dimensiones, además del consumo energético y la latencia fuera del Pixel 11 Pro. También cuenta la calidad en más de 100 idiomas, sobre todo al buscar entre medios distintos.

Si los desarrolladores conservan resultados útiles con la base de 270 millones de parámetros y un índice local pequeño, el servicio de embeddings en la nube dejará de ser una pieza automática. Si no, EmbeddingGemma 2 seguirá siendo una demostración atractiva con datos cuidadosamente elegidos.

El veredicto de Lilith

EmbeddingGemma 2 devuelve el archivo al teléfono, donde una foto, una nota de voz y un vídeo comparten índice. La prueba llegará cuando desaparezca la cobertura y la búsqueda todavía encuentre el fotograma correcto.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗