El nuevo EmbeddingGemma 2 de Google integra búsqueda de texto, imágenes, audio y vídeo en el teléfono
El modelo abierto de 740 millones de parámetros de Google DeepMind se ejecuta sin conexión, consumiendo menos de 600MB de RAM en un Pixel 11 Pro.

Puntos clave
- Google DeepMind lanzó EmbeddingGemma 2 bajo licencia Apache 2.0, lo que significa que cualquier desarrollador puede utilizarlo comercialmente sin pagar a Google.
- El modelo tiene 740 millones de parámetros y maneja texto, código, imágenes, vídeo y audio en un espacio compartido de 768 dimensiones.
- En un Google Pixel 11 Pro, el modelo multimodal completo utiliza aproximadamente 567MB de RAM activa; la versión de solo texto utiliza aproximadamente 191MB.
- La ventana de contexto es de 8.000 tokens, cuatro veces mayor que la del primer EmbeddingGemma, suficiente para aproximadamente 5,5 minutos de audio o 29 imágenes a la vez.
- Google afirma que la calidad de búsqueda de código salta 9,92 puntos en el benchmark MTEB Code, de 68,76 a 78,68, frente a la versión anterior.
Los modelos de incrustación son la infraestructura silenciosa de la IA moderna. Convierten una frase, una foto o un fragmento de audio en una larga lista de números, y los archivos con significados similares terminan con números similares. Así es como tu teléfono puede encontrar "el vídeo de la playa de Lisboa" sin que lo hayas etiquetado.
Hasta ahora, los útiles se ejecutaban principalmente en un centro de datos. EmbeddingGemma 2, lanzado esta semana por Google DeepMind, está diseñado para ejecutarse en el dispositivo que llevas en el bolsillo.
¿Qué hay realmente nuevo aquí?
El primer EmbeddingGemma, lanzado el año pasado, solo manejaba texto. La versión dos también procesa código, imágenes, vídeo y audio, y los mapea en el mismo espacio matemático para que una nota de voz pueda recuperar un videoclip y una consulta de texto pueda extraer un archivo de audio.
El modelo es modular. Un núcleo de texto de 270 millones de parámetros realiza lo básico. Los desarrolladores pueden añadir un codificador de visión de 170 millones de parámetros, una sección especializada que maneja imágenes, o un codificador de audio de 300 millones de parámetros si necesitan esos modos. Así es como el modelo completo se mantiene en 740 millones de parámetros, lo suficientemente pequeño para vivir en un portátil o en un teléfono de gama alta.
Google ha publicado los pesos en Hugging Face y Kaggle bajo Apache 2.0, la misma licencia permisiva que el lanzamiento anterior. La empresa afirma que el primer EmbeddingGemma ha sido descargado más de 20 millones de veces.
¿Por qué a alguien le importaría la ejecución en dispositivo?
Porque tus archivos nunca salen del teléfono. Una incrustación generada localmente no necesita ser enviada a un servidor en la nube para ser útil, lo que importa para notas médicas, fotos privadas o el código interno de una empresa.
También es más rápido. No hay viajes de red, por lo que una búsqueda se siente instantánea. Y funciona en un avión.
El argumento aquí es la generación aumentada por recuperación, o RAG, el truco en el que un asistente de IA busca documentos relevantes antes de responder para no tener que memorizarlo todo. Empareja EmbeddingGemma 2 con un modelo generativo pequeño como Gemma 4, y tendrás un asistente privado que puede razonar sobre tus propios archivos sin nunca conectarse a internet.
¿Cómo se compara?
Google afirma tener puntuaciones de clase mundial entre los modelos de incrustación multimodal con menos de mil millones de parámetros, en benchmarks incluyendo MTEB Code y el Massive Audio Embedding Benchmark. La cifra destacada es el aumento de búsqueda de código de casi diez puntos.
| Especificación | EmbeddingGemma 2 |
|---|---|
| Parámetros totales | 740M |
| RAM solo texto (Pixel 11 Pro) | ~191MB |
| RAM multimodal completa | ~567MB |
| Ventana de contexto | 8.000 tokens |
| Idiomas admitidos | 100+ |
| Licencia | Apache 2.0 |
Un truco genuinamente útil: Matryoshka Representation Learning, un método de entrenamiento que permite a los desarrolladores reducir el vector de salida de 768 números a 512, 256 o 128 y aún así obtener resultados decentes. Esto reduce el almacenamiento de una base de datos de vectores local hasta seis veces, lo que importa cuando la base de datos vive en un teléfono con almacenamiento limitado.
Dónde encaja esto en el impulso más amplio de Google
Google ha estado lanzando variantes de Gemma a buen ritmo. AI2Day cubrió el modelo Gemini de frontera que escribe un millón de tokens sin parar a finales de septiembre, y el argumento más amplio del jefe de IA de Google de que los verdaderos avances ahora se encuentran donde la IA se encuentra con la biología, la energía y la manufactura. Este lanzamiento es el extremo opuesto de ese espectro: no es un modelo de frontera, sino uno de utilidad.
Mi análisis, habiendo observado estos lanzamientos más pequeños de Gemma durante todo el año: la pregunta interesante no es la puntuación del benchmark. Es si los desarrolladores de aplicaciones realmente implementan características RAG en dispositivo que los consumidores noten, o si esto permanece como una herramienta para aficionados. El primer EmbeddingGemma obtuvo las descargas. Las aplicaciones construidas sobre él han sido más silenciosas.



