EmbeddingGemma 2: Modelo abierto de incrustación multimodal
Google DeepMind lanzó EmbeddingGemma 2, un modelo abierto de 740 M de parámetros que incrusta texto, código, imágenes, video y audio en el dispositivo.
Publicación de la fuente original: 6 de octubre de 2026
EmbeddingGemma 2 es el último modelo abierto de Google DeepMind, construido sobre la arquitectura Gemma 4 y lanzado bajo una licencia Apache 2.0. Con 740 millones de parámetros, soporta incrustaciones multimodales nativas para texto, código, imágenes, video y audio, y se presenta como una opción ligera para inferencia en el dispositivo.
El modelo alcanza puntuaciones líderes entre los incrustadores multimodales de menos de 1 B en benchmarks como MTEB Code y MAEB, y iguala o supera a modelos más grandes en tareas de texto, visión y audio. Es modular: las cargas de trabajo solo de texto pueden ejecutarse con tan solo 270 M de parámetros, mientras que los codificadores opcionales de visión (170 M) y audio (300 M) habilitan soporte multimodal completo. Matryoshka Representation Learning permite a los desarrolladores truncar vectores de 768 a 128 dimensiones, ofreciendo hasta una reducción de almacenamiento de 6×. La inferencia cuantizada en un Google Pixel 11 Pro usa aproximadamente 191 MB de RAM para solo texto y 567 MB para el modelo completo, y una ventana de 8 K tokens permite procesar hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de video.
EmbeddingGemma 2 está pensado para búsqueda semántica, enrutamiento y recuperación en el dispositivo, preservando la privacidad de los datos y reduciendo la latencia. Puede combinarse con Gemma 4 para canalizaciones de generación aumentada por recuperación en el dispositivo. Los pesos del modelo están disponibles en Hugging Face y Kaggle, con opciones de despliegue a través de Google AI Edge MediaPipe, LiteRT, transformers.js, WebGPU y diversas bibliotecas de servicio.