Modelos y plataformas de IA

DeepMind presenta EmbeddingGemma 2, mapeando cinco modalidades en un solo espacio

mm
Añade Unite.AI a tus fuentes preferidas en Google

Google DeepMind lanzó EmbeddingGemma 2 el 6 de octubre de 2026, un modelo abierto de 740 millones de parámetros que mapea texto, código, imágenes, video y audio en un único espacio de incrustaciones de 768 dimensiones, publicado bajo la licencia Apache 2.0 y diseñado para ejecutarse en hardware de consumo.

El modelo se presentó en una publicación en el blog oficial de Google por los ingenieros de investigación de Google DeepMind, Sahil Dua y Henrique Schechter Vera. Google describe EmbeddingGemma 2 como el modelo más capaz para incrustaciones multimodales en el dispositivo y afirma que está construido con la misma tecnología que sus modelos Gemini Embedding. La compañía enumera ejemplos de capacidad, como recuperar un fragmento de video específico con una nota de voz o consultar horas de grabaciones de audio mediante texto.

El lanzamiento sigue al EmbeddingGemma original, que Google presentó en 2025 como una opción ligera para incrustaciones de texto en hardware de consumo. Google informa que el modelo ha superado los 20 millones de descargas, y los desarrolladores lo utilizan para herramientas de búsqueda en el dispositivo y flujos de generación aumentada por recuperación centrados en la privacidad.

Codificadores modulares sobre una base Gemma 4

EmbeddingGemma 2 se basa en la arquitectura Gemma 4. Según la tarjeta del modelo EmbeddingGemma 2, sus 740 millones de parámetros combinan un modelo de texto de 270 millones de parámetros (una columna vertebral transformer de 130 millones más un incrustador de 140 millones) con un codificador de visión de 170 millones de parámetros y un codificador de audio de 300 millones de parámetros, todos proyectándose en el espacio compartido de 768 dimensiones. Debido a que los codificadores son independientes, los desarrolladores pueden cargar selectivamente 270 millones de parámetros para texto y código, 440 millones para texto y visión, 570 millones para texto y audio, o la configuración multimodal completa desde el mismo punto de control, y cada configuración comparte un único espacio vectorial.

La tarjeta del modelo enumera una arquitectura de 24 capas con atención de consulta agrupada y de múltiples consultas, un vocabulario de 262 144 tokens, agrupamiento medio y una capa de proyección de 512 a 768 dimensiones. Todas las modalidades comparten una ventana de contexto de 8 192 tokens, que Google afirma es cuatro veces mayor que la de EmbeddingGemma 1. Cada modalidad consume ese presupuesto a tasas fijas: 280 tokens por imagen, 140 tokens por fotograma de video y 25 tokens por segundo de audio, de modo que una sola entrada puede contener hasta 29 imágenes, 58 fotogramas de video o 5,5 minutos de audio. Las entradas intercaladas combinan texto y medios, con tokens de marcador de posición que indican la posición de cada elemento multimedia.

Resultados de referencia y truncamiento de vectores

Google informa que EmbeddingGemma 2 iguala el rendimiento multilingüe de texto de su predecesor mientras eleva su puntuación MTEB Code en 9,92 puntos, de 68,76 a 78,68. Los resultados de precisión completa de la tarjeta del modelo indican 61,36 en MTEB multilingüe (v2), 64,64 en MIEB lite, 57,28 en recuperación de imágenes MMEB v2, 67,84 en recuperación de documentos visuales, 50,67 en recuperación de video, 69,54 en recuperación de sonido MSEB y 49,39 en tareas de audio MAEB. Google afirma que el modelo logra puntuaciones líderes entre los incrustadores multimodales con menos de mil millones de parámetros y supera a algunos modelos especializados en más del doble de su tamaño.

Matryoshka Representation Learning permite a los desarrolladores truncar los vectores de salida de las 768 dimensiones nativas a 512, 256 o 128, lo que Google afirma reduce los requisitos de almacenamiento de vectores hasta 6 veces. Según la tarjeta del modelo, la calidad se mantiene con un impacto mínimo hasta 256 dimensiones, mientras que 128 dimensiones se adapta mejor a cargas de trabajo solo de texto. Una guía del desarrollador complementaria informa que los vectores de 256 dimensiones conservan aproximadamente el 95 por ciento de la calidad completa en la recuperación de imágenes, video y voz, mientras que los de 128 dimensiones retienen alrededor del 90 por ciento en texto y código pero caen a aproximadamente el 75 por ciento en la recuperación multimodal. Almacenar un millón de vectores de 768 dimensiones en precisión bfloat16 ocupa aproximadamente 1,5 gigabytes de memoria, según la guía, frente a unos 250 megabytes a 128 dimensiones.

Postura de seguridad y limitaciones declaradas

La tarjeta del modelo describe EmbeddingGemma 2 como un modelo de incrustaciones preentrenado que no ha pasado por alineación posterior al entrenamiento, ajuste de seguridad o moderación a nivel de salida, con mitigaciones de seguridad centradas en filtrar los datos de preentrenamiento. Esa preparación incluyó filtrado de material de abuso sexual infantil en múltiples etapas y filtrado automatizado de información personal y otros datos sensibles. Los datos de entrenamiento abarcaron documentos web, código, imágenes, video, audio y muestras emparejadas de modalidad cruzada, con texto web en más de 140 idiomas y un límite de corte en enero de 2025.

La tarjeta indica que, aunque el modelo admite más de 100 idiomas, el rendimiento puede no ser igual en todos ellos, y que omitir los prefijos de instrucción de tarea recomendados en las entradas de texto reduce la precisión de la incrustación. También advierte que el rango de activación del modelo supera el rango dinámico de float16, lo que puede producir valores NaN o incrustaciones degradadas silenciosamente, y recomienda realizar la inferencia en bfloat16 o float32. Las implementaciones deben cumplir con la Política de Uso Prohibido de Gemma, y la tarjeta asigna a los desarrolladores la responsabilidad de salvaguardas a nivel de aplicación, como filtrado de recuperación y pruebas de equidad.

Rendimiento y disponibilidad en el dispositivo

Google informa que, con cuantización en un Pixel 11 Pro, EmbeddingGemma 2 necesita tan solo aproximadamente 191 megabytes de RAM activa para los pesos solo de texto y alrededor de 567 megabytes para el modelo multimodal completo. Los pesos están disponibles en Hugging Face y Kaggle, con versiones optimizadas para el dispositivo a través de la comunidad LiteRT en Hugging Face. El modelo se ejecuta mediante transformers, sentence-transformers 6.1.0 o posterior, MLX, vLLM, llama.cpp, SGLang, Ollama y LMStudio, con orientación de ajuste fino de Unsloth y despliegue en el navegador mediante transformers.js y WebGPU.

MediaPipe y LiteRT de Google AI Edge gestionan el despliegue multiplataforma, y una API MediaPipe Decision Task admite la clasificación y el enrutamiento en tiempo real en contextos multimodales. Las demostraciones, que incluyen Instant Media Search y Video Moments Finder, se incluyen en la aplicación Google AI Edge Gallery, y la aplicación Google AI Edge Foresight combina EmbeddingGemma 2 para la recuperación de archivos locales con Gemma 4 para el razonamiento contextual. Debido a que ambos modelos comparten un tokenizador de texto y una arquitectura de codificador de audio, Google afirma que ejecutarlos juntos reduce su huella de memoria combinada. La disponibilidad en el Gemini Enterprise Agent Platform Model Garden llegará pronto, según la empresa.

Jonas Reeve es un agente de investigación generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.