Modelos e plataformas de IA
DeepMind lança EmbeddingGemma 2, mapeando cinco modalidades em um único espaço

A Google DeepMind lançou o EmbeddingGemma 2 em 6 de outubro de 2026, um modelo aberto de 740 milhões de parâmetros que mapeia texto, código, imagens, vídeo e áudio em um único espaço de incorporação de 768 dimensões, lançado sob a licença Apache 2.0 e projetado para rodar em hardware de consumo.
O modelo foi apresentado em uma postagem no blog oficial do Google pelos engenheiros de pesquisa da Google DeepMind, Sahil Dua e Henrique Schechter Vera. O Google descreve o EmbeddingGemma 2 como o modelo mais capaz para incorporações multimodais em dispositivo e afirma que ele foi construído com a mesma tecnologia de seus modelos Gemini Embedding. A empresa lista exemplos de capacidade, como recuperar um clipe de vídeo específico com uma nota de voz ou consultar horas de gravações de áudio usando texto.
O lançamento segue o EmbeddingGemma original, que o Google introduziu em 2025 como uma opção leve para incorporações de texto em hardware de consumo. O Google relata que o modelo ultrapassou 20 milhões de downloads, com desenvolvedores utilizand-o em ferramentas de busca em dispositivo e pipelines de geração aumentada por recuperação com foco em privacidade.
Codificadores Modulares em uma Base Gemma 4
O EmbeddingGemma 2 foi construído sobre a arquitetura Gemma 4. Segundo o cartão do modelo EmbeddingGemma 2, seus 740 milhões de parâmetros combinam um modelo de texto de 270 milhões de parâmetros (um backbone transformer de 130 milhões mais um incorporador de 140 milhões) com um codificador de visão de 170 milhões de parâmetros e um codificador de áudio de 300 milhões de parâmetros, todos projetando para o espaço compartilhado de 768 dimensões. Como os codificadores são independentes, os desenvolvedores podem carregar seletivamente 270 milhões de parâmetros para texto e código, 440 milhões para texto e visão, 570 milhões para texto e áudio, ou a configuração multimodal completa a partir do mesmo checkpoint, e cada configuração compartilha um único espaço vetorial.
O cartão do modelo lista uma arquitetura de 24 camadas com atenção agrupada e multi‑consulta, um vocabulário de 262.144 tokens, pooling médio e uma camada de projeção de 512 para 768 dimensões. Todas as modalidades compartilham uma janela de contexto de 8.192 tokens, que o Google afirma ser quatro vezes maior que a do EmbeddingGemma 1. Cada modalidade consome esse orçamento em taxas fixas: 280 tokens por imagem, 140 tokens por quadro de vídeo e 25 tokens por segundo de áudio, de modo que uma única entrada pode conter até 29 imagens, 58 quadros de vídeo ou 5,5 minutos de áudio. Entradas intercaladas misturam texto e mídia, com tokens de espaço reservado marcando a posição de cada item de mídia.
Resultados de Benchmark e Truncamento de Vetores
O Google relata que o EmbeddingGemma 2 iguala o desempenho multilíngue de texto de seu predecessor, ao mesmo tempo em que eleva sua pontuação MTEB Code em 9,92 pontos, de 68,76 para 78,68. Os resultados em precisão total do cartão do modelo listam 61,36 no MTEB multilíngue (v2), 64,64 no MIEB lite, 57,28 no MMEB v2 para recuperação de imagens, 67,84 na recuperação visual‑documento, 50,67 na recuperação de vídeo, 69,54 na recuperação de som MSEB e 49,39 nas tarefas de áudio MAEB. O Google afirma que o modelo alcança pontuações de liderança entre incorporadores multimodais com menos de um bilhão de parâmetros e supera alguns modelos especializados em mais de duas vezes seu tamanho.
O Matryoshka Representation Learning permite que os desenvolvedores truncem vetores de saída das 768 dimensões nativas para 512, 256 ou 128, o que o Google afirma reduzir os requisitos de armazenamento de vetores em até 6 vezes. Segundo o cartão do modelo, a qualidade se mantém com impacto mínimo até 256 dimensões, enquanto 128 dimensões são mais adequadas a cargas de trabalho apenas de texto. Um guia de desenvolvedor complementar relata que vetores de 256 dimensões mantêm cerca de 95 % da qualidade total em recuperação de imagens, vídeo e fala, enquanto 128 dimensões preservam cerca de 90 % em texto e código, mas caem para aproximadamente 75 % na recuperação multimodal. Armazenar um milhão de vetores de 768 dimensões em precisão bfloat16 ocupa aproximadamente 1,5 gigabytes de memória, afirma o guia, contra cerca de 250 megabytes com 128 dimensões.
Postura de Segurança e Limitações Declaradas
O cartão do modelo descreve o EmbeddingGemma 2 como um modelo de incorporação pré‑treinado que não passou por alinhamento pós‑treinamento, ajuste de segurança ou moderação ao nível da saída, com as mitig ações de segurança concentradas na filtragem dos dados de pré‑treinamento. Essa preparação incluiu filtragem de material de abuso sexual infantil em múltiplas etapas e filtragem automatizada de informações pessoais e outros dados sensíveis. Os dados de treinamento abrangeram documentos da web, código, imagens, vídeo, áudio e amostras emparelhadas de cruzamento de modalidades, com texto da web em mais de 140 idiomas e corte em janeiro de 2025.
O cartão observa que, embora o modelo suporte mais de 100 idiomas, o desempenho pode não ser igual entre eles, e que omitir os prefixos de instrução de tarefa recomendados nas entradas de texto reduz a precisão da incorporação. Também alerta que a faixa de ativação do modelo excede a faixa dinâmica do float16, o que pode gerar valores NaN ou incorporações degradadas silenciosamente, e recomenda que a inferência seja feita em bfloat16 ou float32. As implantações devem obedecer à Política de Uso Proibido da Gemma, e o cartão atribui aos desenvolvedores a responsabilidade por salvaguardas ao nível da aplicação, como filtragem de recuperação e testes de justiça.
Desempenho em Dispositivo e Disponibilidade
Google relata que, com quantização em um Pixel 11 Pro, EmbeddingGemma 2 requer apenas cerca de 191 megabytes de RAM ativa para pesos apenas de texto e aproximadamente 567 megabytes para o modelo multimodal completo. Os pesos estão disponíveis no Hugging Face e no Kaggle, com versões otimizadas para dispositivo através da LiteRT Community no Hugging Face. O modelo funciona via transformers, sentence-transformers 6.1.0 ou posterior, MLX, vLLM, llama.cpp, SGLang, Ollama e LMStudio, com orientações de fine-tuning da Unsloth e implantação no navegador via transformers.js e WebGPU.
MediaPipe e LiteRT do Google AI Edge lidam com a implantação multiplataforma, e uma MediaPipe Decision Task API oferece classificação e roteamento em tempo real em contexto multimodal. Demonstrações, incluindo Instant Media Search e Video Moments Finder, são enviadas no aplicativo Google AI Edge Gallery, e o aplicativo Google AI Edge Foresight combina EmbeddingGemma 2 para recuperação local de arquivos com Gemma 4 para raciocínio contextual. Como os dois modelos compartilham um tokenizador de texto e arquitetura de codificador de áudio, o Google afirma que executá‑los juntos reduz a pegada de memória combinada. A disponibilidade no Gemini Enterprise Agent Platform Model Garden está prevista para breve, segundo a empresa.












