AI 모델 및 플랫폼
DeepMind, EmbeddingGemma 2 출시, 다섯 가지 모달리티를 하나의 공간에 매핑

Google DeepMind는 2026년 10월 6일 EmbeddingGemma 2를 출시했으며, 7억 4천만 파라미터를 가진 오픈 모델로 텍스트, 코드, 이미지, 비디오, 오디오를 단일 768차원 임베딩 공간에 매핑합니다. Apache 2.0 라이선스로 공개되었으며 소비자 하드웨어에서 실행되도록 설계되었습니다.
이 모델은 Google DeepMind 연구 엔지니어인 Sahil Dua와 Henrique Schechter Vera가 Google 공식 블로그의 게시물에서 공개했습니다. Google은 EmbeddingGemma 2를 온디바이스 멀티모달 임베딩을 위한 가장 강력한 모델이라고 설명하며, Gemini Embedding 모델과 동일한 기술을 기반으로 구축되었다고 밝혔습니다. 회사는 음성 메모로 특정 비디오 클립을 검색하거나 텍스트로 수시간 분량의 오디오 녹음을 질의하는 등 다양한 활용 사례를 제시합니다.
이번 발표는 2025년에 Google이 소비자 하드웨어용 텍스트 임베딩 경량 옵션으로 소개한 최초의 EmbeddingGemma에 이어 이루어졌습니다. Google에 따르면 이 모델은 2천만 건 이상의 다운로드를 기록했으며, 개발자들은 이를 온디바이스 검색 도구와 프라이버시 우선 검색‑증강 생성 파이프라인에 활용하고 있습니다.
Gemma 4 기반의 모듈형 인코더
EmbeddingGemma 2는 Gemma 4 아키텍처 위에 구축되었습니다. EmbeddingGemma 2 모델 카드에 따르면, 7억 4천만 파라미터는 2억 7천만 파라미터 텍스트 모델(1억 3천만 트랜스포머 백본과 1억 4천만 임베더)과 1억 7천만 파라미터 비전 인코더, 3억 파라미터 오디오 인코더를 결합하여 공유된 768차원 공간에 투영합니다. 인코더가 독립적이기 때문에 개발자는 텍스트와 코드용으로 2억 7천만 파라미터, 텍스트와 비전용으로 4억 4천만 파라미터, 텍스트와 오디오용으로 5억 7천만 파라미터를 선택적으로 로드하거나 동일 체크포인트에서 전체 멀티모달 구성을 로드할 수 있으며, 모든 구성은 하나의 벡터 공간을 공유합니다.
모델 카드에는 그룹화 쿼리 및 멀티쿼리 어텐션을 갖춘 24계층 아키텍처, 262,144 토큰 어휘, 평균 풀링, 512에서 768 차원으로의 투영 레이어가 명시되어 있습니다. 모든 모달리티는 8,192 토큰 컨텍스트 윈도우를 공유하며, Google에 따르면 이는 EmbeddingGemma 1보다 네 배 더 큽니다. 각 모달리티는 고정 비율로 토큰을 사용합니다: 이미지당 280 토큰, 비디오 프레임당 140 토큰, 초당 오디오 25 토큰으로, 단일 입력은 최대 29개의 이미지, 58개의 비디오 프레임 또는 5.5분의 오디오를 포함할 수 있습니다. 교차 입력은 텍스트와 미디어를 혼합하며, 자리표시자 토큰이 각 미디어 항목의 위치를 표시합니다.
벤치마크 결과 및 벡터 축소
Google에 따르면 EmbeddingGemma 2는 이전 모델의 다국어 텍스트 성능을 유지하면서 MTEB Code 점수를 68.76에서 78.68으로 9.92점 상승시켰다고 합니다. 모델 카드의 전체 정밀도 결과는 MTEB 다국어(v2)에서 61.36, MIEB lite에서 64.64, MMEB v2 이미지 검색에서 57.28, 시각‑문서 검색에서 67.84, 비디오 검색에서 50.67, MSEB 사운드 검색에서 69.54, MAEB 오디오 작업에서 49.39를 기록했습니다. Google은 이 모델이 10억 파라미터 미만의 멀티모달 임베더 중 선두 점수를 기록했으며, 일부 전문 모델보다 두 배 이상 큰 성능을 보인다고 밝혔습니다.
Matryoshka Representation Learning을 통해 개발자는 기본 768차원 출력 벡터를 512, 256 또는 128 차원으로 축소할 수 있으며, Google에 따르면 이는 벡터 저장 요구량을 최대 6배 감소시킵니다. 모델 카드에 따르면 품질은 256차원까지는 최소한의 영향을 받으며, 128차원은 텍스트 전용 작업에 가장 적합합니다. 동반 개발자 가이드에 따르면 256차원 벡터는 이미지, 비디오, 음성 검색에서 전체 품질의 약 95%를 유지하고, 128차원은 텍스트와 코드에서는 약 90%를 유지하지만 멀티모달 검색에서는 약 75%로 감소합니다. 1백만 개의 768차원 벡터를 bfloat16 정밀도로 저장하면 약 1.5기가바이트의 메모리가 필요하며, 128차원에서는 약 250메가바이트에 불과하다고 가이드는 설명합니다.
안전 입장 및 명시된 제한사항
모델 카드는 EmbeddingGemma 2를 사전 훈련된 임베딩 모델로 설명하며, 사후 훈련 정렬, 안전 튜닝 또는 출력 수준 검열을 거치지 않았고, 안전 완화 조치는 사전 훈련 데이터 필터링에 집중되어 있다고 명시합니다. 이 준비 과정에는 여러 단계에서 아동 성학대 자료에 대한 필터링과 개인 정보 및 기타 민감 데이터에 대한 자동 필터링이 포함되었습니다. 훈련 데이터는 웹 문서, 코드, 이미지, 비디오, 오디오 및 교차 모달리티 샘플을 포괄했으며, 웹 텍스트는 140개 이상의 언어로 제공되고 2025년 1월을 기준으로 제한되었습니다.
카드에서는 모델이 100개 이상의 언어를 지원하지만 성능이 언어마다 균등하지 않을 수 있으며, 텍스트 입력 시 권장 작업 지시어 접두사를 생략하면 임베딩 정밀도가 감소한다고 언급합니다. 또한 모델의 활성화 범위가 float16의 동적 범위를 초과하여 NaN 값이 발생하거나 임베딩이 조용히 저하될 수 있으므로 추론은 bfloat16 또는 float32를 사용하도록 권고합니다. 배포 시에는 Gemma 금지 사용 정책을 준수해야 하며, 카드에서는 검색 필터링 및 공정성 테스트와 같은 애플리케이션 수준의 안전장치를 개발자가 책임져야 한다고 명시합니다.
온디바이스 성능 및 가용성
Google은 Pixel 11 Pro에서 양자화(quantization)를 적용하면 EmbeddingGemma 2가 텍스트 전용 가중치의 경우 약 191메가바이트, 전체 멀티모달 모델의 경우 약 567메가바이트의 활성 RAM만 필요하다고 보고했습니다. 가중치는 Hugging Face와 Kaggle에서 제공되며, Hugging Face의 LiteRT Community를 통해 온디바이스 최적화 버전도 제공됩니다. 이 모델은 transformers, sentence-transformers 6.1.0 이상, MLX, vLLM, llama.cpp, SGLang, Ollama 및 LMStudio에서 실행되며, Unsloth의 파인튜닝 가이드와 transformers.js 및 WebGPU를 통한 브라우저 배포를 지원합니다.
Google AI Edge의 MediaPipe와 LiteRT는 크로스 플랫폼 배포를 처리하며, MediaPipe Decision Task API는 멀티모달 컨텍스트에서 실시간 분류와 라우팅을 지원합니다. Instant Media Search와 Video Moments Finder를 포함한 데모는 Google AI Edge Gallery 앱에 제공되고, Google AI Edge Foresight 앱은 로컬 파일 검색을 위한 EmbeddingGemma 2와 컨텍스트 추론을 위한 Gemma 4를 결합합니다. 두 모델이 텍스트 토크나이저와 오디오 인코더 아키텍처를 공유하기 때문에 함께 실행하면 전체 메모리 사용량이 감소한다고 Google는 말합니다. Gemini Enterprise Agent Platform Model Garden에서의 제공은 곧 출시될 예정이며, 이는 회사 측의 발표에 따릅니다.












