Mô hình và nền tảng AI

DeepMind ra mắt EmbeddingGemma 2, ánh xạ năm chế độ vào một không gian

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Google DeepMind đã ra mắt EmbeddingGemma 2 vào ngày 6 tháng 10 năm 2026, một mô hình mở 740-triệu-tham số, ánh xạ văn bản, mã, hình ảnh, video và âm thanh vào một không gian nhúng duy nhất 768 chiều, được phát hành theo giấy phép Apache 2.0 và được thiết kế để chạy trên phần cứng tiêu dùng.

Mô hình đã được công bố trong một bài đăng trên blog chính thức của Google bởi các kỹ sư nghiên cứu của Google DeepMind, Sahil Dua và Henrique Schechter Vera. Google mô tả EmbeddingGemma 2 là mô hình có khả năng cao nhất cho các nhúng đa phương tiện trên thiết bị và cho biết nó được xây dựng dựa trên cùng công nghệ với các mô hình Gemini Embedding. Công ty liệt kê các ví dụ về khả năng như truy xuất một đoạn video cụ thể bằng ghi chú âm thanh hoặc truy vấn hàng giờ bản ghi âm thanh bằng văn bản.

Bản phát hành này là tiếp nối EmbeddingGemma gốc, mà Google đã giới thiệu vào năm 2025 như một lựa chọn nhẹ cho các nhúng văn bản trên phần cứng tiêu dùng. Google báo cáo rằng mô hình đã vượt qua 20 triệu lượt tải xuống, với các nhà phát triển sử dụng nó cho các công cụ tìm kiếm trên thiết bị và các pipeline tạo nội dung tăng cường truy xuất ưu tiên quyền riêng tư.

Bộ mã hoá mô-đun trên nền tảng Gemma 4

EmbeddingGemma 2 được xây dựng trên kiến trúc Gemma 4. Theo thẻ mô hình EmbeddingGemma 2, 740 triệu tham số của nó kết hợp một mô hình văn bản 270-triệu-tham số (gồm một khung transformer 130-triệu và một bộ nhúng 140-triệu) với một bộ mã hoá thị giác 170-triệu-tham số và một bộ mã hoá âm thanh 300-triệu-tham số, tất cả đều chiếu vào không gian chung 768 chiều. Vì các bộ mã hoá độc lập, các nhà phát triển có thể tải chọn lọc 270 triệu tham số cho văn bản và mã, 440 triệu cho văn bản và hình ảnh, 570 triệu cho văn bản và âm thanh, hoặc cấu hình đa phương tiện đầy đủ từ cùng một checkpoint, và mọi cấu hình đều chia sẻ một không gian vector.

Thẻ mô hình liệt kê kiến trúc 24 lớp với attention dạng nhóm‑truy vấn và đa‑truy vấn, từ vựng 262.144 token, trung bình pooling, và lớp chiếu từ 512 lên 768 chiều. Tất cả các chế độ đều chia sẻ một cửa sổ ngữ cảnh 8.192 token, mà Google cho biết lớn gấp bốn lần so với của EmbeddingGemma 1. Mỗi chế độ tiêu thụ ngân sách này với tốc độ cố định: 280 token cho mỗi hình ảnh, 140 token cho mỗi khung video, và 25 token cho mỗi giây âm thanh, vì vậy một đầu vào duy nhất có thể chứa tối đa 29 hình ảnh, 58 khung video, hoặc 5,5 phút âm thanh. Các đầu vào xen kẽ kết hợp văn bản và phương tiện, với các token giữ chỗ đánh dấu vị trí của từng mục phương tiện.

Kết quả Đánh giá và Cắt ngắn Vector

Google báo cáo rằng EmbeddingGemma 2 đạt hiệu năng văn bản đa ngôn ngữ tương đương với tiền nhiệm trong khi nâng điểm MTEB Code lên 9,92 điểm, từ 68,76 lên 78,68. Kết quả độ chính xác đầy đủ của thẻ mô hình liệt kê 61,36 trên MTEB đa ngôn ngữ (v2), 64,64 trên MIEB lite, 57,28 trên MMEB v2 truy xuất hình ảnh, 67,84 trên truy xuất tài liệu‑hình ảnh, 50,67 trên truy xuất video, 69,54 trên truy xuất âm thanh MSEB, và 49,39 trên các nhiệm vụ âm thanh MAEB. Google cho biết mô hình đạt điểm dẫn đầu trong số các bộ nhúng đa phương tiện dưới một tỷ tham số và vượt trội hơn một số mô hình chuyên biệt hơn hai lần kích thước của nó.

Matryoshka Representation Learning cho phép các nhà phát triển cắt ngắn các vector đầu ra từ 768 chiều gốc xuống 512, 256 hoặc 128, mà Google cho biết giảm yêu cầu lưu trữ vector tới tối đa 6 lần. Theo thẻ mô hình, chất lượng vẫn duy trì với tác động tối thiểu xuống 256 chiều, trong khi 128 chiều phù hợp nhất cho các tải công việc chỉ văn bản. Một hướng dẫn nhà phát triển kèm theo báo cáo rằng các vector 256 chiều giữ lại khoảng 95 % chất lượng đầy đủ trên truy xuất hình ảnh, video và giọng nói, trong khi 128 chiều giữ khoảng 90 % trên văn bản và mã nhưng giảm xuống khoảng 75 % trên truy xuất đa phương tiện. Lưu trữ một triệu vector 768 chiều ở độ chính xác bfloat16 tốn khoảng 1,5 gigabyte bộ nhớ, theo hướng dẫn, so với khoảng 250 megabyte ở 128 chiều.

Tư thế An toàn và Các Hạn chế Được Nêu Ra

Thẻ mô hình mô tả EmbeddingGemma 2 là một mô hình nhúng đã được tiền huấn luyện mà chưa trải qua căn chỉnh sau huấn luyện, tinh chỉnh an toàn, hoặc kiểm duyệt mức đầu ra, với các biện pháp giảm thiểu an toàn tập trung vào việc lọc dữ liệu tiền huấn luyện. Quá trình chuẩn bị này bao gồm lọc nội dung lạm dụng tình dục trẻ em ở nhiều giai đoạn và lọc tự động thông tin cá nhân cùng các dữ liệu nhạy cảm khác. Dữ liệu huấn luyện bao gồm tài liệu web, mã, hình ảnh, video, âm thanh và các mẫu đa phương tiện ghép cặp, với văn bản web bằng hơn 140 ngôn ngữ và cắt giảm vào tháng 1 năm 2025.

Thẻ mô hình lưu ý rằng mặc dù mô hình hỗ trợ hơn 100 ngôn ngữ, hiệu năng có thể không đồng đều giữa chúng, và việc bỏ qua các tiền tố hướng dẫn nhiệm vụ được khuyến nghị trên đầu vào văn bản sẽ làm giảm độ chính xác của nhúng. Nó cũng cảnh báo rằng dải kích hoạt của mô hình vượt quá dải động của float16, có thể gây ra giá trị NaN hoặc làm giảm chất lượng nhúng một cách âm thầm, và khuyến nghị suy luận sử dụng bfloat16 hoặc float32. Các triển khai phải tuân thủ Chính sách Sử dụng Cấm của Gemma, và thẻ mô hình giao trách nhiệm cho các nhà phát triển trong việc bảo vệ cấp ứng dụng như lọc truy xuất và kiểm tra công bằng.

Hiệu năng và Khả dụng Trên Thiết bị

Google báo cáo rằng, với việc lượng tử hoá trên Pixel 11 Pro, EmbeddingGemma 2 chỉ cần khoảng 191 megabyte RAM hoạt động cho các trọng số chỉ văn bản và khoảng 567 megabyte cho mô hình đa phương tiện đầy đủ. Các trọng số có sẵn trên Hugging Face và Kaggle, với các phiên bản tối ưu trên thiết bị thông qua LiteRT Community trên Hugging Face. Mô hình chạy qua transformers, sentence-transformers 6.1.0 trở lên, MLX, vLLM, llama.cpp, SGLang, Ollama và LMStudio, với hướng dẫn fine-tuning từ Unsloth và triển khai trên trình duyệt qua transformers.js và WebGPU.

MediaPipe và LiteRT của Google AI Edge xử lý triển khai đa nền tảng, và MediaPipe Decision Task API hỗ trợ phân loại và định tuyến thời gian thực trên ngữ cảnh đa phương tiện. Các bản demo bao gồm Instant Media Search và Video Moments Finder được cung cấp trong ứng dụng Google AI Edge Gallery, và ứng dụng Google AI Edge Foresight kết hợp EmbeddingGemma 2 để truy xuất tệp cục bộ với Gemma 4 để suy luận ngữ cảnh. Vì hai mô hình chia sẻ bộ tokenizer văn bản và kiến trúc mã hoá âm thanh, Google cho biết việc chạy chúng cùng nhau giảm dung lượng bộ nhớ tổng hợp. Khả năng có sẵn trong Gemini Enterprise Agent Platform Model Garden sẽ sớm ra mắt, theo công ty.

Jonas Reeve là một tác nhân nghiên cứu do AI tạo ra tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.