Μοντέλα και πλατφόρμες AI
Η DeepMind παρουσιάζει το EmbeddingGemma 2, χαρτογραφώντας πέντε λειτουργίες σε έναν κοινό χώρο

Η Google DeepMind κυκλοφόρησε το EmbeddingGemma 2 στις 6 οκτωβρίου 2026, ένα ανοιχτό μοντέλο με 740 εκατομμύρια παραμέτρους που χαρτογραφεί κείμενο, κώδικα, εικόνες, βίντεο και ήχο σε έναν ενιαίο χώρο ενσωμάτωσης 768‑διάστατο, κυκλοφόρησε υπό την άδεια Apache 2.0 και σχεδιάστηκε για λειτουργία σε καταναλωτικό υλικό.
Το μοντέλο παρουσιάστηκε σε μια ανάρτηση στο επίσημο ιστολόγιο της Google από τους ερευνητικούς μηχανικούς της Google DeepMind, Σαχίλ Ντουά και Ερνίκε Σέχτερ Βέρα. Η Google περιγράφει το EmbeddingGemma 2 ως το πιο ικανό μοντέλο για ενσωματώσεις πολυμορφικών δεδομένων σε συσκευή και δηλώνει ότι είναι χτισμένο με την ίδια τεχνολογία όπως τα μοντέλα Gemini Embedding. Η εταιρεία παραθέτει παραδείγματα δυνατοτήτων όπως η ανάκτηση συγκεκριμένου βίντεο με φωνητική σημείωση ή η ερώτηση ωρών ηχογραφήσεων με κείμενο.
Η κυκλοφορία ακολουθεί το αρχικό EmbeddingGemma, το οποίο η Google παρουσίασε το 2025 ως ελαφριά επιλογή για ενσωματώσεις κειμένου σε καταναλωτικό υλικό. Η Google αναφέρει ότι το μοντέλο έχει ξεπεράσει τις 20 εκατομμύρια λήψεις, με προγραμματιστές να το χρησιμοποιούν για εργαλεία αναζήτησης σε συσκευή και αγωγούς παραγωγής ενισχυμένης ανάκτησης με προτεραιότητα το απόρρητο.
Κωδικοποιητές με βάση το Gemma 4
Το EmbeddingGemma 2 χτίζεται πάνω στην αρχιτεκτονική Gemma 4. Σύμφωνα με την κάρτα μοντέλου EmbeddingGemma 2, οι 740 εκατομμύρια παράμετροι του συνδυάζουν ένα μοντέλο κειμένου 270 εκατομμυρίων παραμέτρων (πυρήνα transformer 130 εκατομμυρίων και ενσωματωτή 140 εκατομμυρίων) με έναν κωδικοποιητή όρασης 170 εκατομμυρίων παραμέτρων και έναν κωδικοποιητή ήχου 300 εκατομμυρίων παραμέτρων, όλα προβάλλονται στον κοινό χώρο 768‑διάστατο. Επειδή οι κωδικοποιητές είναι ανεξάρτητοι, οι προγραμματιστές μπορούν να φορτώσουν επιλεκτικά 270 εκατομμύρια παραμέτρους για κείμενο και κώδικα, 440 εκατομμύρια για κείμενο και όραση, 570 εκατομμύρια για κείμενο και ήχο, ή τη πλήρη πολυμορφική διαμόρφωση από το ίδιο σημείο ελέγχου, και κάθε διαμόρφωση μοιράζεται έναν ενιαίο χώρο διανυσμάτων.
Η κάρτα μοντέλου παραθέτει αρχιτεκτονική 24 επιπέδων με grouped‑query και multi‑query attention, λεξικό 262 144 διακριτικών, μέση συγκέντρωση (mean pooling) και στρώση προβολής από 512 σε 768 διαστάσεις. Όλες οι λειτουργίες μοιράζονται ένα παράθυρο συμφραζομένων 8 192 διακριτικών, το οποίο η Google δηλώνει ότι είναι τέσσερις φορές μεγαλύτερο από το EmbeddingGemma 1. Κάθε λειτουργία καταναλώνει αυτόν τον προϋπολογισμό με σταθερούς ρυθμούς: 280 διακριτικά ανά εικόνα, 140 διακριτικά ανά καρέ βίντεο και 25 διακριτικά ανά δευτερόλεπτο ήχου, έτσι ώστε μια ενιαία είσοδος να μπορεί να περιέχει έως 29 εικόνες, 58 καρέ βίντεο ή 5,5 λεπτά ήχου. Τα εναλλασσόμενα εισροές συνδυάζουν κείμενο και πολυμέσα, με διακριτικά κράτησης θέσης που σηματοδοτούν τη θέση κάθε στοιχείου πολυμέσου.
Αποτελέσματα Benchmark και Περικοπή Διανυσμάτων
Η Google αναφέρει ότι το EmbeddingGemma 2 ισοδυναμεί με την απόδοση πολυγλωσσικού κειμένου του προκάτοχου, ενώ αυξάνει το σκορ MTEB Code κατά 9,92 μονάδες, από 68,76 σε 78,68. Τα αποτελέσματα πλήρους ακρίβειας της κάρτας μοντέλου καταγράφουν 61,36 στο MTEB multilingual (v2), 64,64 στο MIEB lite, 57,28 στο MMEB v2 image retrieval, 67,84 στην ανάκτηση οπτικού‑εγγράφου, 50,67 στην ανάκτηση βίντεο, 69,54 στην ανάκτηση ήχου MSEB και 49,39 στις εργασίες ήχου MAEB. Η Google δηλώνει ότι το μοντέλο κατακτά κορυφαίες βαθμολογίες μεταξύ των πολυμορφικών ενσωματωτών με λιγότερο από ένα δισεκατομμύριο παραμέτρους και υπερέχει έναντι ορισμένων εξειδικευμένων μοντέλων περισσότερο από το διπλάσιο του μεγέθους του.
Η Μάθηση Αναπαράστασης Matryoshka επιτρέπει στους προγραμματιστές να περικόψουν τα διανύσματα εξόδου από τις εγγενείς 768 διαστάσεις σε 512, 256 ή 128, κάτι που, σύμφωνα με την Google, μειώνει τις απαιτήσεις αποθήκευσης διανυσμάτων έως και 6 φορές. Σύμφωνα με την κάρτα μοντέλου, η ποιότητα παραμένει με ελάχιστη επίπτωση έως τις 256 διαστάσεις, ενώ οι 128 διαστάσεις είναι πιο κατάλληλες για εργασίες μόνο κειμένου. Μια συνοδευτικός οδηγός προγραμματιστών αναφέρει ότι τα διανύσματα 256‑διαστάσεων διατηρούν περίπου το 95 % της πλήρους ποιότητας στην ανάκτηση εικόνας, βίντεο και ομιλίας, ενώ τα 128‑διαστάσεων διατηρούν περίπου το 90 % στην ανάκτηση κειμένου και κώδικα αλλά πέφτουν περίπου στο 75 % στην πολυμορφική ανάκτηση. Η αποθήκευση ενός εκατομμυρίου διανυσμάτων 768‑διαστάσεων με ακρίβεια bfloat16 απαιτεί περίπου 1,5 GB μνήμης, σύμφωνα με τον οδηγό, έναντι περίπου 250 MB στα 128 διαστάσεων.
Προσέγγιση Ασφάλειας και Δηλωμένοι Περιορισμοί
Η κάρτα μοντέλου περιγράφει το EmbeddingGemma 2 ως προ‑εκπαιδευμένο μοντέλο ενσωμάτωσης που δεν έχει υποβληθεί σε ευθυγράμμιση μετά την εκπαίδευση, ρύθμιση ασφαλείας ή διαχείριση εξόδου, με τα μέτρα ασφαλείας να επικεντρώνονται στο φιλτράρισμα των δεδομένων προ‑εκπαίδευσης. Η προετοιμασία αυτή περιελάμβανε φιλτράρισμα υλικού παιδικής σεξουαλικής κακοποίησης σε πολλαπλά στάδια και αυτοματοποιημένο φιλτράρισμα προσωπικών πληροφοριών και άλλων ευαίσθητων δεδομένων. Τα δεδομένα εκπαίδευσης περιλάμβαναν έγγραφα ιστού, κώδικα, εικόνες, βίντεο, ήχο και ζευγάρια δειγμάτων διασταυρούμενης λειτουργικότητας, με κείμενο ιστού σε περισσότερες από 140 γλώσσες και ημερομηνία αποκοπής τον Ιανουάριο 2025.
Η κάρτα σημειώνει ότι, ενώ το μοντέλο υποστηρίζει περισσότερες από 100 γλώσσες, η απόδοση ενδέχεται να μην είναι ίση σε όλες, και ότι η παράλειψη των προτεινόμενων προθεμάτων εντολών εργασίας στα κειμενικά εισροές μειώνει την ακρίβεια των ενσωματώσεων. Επίσης, προειδοποιεί ότι η περιοχή ενεργοποίησης του μοντέλου υπερβαίνει το δυναμικό εύρος του float16, κάτι που μπορεί να παράγει τιμές NaN ή σιωπηρά υποβαθμισμένες ενσωματώσεις, και κατευθύνει την εκτέλεση σε bfloat16 ή float32. Οι υλοποιήσεις πρέπει να συμμορφώνονται με την Πολιτική Απαγορευμένης Χρήσης του Gemma, και η κάρτα αναθέτει στους προγραμματιστές την ευθύνη για μέτρα ασφαλείας επιπέδου εφαρμογής, όπως φιλτράρισμα ανάκτησης και έλεγχο δικαιοσύνης.
Απόδοση σε Συσκευή και Διαθεσιμότητα
Η Google αναφέρει ότι, με την κβαντοποίηση σε ένα Pixel 11 Pro, το EmbeddingGemma 2 απαιτεί μόλις περίπου 191 megabytes ενεργής μνήμης RAM για τα βάρη μόνο κειμένου και περίπου 567 megabytes για το πλήρες πολυμορφικό μοντέλο. Τα βάρη είναι διαθέσιμα στο Hugging Face και στο Kaggle, με εκδόσεις βελτιστοποιημένες για συσκευή μέσω της LiteRT Community στο Hugging Face. Το μοντέλο εκτελείται μέσω των transformers, sentence-transformers 6.1.0 ή νεότερων, MLX, vLLM, llama.cpp, SGLang, Ollama και LMStudio, με οδηγίες βελτιστοποίησης από την Unsloth και ανάπτυξη στον περιηγητή μέσω του transformers.js και του WebGPU.
Τα MediaPipe και LiteRT του Google AI Edge διαχειρίζονται την πολυπλατφορμική ανάπτυξη, και ένα MediaPipe Decision Task API υποστηρίζει την ταξινόμηση και δρομολόγηση σε πραγματικό χρόνο σε πολυμορφικό πλαίσιο. Δείγματα, όπως το Instant Media Search και το Video Moments Finder, κυκλοφορούν στην εφαρμογή Google AI Edge Gallery, και η εφαρμογή Google AI Edge Foresight συνδυάζει το EmbeddingGemma 2 για τοπική ανάκτηση αρχείων με το Gemma 4 για συμφραζόμενη λογική. Επειδή τα δύο μοντέλα μοιράζονται έναν κειμενικό tokenizer και αρχιτεκτονική κωδικοποιητή ήχου, η Google λέει ότι η ταυτόχρονη εκτέλεσή τους μειώνει το συνολικό αποτύπωμα μνήμης. Η διαθεσιμότητα στο Gemini Enterprise Agent Platform Model Garden αναμένεται σύντομα, σύμφωνα με την εταιρεία.












