Μοντέλα και πλατφόρμες AI

Η H Company κυκλοφορεί το NeoMME, μια ανοιχτού κώδικα οικογένεια πολυμορφικών κωδικοποιητών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι ερευνητές της H Company κυκλοφόρησαν το NeoMME στις 3 Σεπτεμβρίου 2026, μια οικογένεια πολυμορφικών και πολυγλωσσικών κωδικοποιητών με 260 M και 800 M παραμέτρους, εκπαιδευμένους από το μηδέν και δημοσιευμένους υπό την άδεια Apache 2.0. Οι εκ των υστέρων βελτιστοποιημένες παραλλαγές ανάκτησης βρίσκονται στο σύνορο Pareto μεγέθους μοντέλου του benchmark ViDoRe v3 για οπτική ανάκτηση εγγράφων, ανέφερε η ομάδα.

Σύμφωνα με τη ανακοίνωση κυκλοφορίας, πολλοί πρόσφατοι ανακτητές οπτικών εγγράφων προσαρμόζονται από προεκπαιδευμένα γενετικά μοντέλα όρασης-γλώσσας, όπου ένας ξεχωριστά προεκπαιδευμένος κωδικοποιητής όρασης παράγει οπτικά χαρακτηριστικά που ένας προβολέας μετατρέπει στον χώρο εισόδου ενός αιτιακού μοντέλου γλώσσας. Οι εργασίες ανάκτησης, ταξινόμησης και ετικετοθέτησης συμβόλων δεν δημιουργούν κείμενο αυτοπαλινδρομικά, γράφουν οι συγγραφείς, επομένως αυτές οι εργασίες δεν απαιτούν αιτιακό αποκωδικοποιητή ή το σχετικό κόστος παραμέτρων και υπολογισμού. Το NeoMME, αντίθετα, επεξεργάζεται τα σύμβολα κειμένου και τα ακατέργαστα τμήματα εικόνας μέσω ενός κοινόχρηστου διπλής κατεύθυνσης Transformer και δεν βασίζεται σε κανέναν υπάρχον προεκπαιδευμένο πύργο όρασης, κωδικοποιητή κειμένου ή αποκωδικοποιητή κειμένου.

Η ανακοίνωση θέτει το σχεδιασμό σε αντίθεση με δύο προηγούμενες προσπάθειες κωδικοποιητών: ModernBERT, που έφερε βελτιώσεις αποδοτικότητας στους διπλής κατεύθυνσης κωδικοποιητές κειμένου, και ModernVBERT, που εφάρμοσε έναν κωδικοποιητή κειμένου τύπου ModernBERT στην ανάκτηση οπτικών εγγράφων διατηρώντας έναν ξεχωριστό προεκπαιδευμένο πύργο όρασης SigLIP2. Οι συγγραφείς γράφουν ότι ήθελαν να αφαιρέσουν το βάρος της μεταφοράς των στοιχείων ενός μοντέλου όρασης-γλώσσας σε έναν κωδικοποιητή.

Αρχιτεκτονική και Εκπαίδευση από το Μηδέν

Και τα δύο μεγέθη του NeoMME μοιράζονται την ίδια αρχιτεκτονική. Οι εισόδους κειμένου χρησιμοποιούν παραγοντοποιημένες ενσωματώσεις συμβόλων, ενώ οι εικόνες διαιρούνται σε ένα πλέγμα μη επικαλυπτόμενων τμημάτων 32×32 και προβάλλονται με ένα μικρό πολυεπίπεδο perceptron· και τα δύο εισέρχονται στον ίδιο κωδικοποιητή Transformer. Οι εικόνες διατηρούν την αναλογία διαστάσεων και το μέγεθός τους, ώστε το μοντέλο να μπορεί να αφιερώνει περισσότερα σύμβολα σε μια σελίδα εγγράφου υψηλής ανάλυσης και πυκνότητας πληροφορίας σε σχέση με μια μικρότερη εικόνα. Το μήκος του πλαισίου είναι 16.384 σύμβολα, επαρκές για έως δύο τυπικές εικόνες 3840×2160 4K UHD. Οι περισσότερες στρώσεις χρησιμοποιούν συμμετρική προσοχή με κυλιόμενο παράθυρο, ενώ κάθε έκτη στρώση και η τελική στρώση χρησιμοποιούν καθολική προσοχή. Η στοίβα περιλαμβάνει επίσης grouped‑query attention, κανονικοποίηση query‑key, gated attention, δισδιάστατες περιστροφικές ενσωματώσεις θέσης και MLPs με τετραγωνική ReLU. Για το κείμενο, η ομάδα εκπαίδευσε έναν BPE tokenizer με λεξικό 131.072 συμβόλων από το μηδέν σε πολυγλωσσικό κείμενο, κώδικα, μαθηματικά και αυτόματα παραγόμενα μεταγραφικά τμήματα εικόνας.

Το NeoMME προεκπαιδεύεται από το μηδέν ως διακριτικός θορυβοαποδιαμορφωτής κειμένου με μάσκα. Για παραδείγματα μόνο κειμένου, ένα ποσοστό αλλοίωσης δειγματοληπτεί ομοιόμορφα μεταξύ 0 και 1, και κάθε επιλέξιμο σύμβολο κειμένου καλύπτεται ανεξάρτητα με αυτό το ποσοστό. Τα πολυμορφικά παραδείγματα χρησιμοποιούν ποσοστά αλλοίωσης μεταξύ 0,3 και 1, με τα τμήματα εικόνας να παραμένουν ορατά ενώ το μοντέλο ανακατασκευάζει το κείμενο με μάσκα· οι συγγραφείς γράφουν ότι η έντονη μάσκα αναγκάζει το μοντέλο να μάθει περιγραφές βασισμένες στην εικόνα αντί να βασίζεται σε συντομεύσεις μόνο γλώσσας. Η προεκπαίδευση συνδυάζει πολυγλωσσικό κείμενο, κώδικα, μαθηματικά, φυσικές εικόνες και εικόνες εγγράφων, και κάθε μοντέλο επεξεργάζεται περίπου 524 δισεκατομμύρια συμπιεσμένα σύμβολα εισόδου, συμπεριλαμβανομένων 290 δισεκατομμυρίων από παραδείγματα μόνο κειμένου. Παρατηρώντας ότι αυτό το προϋπολογισμένο κείμενο είναι μικρό σε σχέση με τα 2 τρισεκατομμύρια σύμβολα εκπαίδευσης του ModernBERT, οι συγγραφείς γράφουν ότι επέλεξαν τον βελτιστοποιητή NorMuon για να βελτιώσουν την αποδοτικότητα των δεδομένων.

Βελτιστοποίηση ανάκτησης και Αποτελέσματα Benchmark

Για να αξιολογήσουν το βασικό μοντέλο σε μια επακόλουθη εργασία, η ομάδα το βελτιστοποίησε για ανάκτηση οπτικών εγγράφων χρησιμοποιώντας τη μεθοδολογία σελίδα‑εικόνα που εισήγαγε η ColPali. Αντί να ανακτά εξαγόμενα τμήματα κειμένου, το NeoMME‑Retriever ταξινομεί στιγμιότυπα οθόνης σελίδων εγγράφων, παρακάμπτοντας την προεπεξεργασία OCR και διατηρώντας τη διάταξη, τα διαγράμματα, τους πίνακες και την τυπογραφία. Ο ανακτητής προσθέτει δύο κοινά εκπαιδευμένα κεφάλαια στο βασικό μοντέλο: ένα πυκνό κεφάλαιο που κάνει μέσο pooling των κρυφών καταστάσεων σε ένα κανονικοποιημένο διάνυσμα, και ένα κεφάλαιο καθυστερημένης αλληλεπίδρασης που προβάλλει κάθε σύμβολο κειμένου ή τμήμα εικόνας σε ένα 128‑διάστατο κανονικοποιημένο διάνυσμα, διατηρώντας λεπτομερείς αντιστοιχίες μεταξύ των συμβόλων ερωτήματος και των περιοχών της εικόνας. Μία προώθηση επιστρέφει και τις δύο αναπαραστάσεις. Οι συγγραφείς συνιστούν γενικά ενσωματώσεις καθυστερημένης αλληλεπίδρασης, καθώς και μια αλυσίδα πυκνής ανάκτησης ακολουθούμενη από επανακατάταξη με καθυστερημένη αλληλεπίδραση για πολύ μεγάλα σώματα κειμένου.

Στο benchmark ViDoRe v3, η ανακοίνωση αναφέρει nDCG@10 ίσο με 0,523 για το NeoMME‑Retriever‑260M, το υψηλότερο σκορ μεταξύ των αξιολογημένων μοντέλων με λιγότερους από 800 M παραμέτρους και εντός 0,002 του ColQwen2.5, ενώ χρησιμοποιεί περίπου 14 φορές λιγότερες παραμέτρους. Το NeoMME‑Retriever‑800M φθάνει στο 0,556, εντός 0,009 του παρόμοιου μεγέθους Vultron Retriever Flash, και και τα δύο μοντέλα βρίσκονται στο σύνορο Pareto μεγέθους μοντέλου του benchmark. Ο πίνακας σύγκρισης της ανακοίνωσης σημειώνει τις βαθμολογίες των ανταγωνιστών ως προερχόμενες από το MTEB και τις βαθμολογίες του NeoMME ως τις δικές τους αξιολογήσεις. Στα παλαιότερα benchmark ViDoRe v1 και v2, που χρησιμοποιούν nDCG@5, η ανακοίνωση αναφέρει ότι το μοντέλο 260M υπερβαίνει το ColModernVBERT και το διπλάσιο ColSmol‑500M, ενώ το μοντέλο 800M υπερβαίνει το ColPali v1.3 με 3,6 φορές λιγότερες παραμέτρους.

Η κάρτα μοντέλου για το NeoMME‑260M‑Retriever αναφέρει 263 M παραμέτρους, μέγεθος κρυφής στρώσης 1 024, βάρη BF16, και πυκνές ενσωματώσεις 1 024‑διάστατες με σημεία αποκοπής Matryoshka στα 128, 256, 512 και 1 024 διαστάσεις, μαζί με την έξοδο 128‑διάστατου πολυ‑διανύσματος. Η κάρτα αναφέρει επίσης αποτελέσματα ανάκτησης κειμένου στο BEIR‑15, όπου ο ανακτητής 260M σημειώνει nDCG@10 ίσο με 0,4881 με καθυστερημένη αλληλεπίδραση και το μοντέλο 800M σημειώνει 0,5126.

Συμπίεση, Ρυθμός Δεικτοδότησης και Διαθεσιμότητα

Επειδή η αποθήκευση με καθυστερημένη αλληλεπίδραση κλιμακώνεται γραμμικά με τον αριθμό των διανυσμάτων ενσωμάτωσης, οι σελίδες υψηλής ανάλυσης είναι ακριβές στην δεικτοδότηση: μια σελίδα 2048×2048 παράγει 4.200 διανύσματα με το NeoMME‑Retriever, περίπου 2,1 MB σε float32, και η ανακοίνωση αναφέρει μέσο όρο περίπου 1,5 MB ανά έγγραφο στο ViDoRe v3. Η ομάδα συνδύασε ιεραρχική συγκέντρωση συμβόλων, η οποία ομαδοποιεί παρόμοια διανύσματα εγγράφων και αποθηκεύει το μέσο κάθε ομάδας, με ασύμμετρη κβαντοποίηση, η οποία αποθηκεύει τις ενσωματώσεις εγγράφων σε int8 ή δυαδική ακρίβεια ενώ διατηρεί τις ενσωματώσεις ερωτήματος σε υψηλότερη ακρίβεια σε πραγματικό χρόνο. Στο ViDoRe v3, η ανακοίνωση αναφέρει ότι ένας παράγοντας συγκέντρωσης 10 με ερωτήματα και έγγραφα int8 μειώνει την αποθήκευση σε 39 kB ανά σελίδα, μείωση 39×, διατηρώντας πάνω από 99 % του βασικού nDCG@10. Μια πιο επιθετική ρύθμιση, παράγοντας συγκέντρωσης 8 με ερωτήματα int8 και δυαδικά έγγραφα, χρησιμοποιεί 6 kB ανά σελίδα, 255 φορές μικρότερο, και διατηρεί πάνω από 95 % της ποιότητας ανάκτησης.

Η ομάδα μέτρησε επίσης το ρυθμό κωδικοποίησης χρησιμοποιώντας προεπεξεργασμένα τανυστές εικόνας, με μεγέθη παρτίδας προσαρμοσμένα ξεχωριστά για κάθε μοντέλο και μέγεθος εικόνας. Σε είσοδο 2048×2048 σε μία GPU NVIDIA L40S, το NeoMME‑Retriever‑260M κωδικοποιεί περίπου 51 σελίδες ανά δευτερόλεπτο, σχεδόν διπλάσιο των 26 σελίδων ανά δευτερόλεπτο του ColModernVBERT, και η ανακοίνωση αναφέρει ότι και τα δύο μεγέθη NeoMME‑Retriever είναι ταχύτερα από τα άλλα συγκριόμενα μοντέλα σε μικρότερες αναλύσεις εισόδου.

Όλα τα σημεία ελέγχου NeoMME κυκλοφορούν υπό την άδεια Apache 2.0 με υλοποίηση ημέρας‑μηδέν στα Hugging Face Transformers, και ένα demo οπτικής ανάκτησης‑ενισχυμένης παραγωγής είναι διαθέσιμο ως Hugging Face Space. Για βελτιστοποίηση, η ομάδα παρέχει ξεχωριστά σημεία ελέγχου πυκνής και καθυστερημένης αλληλεπίδρασης συμβατά με το Sentence Transformers v6, το οποίο αυτή τη στιγμή υποστηρίζει ένα κεφάλαιο ανάκτησης ανά μοντέλο· η εκπαίδευση και των δύο κεφαλαίων ταυτόχρονα απαιτεί την κλάση NeoMMEForRetrieval με έναν προσαρμοσμένο Trainer.

Η συνοδευτική τεχνική αναφορά, των Aurélien Lac και Tony Wu, υποβλήθηκε στο arXiv στις 31 Αυγούστου 2026, στην κατηγορία ανάκτησης πληροφορίας. Στις ευχαριστίες της ανακοίνωσης, οι συγγραφείς περιγράφουν το NeoMME ως ένα παράπλευρο έργο που δημιουργήθηκε με περιορισμένο χρόνο και υπολογιστική ισχύ, και ευχαριστούν την H Company για την υποστήριξη του έργου και την παροχή της υπολογιστικής ισχύος που χρησιμοποιήθηκε για την εκπαίδευσή του.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.