Μοντέλα και πλατφόρμες AI

Η Liquid AI Εκδίδει το LFM2.5-VL-3B για Ταχύτερη Όραση-Γλώσσα AI στην Πériphero

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Liquid AI εξέδωσε το LFM2.5-VL-3B στις 12 Αυγούστου 2026, ένα ανοικτό μοντέλο όρασης-γλώσσας 3,1 δισεκατομμυρίων παραμέτρων, που έχει σχεδιαστεί για να τρέχει σε κινητά τηλέφωνα, λάπτοπ και單ές GPU, αντί να βρίσκεται σε ένα κέντρο δεδομένων. Το μοντέλο, ανακοινώθηκε στο blog της εταιρείας και δημοσιεύθηκε στο Hugging Face με διαθέσιμες βαρύτητες αμέσως, επεκτείνει το LFM2-VL-3B της προηγούμενης χρονιάς με ισχυρότερη κατανόηση οθόνης, αντικειμενική ερμηνεία, πολλαπλή ερμηνεία εικόνων και κλήση λειτουργιών.

Η εταιρεία θέτει την έκδοση ως το πιο ικανό μοντέλο όρασης για tự-φιλοξενημένα υλικό. Στην ανακοίνωση, η Liquid AI περιγράφει ως “το πιο ικανό μοντέλο όρασης-γλώσσας”, που “παρέχει ανταγωνιστική απόδοση όρασης έναντι μοντέλων διπλάσιου μεγέθους, ενώ τρέχει γρηγορότερα σε eine σειρά CPU και GPU, ακόμη και σε σύγκριση με μοντέλα που έχουν λιγότερες παραμέτρους”.

Όλες οι μετρήσεις και ταχύτητες σε αυτή την έκδοση είναι αναφερόμενες από τον προμηθευτή: Η Liquid AI έτρεξε τις αξιολογήσεις από μόνη της χρησιμοποιώντας vLLM 0.26.0, με κάθε μοντέλο σε λειτουργία μη λογικής και με πρόθεση να απαντήσει άμεσα. Δεν υπάρχουν ανεξάρτητες αξιολογήσεις του νέου μοντέλου ακόμη, που είναι η αναμενόμενη κατάσταση την ημέρα της έκδοσης, αν και πρόσφατη κάλυψη της Unite.AI για μια μελέτη της Amazon που αξιολόγησε beberapa από τα ίδια μοντέλα σύγκρισης δείχνει γιατί η ανεξάρτητη μετρημένη συμπεριφορά μεταγραφής μπορεί να απομακρύνεται από καθαρές μετρήσεις benchmark.

Πώς το LFM2.5-VL-3B Διαβάζει Οθόνες, Έγγραφα και Πολλαπλές Εικόνες

Το μοντέλο ζευγαρώνει einen SigLIP2 400M NaFlex κωδικοποιητή όρασης από την Google με το ίδιο προ-εκπαιδευμένο σκελετό όπως το LFM2.5-2.6B μοντέλο κειμένου της Liquid AI, που κυκλοφόρησε στις 4 Αυγούστου 2026. Σύμφωνα με την κάρτα μοντέλου, προ-εκπαιδεύτηκε σε περίπου 34 τρισεκατομμύρια tokens με τέσσερις φορές περισσότερα δεδομένα όρασης από τον προκάτοχό του, και το λεξιλόγιο του διπλασιάστηκε σε 128.000 tokens με την επέκταση του υφιστάμενου tokenizer αντί για επανεκπαίδευση, μια αλλαγή που στοχεύει σε μη-λατινικούς κώδικες. Η μετα-εκπαίδευση συνδυάζει επιβλεπόμενη λεπτομέρεια με γνώση απόσταξης από ένα μεγαλύτερο μοντέλο δασκάλου, ακολουθούμενο από πολλαπλή επιβράβευση ενίσχυσης.

Τέσσερις περιοχές ικανοτήτων ορίζουν την αναβάθμιση πάνω από το LFM2-VL-3B. Στην κατανόηση οθόνης, το μοντέλο μέσο όρο 80,7 σε desktop, κινητά και web διαμερισμάτων του ScreenSpot-v2, από singledigits στο προηγούμενο μοντέλο και πολύ μπροστά από το 8-δισεκατομμυρίων παραμέτρων Gemma-4-E4B στο 50,9, αν και πίσω από το μεγαλύτερο InternVL 3.5 4B στο 84,2. Στην ερμηνεία, όπου το μοντέλο επιστρέφει bounding boxes για αντικείμενα που περιγράφονται σε φυσική γλώσσα, η ακρίβεια RefCOCO αυξάνεται από 57,1 σε 87,9, μια αύξηση περισσότερο από 30 πόντων που η Liquid AI αποδίδει σε κλιμακωμένα συνθετικά δεδομένα ερμηνείας.

Η κλήση λειτουργιών είναι νέο στοιχείο στη γραμμή όρασης της εταιρείας. Στο ToolSandbox, που μετράει τη χρήση εργαλείων, το σκορ διπλασιάζεται από 26,4 σε 59,5, τοποθετώντας το 3,1B μοντέλο στο ίδιο επίπεδο με το Gemma-4-E2B και μπροστά από το Qwen3.5-2B. Η πολλαπλή ερμηνεία εικόνων βελτιώνεται επίσης δραματικά, με το BLINK να αυξάνεται από 50,2 σε 61,5 και το MuirBench από 34,9 σε 58,3.

Σε όλη τη σειρά 28-βENCHMARK όρασης, το LFM2.5-VL-3B μέσο όρο 69,4, μια βελτίωση 12 πόντων πάνω από το 57,2 του προκατόχου και εντός 0,7 πόντων του μεγαλύτερου 4,7-δισεκατομμυρίων παραμέτρων Qwen3.5-4B. Το μέσο όρο κρύβει πραγματική υφή, αν και: το μοντέλο είναι πίσω από τους αντιπάλους του σε ορισμένες γενικές σουίτες και χάνει έδαφος στο CountBenchQA, που πέφτει από 92,2 σε 87,3.

Τι το Μοντέλο Αφήνει Ε故意 Εκτός

Το LFM2.5-VL-3B είναι ένα μοντέλο μη λογικής. Απαντάει άμεσα αντί να γεννάει μια ενδιάμεση αλυσίδα σκέψης, μια σχεδιαστική επιλογή που η Liquid AI περιγράφει ως βελτίωση της καθυστέρησης: η κάρτα μοντέλου συνιστά να χρησιμοποιηθεί για “μονό-στροφή, υψηλής απόδοσης, χαμηλής καθυστέρησης εργασίες”, ονομάζοντας την近-πραγματική ανίχνευση αντικειμένων για αυτοκινητικές εφαρμογές,批 OCR σαρωμένων εγγράφων και την 翻譯 μενού και οδικών σημάτων ως προοριζόμενες εργασίες.

Η ίδια κάρτα δηλώνει σαφώς τι το μοντέλο δεν είναι για. “Δεν συνιστάται για μακροπρόθεσμες, reasoning-εντατικές εργασίες, όπως η οπτική σχεδίαση ιστοσελίδων ή η απάντηση σε高度 τεχνικές ερωτήσεις σχετικά με μπλουπρίντ”. Η μήκος контекstu είναι 32.768 tokens, και η κάρτα σημαίνει ότι η μορφή OCR layout-annotation είναι πειραματική, προειδοποιώντας ότι “μπορεί να αλλάξει, μπορεί να είναι αξιόπιστη και μπορεί να μην είναι εύκολο να αναλυθεί”. Αυτά είναι οι δικοί τους περιορισμοί, και σηματοδοτούν το πού σταματούν οι αξιολογήσεις.

Τα νούμερα ταχύτητας που στηρίζουν την έκδοση προέρχονται από αυτή τη σχεδιαστική επιλογή. Η Liquid AI αναφέρει ταχύτητες αποκωδικοποίησης 228 tokens ανά δευτερόλεπτο σε ένα Apple M5 Max και 116 tokens ανά δευτερόλεπτο σε ένα AMD Ryzen AI Max+ 395, σε περίπου 3 GB μνήμης, και 20 tokens ανά δευτερόλεπτο σε ένα Galaxy S26 Ultra. Σε ένα μονό NVIDIA H100, η εταιρεία μετράει τον χρόνο πρώτου token σε περίπου 34 χιλιοστά του δευτερολέπτου σε ένα βίντεο κλιπ πέντε καρέ, έναντι περίπου 200 χιλιοστών του δευτερολέπτου για τα μοντέλα Gemma, και την απόδοση εξόδου κοντά στα 11.000 tokens ανά δευτερόλεπτο σε υψηλή σύγκλιση, που λέει ότι προστίθεται σε σχεδόν ένα δισεκατομμύριο εξόδου tokens την ημέρα σε μια κάρτα.

Το LFM2.5-VL-3B με Αριθμούς

  • 3,1 δισεκατομμύρια παραμέτρους; 34 τρισεκατομμύρια προ-εκπαιδευμένα tokens; 32.768-token контекст
  • 69,4 μέσο όρο σε 28 βENCHMARK όρασης, έναντι 57,2 για το LFM2-VL-3B
  • 80,7 μέσο όρο στο ScreenSpot-v2 κατανόηση οθόνης, από singledigits στο προηγούμενο μοντέλο
  • 87,9 ακρίβεια RefCOCO ερμηνείας, από 57,1
  • 59,5 στο ToolSandbox κλήση λειτουργιών, από 26,4
  • 228 tokens/s αποκωδικοποίηση στο Apple M5 Max; 20 tokens/s στο Galaxy S26 Ultra; περίπου 3 GB αποτύπωση μνήμης
  • Περίπου 11.000 εξόδου tokens/s σε υψηλή σύγκλιση σε ένα μονό H100

Τι Συνοδεύει το LFM2.5-VL-3B

Οι βαρύτητες είναι διαθέσιμες τώρα από το Hugging Face με άδεια ανοικτών βαρύτητων, με quantized εξαγωγές σε GGUF, ONNX και MLX μορφές και υποστήριξη ημέρας-μίας σε llama.cpp, MLX, vLLM, SGLang και ONNX runtimes. Ένα WebGPU demo τρέχει το μοντέλο ολόκληρο στο πρόγραμμα περιήγησης, και η εταιρεία καταγράφει 16 υποστηριζόμενες γλώσσες, συμπεριλαμβανομένων των αγγλικών, αραβικών, κινεζικών, ιαπωνικών και ινδικών.

Η έκδοση συμπληρώνει την οικογένεια LFM2.5 που η Liquid AI έχει συναρμολογήσει κατά τη δεύτερη helf του 2026: το LFM2.5-2.6B μοντέλο κειμένου στις 4 Αυγούστου 2026, παραλλαγές κωδικοποιητή για μακροπρόθεσμες CPU inference στα τέλη Ιουλίου 2026, και τώρα το flagship μοντέλο όρασης, που ακολουθεί τις μικρότερες LFM2.5-VL-1.6B και 450M παραλλαγές. Σημειώσεις fine-tuning και τεκμηρίωση πλοηγούνται μαζί με τις βαρύτητες, ώστε το μοντέλο να μπορεί να προσαρμοστεί σε συγκεκριμένες εργασίες ερμηνείας, OCR ή κλήσης λειτουργιών από την πρώτη ημέρα.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.