Μοντέλα και πλατφόρμες AI

Liquid AI κυκλοφορεί το LFM2.5-DSpark για έως και 3,2× ταχύτερη απόδοση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Liquid AI κυκλοφόρησε σημεία ελέγχου (checkpoints) προσχεδίου για τρία μοντέλα της σειράς LFM2.5 στις 20 Αυγούστου 2026, αναφέροντας κέρδη απόδοσης έως και 3,18× σε μία μόνο GPU H100 και έως και 2,87× σε MacBook με πυρήνα Apple‑silicon, χωρίς καμία αλλαγή στα αποτελέσματα του μοντέλου. Η έκδοση LFM2.5-DSpark περιλαμβάνει προσχεδία για τα LFM2.5-1.2B-Instruct, LFM2.5-2.6B και το mixture‑of‑experts LFM2.5-8B‑A1B, καθένα από τα οποία προσθέτει περίπου 300 εκατομμύρια παραμέτρους προσχεδίου πάνω από το στόχο μοντέλο.

Τα checkpoints διανέμονται σε μορφές Safetensors και GGUF με υποστήριξη από την πρώτη ημέρα στο llama.cpp και στο SGLang, και οι δύο ενσωματώσεις συνεισφέρθηκαν upstream στους επίσημους κώδικες. Επειδή η υποθετική αποκωδικοποίηση εκδίδει μόνο διακριτικά που έχει επαληθεύσει το μοντέλο‑στόχος, η εταιρεία δηλώνει ότι το παραγόμενο κείμενο είναι ταυτόσημο με αυτό που θα παρήγαγε το μοντέλο‑στόχος μόνο του υπό greedy decoding, επομένως η ακρίβεια του benchmark παραμένει αμετάβλητη.

Οι μετρήσεις της Liquid AI, που εκτελέστηκαν με batch size 1 και θερμοκρασία 0 σε πέντε σύνολα δεδομένων, έδωσαν μέση επιτάχυνση για το LFM2.5-2.6B 2,67× σε H100 (από 323 σε 864 διακριτικά ανά δευτερόλεπτο) και 2,27× σε MacBook Pro M4 Max (από 61 σε 139 διακριτικά ανά δευτερόλεπτο). Το μεγαλύτερο μεμονωμένο αποτέλεσμα προήλθε από το LFM2.5-8B-A1B στο MATH500, όπου η απόδοση στο H100 αυξήθηκε 3,18×, από 428 σε 1.362 διακριτικά ανά δευτερόλεπτο. Η εταιρεία αναφέρει επίσης ότι το DSpark μείωσε τη λανθάνοντα χρόνο κλήσης λειτουργιών κατά 57 % κατά μέσο όρο για το LFM2.5-2.6B σε σενάρια πολλαπλών εργαλείων, το κύριο αποτέλεσμα για τις εργασίες on‑device που στοχεύει η σειρά LFM2.5.

Πώς το DSpark Επιταχύνει την Αποκωδικοποίηση

Η φάση αποκωδικοποίησης στην εκτέλεση LLM είναι περιορισμένη από τη μνήμη: το μεγαλύτερο μέρος της καθυστέρησης προέρχεται από τη ροή βαρών από τη DRAM στη μνήμη του chip αντί για την ίδια την υπολογιστική διαδικασία, γι’ αυτό η οικονομία της εκτέλεσης έχει γίνει το κεντρικό τεχνικό πρόβλημα του πεδίου.

Η υποθετική αποκωδικοποίηση αντιμετωπίζει αυτό το ζήτημα χρησιμοποιώντας ένα μικρό μοντέλο προσχεδίου που προτείνει ένα μπλοκ υποψήφιων διακριτικών, έπειτα επαληθεύει ολόκληρο το μπλοκ σε μία προώθηση του μοντέλου‑στόχου, διανέμοντας το κόστος φόρτωσης των βαρών σε κάθε διακριτικό που ελέγχεται.

Το DSpark, που παρουσιάστηκε σε ένα άρθρο του Ιουλίου 2026 από ερευνητές της DeepSeek και ενσωματώθηκε στο σύστημα εξυπηρέτησης DeepSeek‑V4 της εταιρείας, συνδυάζει τρία στοιχεία: ένα παράλληλο πυρήνα που παράγει κρυφές καταστάσεις για όλα τα διακριτικά προσχεδίου σε μία μόνο διέλευση, μια ελαφριά διαδοχική κεφαλή που μοντελοποιεί τις εξαρτήσεις μεταξύ γειτονικών διακριτικών ώστε τα ποσοστά αποδοχής να μην μειώνονται στο τέλος του μπλοκ, και έναν επαληθευτή με χρονοδιάγραμμα εμπιστοσύνης που αποκόπτει κατάληξες χαμηλής εμπιστοσύνης όταν η επαλήθευσή τους κοστίζει περισσότερο από ό,τι εξοικονομεί. Στην παραγωγική υλοποίηση της DeepSeek, το άρθρο αναφέρει επιταχύνσεις παραγωγής ανά χρήστη 60‑85 % σε σχέση με το προηγούμενο baseline MTP‑1 με ίση απόδοση.

Οι δημιουργοί προσχεδίου της Liquid AI ακολουθούν αυτή τη συνταγή με ένα απλοποιημένο σχεδιασμό μόνο με προσοχή: πέντε στρώματα, μέγεθος μπλοκ εννέα διακριτικών προσχεδίου ανά βήμα, και κεφαλή Markov πάνω σε λεξιλόγιο 128.000 διακριτικών, σύμφωνα με την κάρτα μοντέλου LFM2.5-2.6B-DSpark. Κάθε δημιουργός εκπαιδεύτηκε για 15 εποχές σε συνδυασμό επιβλεπόμενης εκπαίδευσης, συνομιλίας, κώδικα και δεδομένων κλήσης λειτουργιών, με το checkpoint να επιλέγεται βάσει του υψηλότερου ποσοστού αποδοχής αντί του χαμηλότερου loss. Η εγγύηση ακρίβειας εξασφαλίζει την ποιότητα: «Η υποθετική αποκωδικοποίηση είναι ακριβής: το μοντέλο‑στόχος επαληθεύει κάθε προτεινόμενο διακριτικό, έτσι η greedy έξοδος ισούται με αυτή του μοντέλου‑στόχου μόνο του», δηλώνει η κάρτα μοντέλου GGUF, με χρονομετρήσεις ανά απόκριση που αποκαλύπτουν πόσα διακριτικά προσχεδίου προτάθηκαν και αποδεχθήκαν.

LFM2.5-DSpark σε Αριθμούς

  • 3.18x — η καλύτερη αναφερθέντα επιτάχυνση GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
  • 2.87x — η καλύτερη αναφερθέντα επιτάχυνση on‑device (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2.67x / 2.27x — μέσες επιταχύνσεις H100 / M4 Max για LFM2.5-2.6B σε πέντε σύνολα δεδομένων
  • 57%: μέση μείωση του λανθάνοντος χρόνου κλήσης λειτουργιών για το LFM2.5-2.6B σε σενάρια πολλαπλών εργαλείων
  • 295.7M–327.7M (παράμετροι μοντέλου προσχεδίου, έναντι στόχων 1.2B έως 8B)
  • 4.81 of 10, μέσο αριθμό αποδεκτών διακριτικών προσχεδίου ανά βήμα για το LFM2.5-2.6B με μέγεθος μπλοκ 9

Πού οι Αναφερθέντες Επιταχύνσεις Μειώνονται

Οι δικοί πίνακες της Liquid AI δείχνουν ότι τα κέρδη είναι άνιχα, και η εταιρεία εξηγεί τους λόγους. Για το LFM2.5-8B-A1B, η βελτίωση on‑device είναι κατά μέσο όρο μόνο 1,18× παρά τις υψηλότερες αποδοχές αποδοχής των τριών μοντέλων, ένα χάσμα που η εταιρεία αποδίδει στην τρέχουσα υλοποίηση mixture‑of‑exets στο Metal backend του llama.cpp και στην επιπλέον κίνηση βαρών που ενεργοποιείται κατά την επαλήθευση ενός μπλοκ διακριτικών μεταξύ των experts. Για το LFM2.5-1.2B-Instruct, τα ποσοστά αποδοχής διαφέρουν αρκετά ανά σύνολο δεδομένων, ώστε η επιτάχυνση να κυμαίνεται έως και 52 % ανάλογα με την κατανομή κειμένου, από 1,66× στο MT‑Bench έως 2,56× στο MATH500 στο H100.

Όλα τα στοιχεία είναι αναφορές του προμηθευτή από το δικό τους harness της Liquid AI: SGLang σε ένα H100 80 GB σε BF16 για αριθμούς GPU, llama.cpp με πειραματικούς πυρήνες Metal σε M4 Max με βάρη FP16 GGUF για αριθμούς on‑device, περιορισμένα στα 256 διακριτικά εξόδου. Η διαδρομή SGLang απαιτεί μια κατασκευή με υποστήριξη DSpark για στόχους LFM2, και η διαδρομή llama.cpp απαιτεί την αντίστοιχη κατασκευή, έτσι οι επιταχύνσεις εξαρτώνται από αυτές τις ενσωματώσεις αντί για τη διανομή σε σταθερή έκδοση οποιουδήποτε κινητήρα.

Η Προσπάθεια On‑Device της Liquid AI Μέχρι Σήμερα

Η έκδοση DSpark είναι η τρίτη ενημέρωση της σειράς LFM2.5 μέσα σε λίγο περισσότερο από μία εβδομάδα. Στις 12 Αυγούστου 2026, η εταιρεία κυκλοφόρησε το LFM2.5-VL-3B, ένα μοντέλο όρασης‑γλώσσας για το edge, και στις 19 Αυγούστου 2026 δημοσίευσε checkpoints Q4_0 με γνώση κβαντοποίησης για τη σειρά. Το κοινό νήμα είναι το ίδιο: η εταιρεία δηλώνει ότι η επιτάχυνση DSpark του μοντέλου 2.6B σε MacBook ωθεί την αλληλεπιδραστικότητα πέρα από την απόδοση που προσφέρουν τα περισσότερα ιδιόκτητα cloud μοντέλα, τα οποία εκτιμούνται περίπου στα 140 διακριτικά ανά δευτερόλεπτο.

Όλοι οι τρεις δημιουργοί προσχεδίου είναι διαθέσιμοι τώρα στο Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark, και LFM2.5-8B-A1B-DSpark, με κατασκευές GGUF παράλληλα για υλοποιήσεις llama.cpp.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.