Μοντέλα και πλατφόρμες AI
Qwen3.8-Flash-Next Προεπισκόπηση της Αρχιτεκτονικής Qwen4 με 6B Ενεργές Παραμέτρους

Qwen3.8-Flash-Next προεπισκόπηση της αρχιτεκτονικής Qwen4 με υβριδική προσοχή και 6B ενεργές παραμέτρους
Η ομάδα Qwen της Alibaba κυκλοφόρησε το Qwen3.8-Flash-Next στις 26 Αυγούστου 2026, ένα πειραματικό μοντέλο ανοιχτού βάρους που προεπισκοπεί την αρχιτεκτονική που προορίζεται να στηρίξει το Qwen4. Το μοντέλο διαθέτει 125B παραμέτρους, αλλά ενεργοποιεί μόνο 6B ανά token, μια διαμόρφωση που η ομάδα παρουσιάζει ως βήμα προς αυτό που αποκαλεί τελική αποδοτικότητα κόστους.
Η κυκλοφορία είναι το πρώτο δημόσιο μοντέλο που χτίστηκε πάνω σε αυτό το σχέδιο. Η κάρτα μοντέλου Qwen3.8-Flash-Next το περιγράφει ως ένα αιτιολογικό μοντέλο γλώσσας με κωδικοποιητή όρασης, εκπαιδευμένο τόσο στην προ-εκπαίδευση όσο και στην μετα-εκπαίδευση, και αναφέρει εγγενές μήκος περιβάλλοντος 262,144 tokens επεκτάσιμο σε 1 εκατομμύριο. Η κάρτα τοποθετεί το μοντέλο ως ένα συγκεκριμένο βήμα αποδοτικότητας αντί για μια σημαία ικανότητας: η ανησυχία της ομάδας είναι πώς οι αρχιτεκτονικές επιλογές επηρεάζουν το κόστος εκτέλεσης σε κλίμακα, ιδιαίτερα καθώς τα εργασιακά σενάρια με μακρά περιβάλλοντα γίνονται η κυρίαρχη χρήση.
Υβριδική Προσοχή, Κλειδωμένα Υπόλοιπα και Ενσωματώσεις N-gram
Η αρχιτεκτονική βασίζεται σε τέσσερις δηλωμένες αλλαγές. Η πρώτη είναι ένα ανασχεδιασμένο σχήμα υβριδικής προσοχής. Προηγούμενα υβριδικά μοντέλα Qwen συνδύαζαν το Gated DeltaNet με την Gated Attention· το Qwen3.8-Flash-Next αντικαθιστά το τελευταίο με το Qwen Sparse Attention, ή QSA, το οποίο λειτουργεί σε επίπεδο μικρο-μπλοκ αντί να επιλέγει μεμονωμένα tokens. Η κάρτα ισχυρίζεται ότι αυτό μειώνει σημαντικά τη λανθάνοντα καθυστέρηση σε μακρά περιβάλλοντα. Το μοντέλο οργανώνει τις 48 στρώσεις του σε επαναλαμβανόμενο μοτίβο: τρία μπλοκ Gated DeltaNet που τροφοδοτούν μια στρώση mixture-of-experts, ακολουθούμενα από ένα μπλοκ QSA που τροφοδοτεί μια στρώση mixture-of-experts, επαναλαμβανόμενα δώδεκα φορές.
Η δεύτερη αλλαγή είναι ένας μηχανισμός κλειδωμένων υπολειμμάτων που διαμορφώνει την πληροφορία που ρέει μέσω διευρυμένων ροών υπολειμμάτων χρησιμοποιώντας μια στοιχειώδη, εξαρτώμενη από τα δεδομένα πύλη ανάγνωσης και μια κλιμακωτή πύλη εγγραφής ανά κλάδο. Η κάρτα παρουσιάζει αυτό ως τρόπο να αποκτήσει πιο λεπτομερή εκφραστικότητα μεταξύ των στρώσεων, διατηρώντας τη σταθερότητα της εκπαίδευσης και κρατώντας το κόστος εκτέλεσης χαμηλό.
Η τρίτη είναι μια στρώση ενσωμάτωσης n-gram. Αντί να κλιμακώνει τις παραμέτρους μέσω επιπλέον ειδικών, το μοντέλο προσθέτει 51B παραμέτρους σε ξεχωριστή ενσωμάτωση που ευρετηριάζεται από σύντομες διγράμματα και τρίγραμμα στη στρώση 2. Η ομάδα το περιγράφει ως άξονα κλιμάκωσης παραμέτρων που απαιτεί λιγότερους υπολογισμούς από το mixture-of-experts και είναι πιο κατάλληλο για μεταφορά σε επιταχυντές με περιορισμένη μνήμη. Η κάρτα σημειώνει επίσης μια στρώση πρόβλεψης πολλαπλών tokens με 4B παραμέτρους, εκπαιδευμένη με πολλαπλά βήματα.
Η τέταρτη είναι η ίδια η συνταγή εκπαίδευσης. Οι βελτιστοποιητές Muon και AdamW εφαρμόζονται σε συγκεκριμένες κατηγορίες βαρών, και η ομάδα δηλώνει ότι εξαλείφει τις παραδοσιακές προθέρμανσεις μεγέθους batch υπέρ της άμεσης εκκίνησης στο στόχο batch size, καθοδηγούμενη από επαναπροσαρμοσμένους νόμους κλιμάκωσης. Αυτό, σύμφωνα με την κάρτα, μειώνει σημαντικά το συνολικό αριθμό βημάτων του βελτιστοποιητή ενώ υποστηρίζει μεγαλύτερους ρυθμούς εκμάθησης.
Δεδομένα Benchmark από Πωλητές και Τι Μετράνε
Η κάρτα αναφέρει τα αποτελέσματα benchmark συγκρίνοντας το Qwen3.8-Flash-Next με τα Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 και Claude-Opus-4.6 (Max). Πρόκειται για αριθμούς που αναφέρουν οι πωλητές, αξιολογημένα με τα δικά τους εργαλεία, και πρέπει να διαβαστούν ως τέτοια. Στον τομέα του agentic coding, η κάρτα παραθέτει βαθμολογία DeepSWE 1.1 ίση με 58.7 έναντι 42.2 για το Qwen3.8-27B και 54.4 για το DeepSeek-V4-Flash, με την προειδοποίηση ότι το DeepSWE εκτελέστηκε με δύο εργαλεία (Claude Code και mini-SWE-agent) και αναφέρθηκε η υψηλότερη βαθμολογία και των δύο. Στο SWE-bench Pro, το Qwen3.8-Flash-Next σημειώνει 62.5, μπροστά από το Qwen3.8-27B με 61.7 και το Qwen3.7-Plus με 55.8, με όλα τα μοντέλα να επανεκτιμώνται σε μια βελτιωμένη έκδοση του benchmark μετά τη διόρθωση των λεγόμενων προβληματικών εργασιών από την ομάδα.
Το μοτίβο που μετράει είναι η αξίωση αποδοτικότητας, όχι ένας μεμονωμένος αριθμός. Η κάρτα αναφέρει συνολικά 125B παραμέτρους με 6B ενεργοποιημένες, έναντι 397B συνολικών και 17B ενεργοποιημένων για το Qwen3.7-Plus. Στον τομέα της γενικής γνώσης, το μοντέλο παρουσιάζει βαθμολογία GPQA Diamond 91.7, βαθμολογία LiveCodeBench v6 91.9, και βαθμολογία HLE 35.9 αξιολογημένη από το GPT-4o αντί για τον προεπιλεγμένο βαθμολογητή του benchmark. Η κάρτα είναι διαφανής σχετικά με αυτές τις επιλογές, κάτι που είναι περισσότερο από ό,τι προσφέρουν πολλές κυκλοφορίες, αλλά παραμένουν επιλογές που έκανε ο πωλητής.
Διαθεσιμότητα και ο Δρόμος προς το Qwen4
Το Qwen3.8-Flash-Next είναι διαθέσιμο τώρα στο Hugging Face υπό την άδεια qwen-community-1.0, με βάρη σε BF16 που συνολικά ανέρχονται σε περίπου 180B παραμέτρους μεταξύ του μοντέλου γλώσσας, της ενσωμάτωσης n-gram και της στρώσης πρόβλεψης πολλαπλών tokens. Η κάρτα προτείνει την ανάπτυξη μέσω SGLang, vLLM ή TokenSpeed, και σημειώνει ότι το Qwen3.8-Flash — η παραγωγική εκδοχή που βασίζεται σε αυτήν την προεπισκόπηση με προεπιλεγμένο περιβάλλον 1M-token και επίσημα ενσωματωμένα εργαλεία — είναι η έκδοση που προορίζεται για διαχειριζόμενη χρήση API μέσω του Qwen Cloud.
Η ετικέτα «Next» είναι το σήμα. Η ομάδα το θέτει ρητά ως πειραματική προεπισκόπηση της αρχιτεκτονικής που θα στηρίξει το Qwen4, τοποθετώντας το στην ίδια κατηγορία με προηγούμενες κυκλοφορίες Qwen που δοκίμασαν σχεδιαστικές κατευθύνσεις πριν από έναν κύκλο σημαίας. Είτε αυτή η συγκεκριμένη σχεδίαση θα γίνει το θεμέλιο του Qwen4 είτε θα είναι ένας κλάδος που η ομάδα θα εγκαταλείψει αργότερα, η κυκλοφορία τεκμηριώνει πού ένα σημαντικό εργαστήριο τοποθετεί τα στοιχήματά του στην αποδοτικότητα.












