एआई मॉडल और प्लेटफ़ॉर्म

Qwen3.8-Flash-Next Qwen4 आर्किटेक्चर को 6B सक्रिय पैरामीटरों के साथ पूर्वावलोकन करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Qwen3.8-Flash-Next पूर्वावलोकन करता है Qwen4 आर्किटेक्चर को हाइब्रिड अटेंशन और 6B सक्रिय पैरामीटरों के साथ

अलीबाबा की Qwen टीम ने 26 अगस्त 2026 को Qwen3.8-Flash-Next जारी किया, एक ओपन‑वेट प्रयोगात्मक मॉडल जो Qwen4 को आधार देने के लिए नियोजित आर्किटेक्चर का पूर्वावलोकन करता है। इस मॉडल में 125B पैरामीटर हैं लेकिन प्रत्येक टोकन पर केवल 6B सक्रिय होते हैं, एक विन्यास जिसे टीम अंतिम लागत‑कुशलता की दिशा में एक कदम के रूप में प्रस्तुत करती है।

यह रिलीज़ इस डिजाइन पर निर्मित पहला सार्वजनिक मॉडल है। Qwen3.8-Flash-Next मॉडल कार्ड इसे एक कारणात्मक भाषा मॉडल के रूप में वर्णित करता है जिसमें विज़न एन्कोडर है, जिसे पूर्व‑प्रशिक्षण और पश्च‑प्रशिक्षण दोनों के माध्यम से प्रशिक्षित किया गया है, और मूल संदर्भ लंबाई 262,144 टोकन बताता है जिसे 1 मिलियन तक विस्तारित किया जा सकता है। कार्ड मॉडल को एक ठोस दक्षता कदम के रूप में रखता है न कि क्षमता का प्रमुख मॉडल: टीम की मुख्य चिंता यह है कि आर्किटेक्चरल विकल्प बड़े पैमाने पर अनुमान लागत को कैसे प्रभावित करते हैं, विशेष रूप से जब लंबी संदर्भ वाली एजेंटिक कार्यभार प्रमुख उपयोग केस बनते हैं।

हाइब्रिड अटेंशन, गेटेड रेजिडुअल्स, और N-ग्राम एम्बेडिंग्स

आर्किटेक्चर चार घोषित परिवर्तनों पर आधारित है। पहला है पुनः डिज़ाइन किया गया हाइब्रिड अटेंशन स्कीम। पिछले Qwen हाइब्रिड मॉडलों ने गेटेड डेल्टा नेट को गेटेड अटेंशन के साथ जोड़ा था; Qwen3.8-Flash-Next बाद वाले को Qwen स्पार्स अटेंशन (QSA) से बदलता है, जो व्यक्तिगत टोकन चुनने के बजाय माइक्रो‑ब्लॉक स्तर पर कार्य करता है। कार्ड का दावा है कि यह लंबी‑संदर्भ लेटेंसी को काफी घटाता है। मॉडल अपने 48 लेयरों को दोहराव वाले पैटर्न में व्यवस्थित करता है: गेटेड डेल्टा नेट के तीन ब्लॉक मिश्रित‑विशेषज्ञ लेयर में फीड होते हैं, इसके बाद एक QSA ब्लॉक मिश्रित‑विशेषज्ञ लेयर में फीड होता है, यह प्रक्रिया बारह बार दोहराई जाती है।

दूसरा परिवर्तन एक गेटेड रेजिडुअल तंत्र है जो विस्तारित रेजिडुअल स्ट्रीम्स में प्रवाहित जानकारी को तत्व‑स्तरीय, डेटा‑निर्भर रीड गेट और प्रति‑शाखा स्केलर राइट गेट का उपयोग करके मॉड्यूलेट करता है। कार्ड इसे लेयरों के बीच अधिक सूक्ष्म अभिव्यक्ति प्राप्त करने का तरीका बताता है, साथ ही प्रशिक्षण स्थिरता को बनाए रखता है और अनुमान ओवरहेड को कम रखता है।

तीसरा है एक n-gram एम्बेडिंग लेयर। अतिरिक्त विशेषज्ञों के माध्यम से पैरामीटर स्केलिंग करने के बजाय, मॉडल लेयर 2 में छोटे बाइग्राम और ट्राइग्राम द्वारा अनुक्रमित एक अलग एम्बेडिंग में 51B पैरामीटर जोड़ता है। टीम इसे पैरामीटर स्केलिंग के लिए एक अक्ष के रूप में वर्णित करती है जो मिश्रित‑विशेषज्ञों की तुलना में कम गणना की मांग करता है और मेमोरी‑सीमित एक्सेलेरेटरों को ऑफलोड करने के लिए अधिक उपयुक्त है। कार्ड यह भी नोट करता है कि 4B पैरामीटर वाला मल्टी‑टोकन प्रेडिक्शन लेयर मल्टी‑स्टेप्स के साथ प्रशिक्षित किया गया है।

चौथा परिवर्तन स्वयं प्रशिक्षण विधि है। Muon और AdamW ऑप्टिमाइज़र को विशिष्ट वजन वर्गों पर लागू किया जाता है, और टीम कहती है कि इसने पारंपरिक बैच‑साइज़ वार्म‑अप को समाप्त कर सीधे लक्ष्य बैच साइज़ से शुरू किया, जो पुनः फिटेड स्केलिंग नियमों द्वारा निर्देशित है। कार्ड के अनुसार, यह कुल ऑप्टिमाइज़र चरणों को काफी कम करता है जबकि बड़े लर्निंग रेट्स का समर्थन करता है।

विक्रेता-रिपोर्टेड बेंचमार्क और उनका मापदंड

कार्ड बेंचमार्क परिणाम रिपोर्ट करता है जो Qwen3.8-Flash-Next की तुलना Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, और Claude-Opus-4.6 (Max) से करता है। ये विक्रेता‑रिपोर्टेड आंकड़े हैं, जो टीम के अपने हार्नेस पर मूल्यांकित किए गए हैं, और इन्हें उसी रूप में पढ़ा जाना चाहिए। एजेंटिक कोडिंग पर, कार्ड DeepSWE 1.1 स्कोर 58.7 दिखाता है, जबकि Qwen3.8-27B के लिए 42.2 और DeepSeek‑V4‑Flash के लिए 54.4 है, यह ध्यान रखते हुए कि DeepSWE दो हार्नेस (Claude Code और mini‑SWE‑agent) के साथ चलाया गया था और दोनों में से उच्चतम स्कोर रिपोर्ट किया गया। SWE‑bench Pro पर, Qwen3.8‑Flash‑Next का स्कोर 62.5 है, जो Qwen3.8‑27B के 61.7 और Qwen3.7‑Plus के 55.8 से आगे है, सभी मॉडलों को टीम द्वारा समस्याग्रस्त कार्यों को सुधारने के बाद बेंचमार्क के परिष्कृत संस्करण पर पुनः मूल्यांकित किया गया।

महत्वपूर्ण पैटर्न दक्षता दावा है, न कि कोई एकल संख्या। कार्ड कुल 125B पैरामीटर बताता है जिसमें 6B सक्रिय हैं, जबकि Qwen3.7‑Plus के लिए कुल 397B और 17B सक्रिय हैं। सामान्य ज्ञान पक्ष में, मॉडल ने GPQA डायमंड स्कोर 91.7, LiveCodeBench v6 स्कोर 91.9, और HLE स्कोर 35.9 प्राप्त किया, जो GPT‑4o द्वारा मूल्यांकित है न कि बेंचमार्क के डिफ़ॉल्ट ग्रेडर द्वारा। कार्ड इन विकल्पों के बारे में पारदर्शी है, जो कई रिलीज़ों से अधिक है, लेकिन ये अभी भी विक्रेता द्वारा किए गए विकल्प हैं।

उपलब्धता और Qwen4 की राह

Qwen3.8‑Flash‑Next अब Hugging Face पर qwen‑community‑1.0 लाइसेंस के तहत उपलब्ध है, जिसमें भाषा मॉडल, n‑gram एम्बेडिंग और मल्टी‑टोकन प्रेडिक्शन लेयर में लगभग 180B पैरामीटर BF16 वेट्स हैं। कार्ड SGLang, vLLM, या TokenSpeed के माध्यम से डिप्लॉयमेंट की सलाह देता है, और यह नोट करता है कि Qwen3.8‑Flash — इस पूर्वावलोकन पर निर्मित उत्पादन‑उन्मुख समकक्ष, जिसमें डिफ़ॉल्ट 1M‑टोकन संदर्भ और आधिकारिक बिल्ट‑इन टूल्स हैं — वह संस्करण है जिसे Qwen Cloud के माध्यम से प्रबंधित API उपयोग के लिए इरादा किया गया है।

“Next” लेबल यह संकेत देता है। टीम स्पष्ट रूप से इसे Qwen4 को आधार देने वाली आर्किटेक्चर का एक प्रयोगात्मक पूर्वावलोकन बताती है, जो इसे पहले के Qwen रिलीज़ों के समान श्रेणी में रखता है जिन्होंने प्रमुख चक्र से पहले डिजाइन दिशा का परीक्षण किया था। चाहे यह विशिष्ट डिजाइन Qwen4 की नींव बन जाए या टीम बाद में इसे छोड़ दे, यह रिलीज़ दस्तावेज़ करता है कि एक प्रमुख लैब अपनी दक्षता की शर्तें कहाँ लगा रही है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।