Modele și platforme AI
Qwen3.8-Flash-Next prezintă arhitectura Qwen4 cu 6B parametri activi

Qwen3.8-Flash-Next prezintă arhitectura Qwen4 cu atenție hibridă și 6B parametri activi
Echipa Qwen de la Alibaba a lansat Qwen3.8-Flash-Next pe 26 august 2026, un model experimental cu greutăţi deschise care prezintă arhitectura destinată să susțină Qwen4. Modelul are 125 B parametri, dar activează doar 6 B per token, o configurație pe care echipa o descrie ca un pas spre ceea ce numește eficiență maximă a costurilor.
Această lansare este primul model public construit pe acest design. Fișa modelului Qwen3.8-Flash-Next îl descrie ca un model de limbaj cauzal cu un codor vizual, antrenat atât în pre‑antrenare, cât și în post‑antrenare, și enumeră o lungime nativă a contextului de 262.144 de tokeni, extensibilă la 1 milion. Fișa poziționează modelul ca un pas concret spre eficiență, nu ca un flagship al capabilităților: preocuparea echipei este cum alegerile arhitecturale influențează costul inferenței la scară, în special pe măsură ce sarcinile agentice cu contexte lungi devin cazul de utilizare dominant.
Atenție hibridă, reziduuri gated și încorporări N‑Gram
Arhitectura se bazează pe patru modificări declarate. Prima este o schemă de atenție hibridă reconcepută. Modelele hibrid Qwen anterioare combinau Gated DeltaNet cu Gated Attention; Qwen3.8-Flash-Next înlocuiește aceasta din urmă cu Qwen Sparse Attention, sau QSA, care operează la nivel de micro‑bloc în loc să selecteze tokeni individuali. Fișa susține că aceasta reduce semnificativ latența în contexte lungi. Modelul organizează cele 48 de straturi într-un model repetitiv: trei blocuri de Gated DeltaNet care alimentează un strat de tip mixture‑of‑experts, urmate de un bloc QSA care alimentează un alt strat mixture‑of‑experts, repetat de douăsprezece ori.
A doua schimbare este un mecanism de reziduuri gated care modulează informația ce circulă prin fluxuri reziduale lărgite, utilizând o poartă de citire element‑wise, dependentă de date, și o poartă de scriere scalară pe ramură. Fișa prezintă aceasta ca o metodă de a obține o expresivitate mai fină la nivelul straturilor, păstrând stabilitatea antrenamentului și menținând costul inferenței scăzut.
A treia este un strat de încorporare n‑gram. În loc să scaleze parametrii prin experți suplimentari, modelul adaugă 51 B parametri într-o încorporare separată indexată pe bigrame și trigrame scurte în stratul 2. Echipa descrie aceasta ca un ax pentru scalarea parametrilor care necesită mai puțină calcul decât mixture‑of‑experts și este mai potrivit pentru descărcarea pe acceleratoare cu memorie limitată. Fișa menționează, de asemenea, un strat de predicție multi‑token de 4 B parametri antrenat cu pași multipli.
A patra este rețeta de antrenament în sine. Optimizatorii Muon și AdamW sunt aplicați pe categorii specifice de greutăţi, iar echipa afirmă că a eliminat încălzirea tradițională a dimensiunii lotului în favoarea începerii direct la dimensiunea de lot țintă, ghidată de legi de scalare refăcute. Conform fișei, aceasta reduce substanțial numărul total de pași ai optimizatorului, permițând în același timp rate de învățare mai mari.
Benchmarks raportate de furnizori și ce măsoară acestea
Fișa raportează rezultate de benchmark comparând Qwen3.8-Flash-Next cu Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 și Claude-Opus-4.6 (Max). Acestea sunt cifre raportate de furnizori, evaluate pe propriile platforme ale echipei, și trebuie interpretate în consecință. Pentru programarea agentică, fișa enumeră un scor DeepSWE 1.1 de 58,7 comparativ cu 42,2 pentru Qwen3.8-27B și 54,4 pentru DeepSeek-V4-Flash, cu mențiunea că DeepSWE a fost rulat cu două platforme (Claude Code și mini‑SWE‑agent) și s-a raportat cel mai mare scor dintre cele două. Pentru SWE‑bench Pro, Qwen3.8-Flash-Next obține 62,5, depășind Qwen3.8-27B cu 61,7 și Qwen3.7-Plus cu 55,8, toate modelele fiind re‑evaluate pe o versiune rafinată a benchmark‑ului după ce echipa a corectat ceea ce numește sarcini problematice.
Modelul de interes este reclama de eficiență, nu un singur număr. Fișa enumeră 125 B parametri în total, cu 6 B activați, versus 397 B în total și 17 B activați pentru Qwen3.7-Plus. În zona cunoștințelor generale, modelul afișează un scor GPQA Diamond de 91,7, un scor LiveCodeBench v6 de 91,9 și un scor HLE de 35,9 evaluat de GPT‑4o în loc de evaluatorul implicit al benchmark‑ului. Fișa este transparentă în privința acestor alegeri, ceea ce depășește multe alte lansări, însă rămân decizii luate de furnizor.
Disponibilitate și drumul spre Qwen4
Qwen3.8-Flash-Next este disponibil acum pe Hugging Face sub licența qwen-community-1.0, cu greutăţi în BF16 totalizând aproximativ 180 B parametri în modelul de limbaj, încorporarea n‑gram și stratul de predicție multi‑token. Fișa recomandă implementarea prin SGLang, vLLM sau TokenSpeed și menționează că Qwen3.8-Flash — contrapartea orientată spre producție construită pe această previzualizare, cu un context implicit de 1 M de tokeni și instrumente oficiale integrate — este versiunea destinată utilizării API gestionate prin Qwen Cloud.
Eticheta „Next” este indiciul. Echipa încadrează explicit aceasta ca o previzualizare experimentală a arhitecturii care va susține Qwen4, plasând-o în aceeași categorie cu lansările Qwen anterioare care au testat direcții de design înainte de un ciclu flagship. Indiferent dacă acest design specific va deveni fundația Qwen4 sau o ramură pe care echipa o va abandona ulterior, lansarea documentează unde un laborator important își plasează pariurile pe eficiență.












