AI-modeller och plattformar
Qwen3.8-Flash-Next förhandsvisar Qwen4-arkitektur med 6B aktiva parametrar

Qwen3.8-Flash-Next förhandsvisar Qwen4-arkitektur med hybriduppmärksamhet och 6B aktiva parametrar
Alibabas Qwen‑team släppte Qwen3.8-Flash-Next den 26 augusti 2026, en öppen‑vikt experimentell modell som förhandsvisar den arkitektur som är avsedd att ligga till grund för Qwen4. Modellen har 125 B parametrar men aktiverar endast 6 B per token, en konfiguration som teamet beskriver som ett steg mot vad de kallar ultimat kostnadseffektivitet.
Utgåvan är den första offentliga modellen byggd på denna design. Qwen3.8-Flash-Next-modellkortet beskriver den som en kausal språkmodell med en bildkodare, tränad både genom förträning och efterträning, och anger en inbyggd kontextlängd på 262 144 token som kan utökas till 1 miljon. Kortet placerar modellen som ett konkret steg mot effektivitet snarare än ett kapacitetsflaggskepp: teamets uttalade oro är hur arkitekturbeslut påverkar inferenskostnaden i stor skala, särskilt när agentbaserade arbetsbelastningar med långa kontexter blir det dominerande användningsfallet.
Hybriduppmärksamhet, styrda residualer och n‑gram‑inbäddningar
Arkitekturen bygger på fyra angivna förändringar. Den första är ett omarbetat hybriduppmärksamhetsschema. Tidigare Qwen‑hybridmodeller kombinerade Gated DeltaNet med Gated Attention; Qwen3.8-Flash-Next ersätter den senare med Qwen Sparse Attention, eller QSA, som arbetar på mikrobbloksnivå snarare än att välja enskilda token. Kortet påstår att detta reducerar latensen för långa kontexter avsevärt. Modellen organiserar sina 48 lager i ett återkommande mönster: tre block av Gated DeltaNet som matas in i ett mixture‑of‑experts‑lager, följt av ett QSA‑block som matas in i ett mixture‑of‑experts‑lager, upprepat tolv gånger.
Den andra förändringen är en styrd residualmekanism som reglerar information som flödar genom utökade residualströmmar med en element‑vis, datadriven läsgate och en per‑gren skalär skrivgate. Kortet presenterar detta som ett sätt att uppnå finare uttrycksfullhet över lagren samtidigt som träningsstabiliteten bevaras och inferensöverhead hålls låg.
Den tredje är ett n‑gram‑inbäddningslager. Istället för att skala parametrar via ytterligare experter lägger modellen till 51 B parametrar i en separat inbäddning som indexeras av korta bigram och trigram i lager 2. Teamet beskriver detta som en axel för parameter‑skalning som kräver mindre beräkning än mixture‑of‑experts och som är mer lämplig för avlastning till minnesbegränsade acceleratorer. Kortet noterar också ett 4 B‑parameter multi‑token‑förutsägelselager tränat med flera steg.
Den fjärde är själva träningsreceptet. Optimerarna Muon och AdamW appliceras på specifika viktkategorier, och teamet uppger att de eliminerade traditionella uppvärmningar av batch‑storlek till förmån för att börja direkt med mål‑batch‑storleken, styrda av omkalibrerade skalningslagar. Detta, enligt kortet, minskar avsevärt det totala antalet optimeringssteg samtidigt som större inlärningshastigheter stödjs.
Leverantörsrapporterade prestandamätningar och vad de mäter
Kortet rapporterar benchmarkresultat som jämför Qwen3.8-Flash-Next med Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 och Claude-Opus-4.6 (Max). Detta är leverantörsrapporterade siffror, utvärderade på teamets egna testbäddar, och de bör läsas som sådana. För agentbaserad kodning listar kortet ett DeepSWE 1.1‑resultat på 58,7 jämfört med 42,2 för Qwen3.8-27B och 54,4 för DeepSeek-V4-Flash, med förbehållet att DeepSWE kördes med två testbäddar (Claude Code och mini‑SWE‑agent) och det högsta resultatet av båda rapporterades. På SWE‑bench Pro får Qwen3.8-Flash-Next 62,5, framför Qwen3.8-27B med 61,7 och Qwen3.7-Plus med 55,8, där alla modeller omvärderades på en förfinad version av benchmarken efter att teamet korrigerat vad de kallar problematiska uppgifter.
Det mönster som är av betydelse är effektivitetspåståendet, inte någon enskild siffra. Kortet listar 125 B totala parametrar med 6 B aktiverade, jämfört med 397 B totalt och 17 B aktiverade för Qwen3.7-Plus. På allmänkunskapsfronten visar modellen ett GPQA Diamond‑resultat på 91,7, ett LiveCodeBench v6‑resultat på 91,9 och ett HLE‑resultat på 35,9 bedömt av GPT‑4o snarare än benchmarkens standardbedömare. Kortet är transparent kring dessa val, vilket är mer än många releaser erbjuder, men de förblir val som leverantören gjort.
Tillgänglighet och vägen till Qwen4
Qwen3.8-Flash-Next är nu tillgänglig på Hugging Face under licensen qwen-community-1.0, med vikter i BF16 som sammanlagt uppgår till cirka 180 B parametrar över språkmodellen, n‑gram‑inbäddning och multi‑token‑förutsägelselager. Kortet rekommenderar distribution via SGLang, vLLM eller TokenSpeed, och noterar att Qwen3.8-Flash — den produktionsinriktade motsvarigheten byggd på denna förhandsvisning med en standardkontext på 1 M token och officiella inbyggda verktyg — är versionen avsedd för hanterad API‑användning via Qwen Cloud.
Etiketten ”Next” är ledtråden. Teamet presenterar detta uttryckligen som en experimentell förhandsvisning av den arkitektur som kommer att ligga till grund för Qwen4, vilket placerar den i samma kategori som tidigare Qwen‑utgåvor som testade designriktningar före en flaggskepps‑cykel. Oavsett om just denna design blir Qwen4:s fundament eller en gren som teamet senare överger, dokumenterar releasen var ett stort laboratorium satsar sina effektivitetshandlingar.












