Modely a platformy AI
Qwen3.8-Flash-Next představuje architekturu Qwen4 se 6 B aktivními parametry

Qwen3.8-Flash-Next představuje architekturu Qwen4 s hybridní pozorností a 6 B aktivními parametry
Tým Qwen společnosti Alibaba vydal Qwen3.8-Flash-Next dne 26. srpna 2026, experimentální model s otevřenou vahou, který představuje architekturu určenou pro Qwen4. Model má 125 B parametrů, ale při zpracování tokenu aktivuje pouze 6 B, což tým označuje jako krok směrem k tomu, co nazývá maximální úspornost nákladů.
Jedná se o první veřejně dostupný model postavený na tomto návrhu. Karta modelu Qwen3.8-Flash-Next ho popisuje jako kauzální jazykový model s vizuálním enkodérem, trénovaný jak předtrénováním, tak následným trénováním, a uvádí nativní délku kontextu 262 144 tokenů, rozšiřitelnou na 1 milion. Karta staví model jako konkrétní krok ke zvýšení efektivity, nikoli jako vlajkový produkt schopností: tým upozorňuje na to, jak architektonické volby ovlivňují náklady na inferenci ve velkém měřítku, zejména když se agenturní úlohy s dlouhými kontexty stávají dominantním případem použití.
Hybridní pozornost, řízené reziduály a n‑gramové vkládání
Architektura spočívá ve čtyřech uvedených změnách. První je přepracovaný schéma hybridní pozornosti. Předchozí hybridní modely Qwen kombinovaly Gated DeltaNet s Gated Attention; Qwen3.8-Flash-Next nahrazuje druhý Qwen Sparse Attention (QSA), který funguje na úrovni mikro‑bloku místo výběru jednotlivých tokenů. Karta tvrdí, že tím výrazně snižuje latenci při dlouhých kontextech. Model uspořádává svých 48 vrstev do opakujícího se vzoru: tři bloky Gated DeltaNet vstupují do vrstvy mixture‑of‑experts, následovaný jedním blokem QSA, který také vstupuje do vrstvy mixture‑of‑experts, a to celkem dvanáctkrát.
Druhou změnou je řízený reziduální mechanismus, který moduluje informace protékající rozšířenými reziduálními toky pomocí elementárního, na datech závislého čtecího brány a větvovité skalární zápisové brány. Karta to představuje jako způsob, jak získat jemnější vyjádření napříč vrstvami při zachování stability tréninku a nízkých nákladů na inferenci.
Třetí změnou je vrstva n‑gramových vkládání. Místo škálování parametrů pomocí dalších expertů model přidává 51 B parametrů v samostatném vkládání indexovaném krátkými bigramy a trigramy ve vrstvě 2. Tým to popisuje jako osu pro škálování parametrů, která vyžaduje méně výpočtů než mixture‑of‑experts a je lépe přizpůsobitelná odkládání na akcelerátory s omezenou pamětí. Karta také uvádí 4 B‑parametrovou vrstvu pro predikci více tokenů trénovanou více kroky.
Čtvrtou změnou je samotný tréninkový recept. Optimalizátory Muon a AdamW jsou aplikovány na konkrétní kategorie vah a tým uvádí, že tím eliminoval tradiční rozběh velikosti batchů ve prospěch okamžitého zahájení s cílovou velikostí batchu, řízeného přepočtenými zákony škálování. Podle karty to podstatně snižuje celkový počet kroků optimalizátoru a zároveň umožňuje vyšší učební rychlosti.
Výsledky benchmarků uváděné dodavatelem a co měří
Karta uvádí výsledky benchmarků, kde Qwen3.8-Flash-Next soutěží s Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 a Claude-Opus-4.6 (Max). Jedná se o údaje uváděné dodavatelem, vyhodnocené na vlastních testovacích sadách týmu, a tak by měly být interpretovány. V oblasti agenturního kódování karta uvádí skóre DeepSWE 1.1 ve výši 58,7 oproti 42,2 u Qwen3.8-27B a 54,4 u DeepSeek-V4-Flash, s upozorněním, že DeepSWE byl spuštěn se dvěma testovacími sadami (Claude Code a mini‑SWE‑agent) a bylo uvedeno nejvyšší skóre z obou. V benchmarku SWE‑bench Pro dosahuje Qwen3.8-Flash-Next 62,5, před Qwen3.8-27B s 61,7 a Qwen3.7-Plus s 55,8, přičemž všechny modely byly po opravě takzvaných problematických úloh přehodnoceny na vylepšené verzi benchmarku.
Vzor, který je podstatný, je tvrzení o efektivitě, nikoli jednotlivé číslo. Karta uvádí celkem 125 B parametrů s 6 B aktivními, oproti 397 B celkem a 17 B aktivním u Qwen3.7-Plus. V oblasti obecné znalosti model dosahuje skóre GPQA Diamond 91,7, LiveCodeBench v6 91,9 a HLE 35,9, hodnocené GPT‑4o místo výchozího hodnotitele benchmarku. Karta je ohledně těchto voleb transparentní, což je více než u mnoha vydání, ale stále jde o rozhodnutí, která učinil dodavatel.
Dostupnost a cesta k Qwen4
Qwen3.8-Flash-Next je nyní k dispozici na Hugging Face pod licencí qwen-community-1.0, s vahami v BF16 o celkovém objemu přibližně 180 B parametrů zahrnujících jazykový model, n‑gramové vkládání a vrstvu predikce více tokenů. Karta doporučuje nasazení přes SGLang, vLLM nebo TokenSpeed a uvádí, že Qwen3.8-Flash – produkčně orientovaná verze postavená na tomto náhledu s výchozím kontextem 1 M tokenů a oficiálními vestavěnými nástroji – je určena pro řízené využití API prostřednictvím Qwen Cloud.
Štítek „Next“ to naznačuje. Tým to výslovně představuje jako experimentální náhled na architekturu, která bude tvořit základ Qwen4, čímž ji řadí do stejné kategorie jako předchozí vydání Qwen, která testovala designové směry před hlavní sérií. Ať už se tento konkrétní návrh stane základem Qwen4, nebo jej tým později opustí, vydání dokumentuje, kam jedno významné laboratoř sáze na efektivitu.












