Modelos e plataformas de IA
Qwen3.8-Flash-Next Antecipando a Arquitetura Qwen4 com 6 B de Parâmetros Ativos

Qwen3.8-Flash-Next Antecipando a Arquitetura Qwen4 com Atenção Híbrida e 6 B de Parâmetros Ativos
A equipe Qwen da Alibaba lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026, um modelo experimental de peso aberto que antecipa a arquitetura destinada a sustentar o Qwen4. O modelo possui 125 B de parâmetros, mas ativa apenas 6 B por token, configuração que a equipe descreve como um passo rumo ao que chamam de eficiência de custo definitiva.
O lançamento é o primeiro modelo público construído com esse design. O cartão do modelo Qwen3.8-Flash-Next descreve-o como um modelo de linguagem causal com codificador de visão, treinado tanto em pré‑treinamento quanto em pós‑treinamento, e indica um comprimento de contexto nativo de 262.144 tokens, extensível a 1 milhão. O cartão posiciona o modelo como um passo concreto de eficiência, em vez de um destaque de capacidade: a preocupação declarada da equipe é como as escolhas arquiteturais afetam o custo de inferência em escala, particularmente à medida que cargas de trabalho agentes com contextos longos se tornam o caso de uso dominante.
Atenção Híbrida, Resíduos Portados e Embeddings de N‑Gram
A arquitetura baseia‑se em quatro mudanças declaradas. A primeira é um esquema de atenção híbrida reformulado. Modelos híbridos anteriores da Qwen combinavam Gated DeltaNet com Gated Attention; o Qwen3.8-Flash-Next substitui este último por Qwen Sparse Attention, ou QSA, que opera ao nível de micro‑blocos em vez de selecionar tokens individuais. O cartão afirma que isso reduz significativamente a latência em contextos longos. O modelo organiza suas 48 camadas em um padrão repetitivo: três blocos de Gated DeltaNet alimentando uma camada de mixture‑of‑experts, seguidos por um bloco QSA alimentando outra camada de mixture‑of‑experts, repetido doze vezes.
A segunda mudança é um mecanismo de resíduo portado que modula a informação que flui por fluxos residuais ampliados usando um portão de leitura elemento a elemento, dependente dos dados, e um portão de escrita escalar por ramo. O cartão apresenta isso como forma de obter expressividade mais granular entre as camadas, preservando a estabilidade do treinamento e mantendo a sobrecarga de inferência baixa.
A terceira é uma camada de embedding de n‑gramas. Em vez de escalar parâmetros por meio de especialistas adicionais, o modelo adiciona 51 B de parâmetros em um embedding separado indexado por bigramas e trigramas curtos na camada 2. A equipe descreve isso como um eixo de escalonamento de parâmetros que requer menos computação que mixture‑of‑experts e é mais adequado para descarregamento em aceleradores com memória limitada. O cartão também observa uma camada de predição multi‑token de 4 B de parâmetros treinada com múltiplas etapas.
A quarta é a própria receita de treinamento. Os otimizadores Muon e AdamW são aplicados a categorias específicas de pesos, e a equipe afirma que eliminou os aquecimentos tradicionais de tamanho de lote em favor de iniciar diretamente no tamanho de lote alvo, guiado por leis de escalonamento recalibradas. Isso, segundo o cartão, reduz substancialmente o número total de passos do otimizador enquanto permite taxas de aprendizado maiores.
Benchmarks Reportados pelos Fornecedores e o Que Eles Medem
O cartão apresenta resultados de benchmarks comparando o Qwen3.8-Flash-Next com Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 e Claude-Opus-4.6 (Max). Esses são números reportados pelos fornecedores, avaliados nos próprios harnesses da equipe, devendo ser interpretados como tal. Em codificação agente, o cartão indica uma pontuação DeepSWE 1.1 de 58,7 contra 42,2 para o Qwen3.8-27B e 54,4 para o DeepSeek-V4-Flash, com a ressalva de que o DeepSWE foi executado com dois harnesses (Claude Code e mini‑SWE‑agent) e a maior pontuação entre ambos foi reportada. No SWE‑bench Pro, o Qwen3.8-Flash-Next obtém 62,5, à frente do Qwen3.8-27B com 61,7 e do Qwen3.7-Plus com 55,8, com todos os modelos reavaliados em uma versão refinada do benchmark após a equipe corrigir o que chamam de tarefas problemáticas.
O padrão que importa é a alegação de eficiência, não um número isolado. O cartão indica 125 B de parâmetros totais com 6 B ativados, contra 397 B totais e 17 B ativados para o Qwen3.7-Plus. No quesito conhecimento geral, o modelo registra uma pontuação GPQA Diamond de 91,7, uma pontuação LiveCodeBench v6 de 91,9 e uma pontuação HLE de 35,9 avaliada pelo GPT‑4o em vez do avaliador padrão do benchmark. O cartão é transparente quanto a essas escolhas, o que supera o que muitas versões oferecem, embora continuem sendo decisões do fornecedor.
Disponibilidade e o Caminho para o Qwen4
O Qwen3.8-Flash-Next está disponível agora no Hugging Face sob a licença qwen-community-1.0, com pesos em BF16 totalizando aproximadamente 180 B de parâmetros entre o modelo de linguagem, o embedding de n‑gramas e a camada de predição multi‑token. O cartão recomenda implantação via SGLang, vLLM ou TokenSpeed, e observa que o Qwen3.8-Flash — a contraparte orientada à produção construída a partir desta pré‑visualização com contexto padrão de 1 M de tokens e ferramentas integradas oficiais — é a versão destinada ao uso de API gerenciada através do Qwen Cloud.
O rótulo “Next” é o indicativo. A equipe enquadra explicitamente isso como uma pré‑visualização experimental da arquitetura que sustentará o Qwen4, situando‑o na mesma categoria de lançamentos anteriores da Qwen que testaram direções de design antes de um ciclo de flagship. Seja este design específico a base do Qwen4 ou um ramo que a equipe abandone posteriormente, o lançamento documenta onde um grande laboratório está apostando sua eficiência.












