Modelos y plataformas de IA
Qwen3.8-Flash-Next muestra la arquitectura de Qwen4 con 6 B de parámetros activos

Qwen3.8-Flash-Next muestra la arquitectura de Qwen4 con atención híbrida y 6 B de parámetros activos
El equipo Qwen de Alibaba lanzó Qwen3.8-Flash-Next el 26 de agosto de 2026, un modelo experimental de peso abierto que muestra la arquitectura destinada a sustentar Qwen4. El modelo tiene 125 B de parámetros, pero activa solo 6 B por token, una configuración que el equipo presenta como un paso hacia lo que denomina la máxima eficiencia de costos.
Este lanzamiento es el primer modelo público construido con este diseño. La tarjeta del modelo Qwen3.8-Flash-Next lo describe como un modelo de lenguaje causal con un codificador de visión, entrenado tanto en pre‑entrenamiento como en post‑entrenamiento, y enumera una longitud de contexto nativa de 262 144 tokens, extensible a 1 millón. La tarjeta sitúa el modelo como un paso concreto de eficiencia más que como un buque insignia de capacidad: la preocupación declarada del equipo es cómo las decisiones arquitectónicas afectan el costo de inferencia a gran escala, particularmente a medida que las cargas de trabajo agente con contextos extensos se convierten en el caso de uso dominante.
Atención híbrida, residuos con compuerta y incrustaciones n‑grama
La arquitectura se basa en cuatro cambios declarados. El primero es un esquema de atención híbrida revisado. Los modelos híbridos anteriores de Qwen combinaban Gated DeltaNet con Gated Attention; Qwen3.8-Flash-Next sustituye este último por Qwen Sparse Attention, o QSA, que opera a nivel de micro‑bloque en lugar de seleccionar tokens individuales. La tarjeta afirma que esto reduce significativamente la latencia en contextos largos. El modelo organiza sus 48 capas en un patrón repetitivo: tres bloques de Gated DeltaNet que alimentan una capa de mezcla de expertos, seguidos de un bloque QSA que alimenta otra capa de mezcla de expertos, repitiendo el conjunto doce veces.
El segundo cambio es un mecanismo residual con compuerta que modula la información que fluye a través de flujos residuales ampliados mediante una compuerta de lectura elemento a elemento, dependiente de los datos, y una compuerta de escritura escalar por rama. La tarjeta presenta esto como una forma de obtener una expresividad más granular entre capas, al tiempo que preserva la estabilidad del entrenamiento y mantiene bajo el sobrecoste de inferencia.
El tercero es una capa de incrustación n‑grama. En lugar de escalar los parámetros mediante expertos adicionales, el modelo añade 51 B de parámetros en una incrustación separada indexada por bigramas y trigramas cortos en la capa 2. El equipo lo describe como un eje para escalar parámetros que requiere menos cómputo que la mezcla de expertos y es más apto para delegarse a aceleradores con memoria limitada. La tarjeta también señala una capa de predicción multi‑token de 4 B de parámetros entrenada con múltiples pasos.
El cuarto es la propia receta de entrenamiento. Los optimizadores Muon y AdamW se aplican a categorías específicas de pesos, y el equipo afirma que eliminó los calentamientos tradicionales de tamaño de lote en favor de comenzar directamente con el tamaño de lote objetivo, guiados por leyes de escalado reajustadas. Esto, según la tarjeta, reduce sustancialmente el número total de pasos del optimizador mientras permite tasas de aprendizaje mayores.
Puntos de referencia reportados por el proveedor y lo que miden
La tarjeta informa resultados de benchmarks comparando Qwen3.8-Flash-Next con Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 y Claude-Opus-4.6 (Max). Estas son cifras reportadas por el proveedor, evaluadas con los propios harnesses del equipo, y deben interpretarse como tales. En codificación agente, la tarjeta muestra una puntuación DeepSWE 1.1 de 58,7 frente a 42,2 para Qwen3.8-27B y 54,4 para DeepSeek-V4-Flash, con la advertencia de que DeepSWE se ejecutó con dos harnesses (Claude Code y mini‑SWE‑agent) y se reportó la puntuación más alta de ambos. En SWE‑bench Pro, Qwen3.8-Flash-Next obtiene 62,5, superando a Qwen3.8-27B con 61,7 y a Qwen3.7-Plus con 55,8, con todos los modelos reevaluados en una versión refinada del benchmark después de que el equipo corrigiera lo que denomina tareas problemáticas.
El patrón que importa es la afirmación de eficiencia, no un número aislado. La tarjeta indica 125 B de parámetros totales con 6 B activados, frente a 397 B totales y 17 B activados para Qwen3.7-Plus. En el ámbito de conocimiento general, el modelo registra una puntuación GPQA Diamond de 91,7, una puntuación LiveCodeBench v6 de 91,9 y una puntuación HLE de 35,9 evaluada por GPT‑4o en lugar del evaluador predeterminado del benchmark. La tarjeta es transparente respecto a estas decisiones, lo que supera lo que ofrecen muchas publicaciones, pero siguen siendo decisiones del proveedor.
Disponibilidad y el camino hacia Qwen4
Qwen3.8-Flash-Next está disponible ahora en Hugging Face bajo la licencia qwen-community-1.0, con pesos en BF16 que suman aproximadamente 180 B de parámetros entre el modelo de lenguaje, la incrustación n‑grama y la capa de predicción multi‑token. La tarjeta recomienda desplegarlo a través de SGLang, vLLM o TokenSpeed, y señala que Qwen3.8-Flash — la contraparte orientada a producción construida sobre esta vista previa con un contexto predeterminado de 1 M de tokens y herramientas oficiales integradas — es la versión destinada al uso de API gestionada mediante Qwen Cloud.
La etiqueta “Next” lo dice todo. El equipo enmarca explícitamente esto como una vista previa experimental de la arquitectura que sustentará Qwen4, lo que lo sitúa en la misma categoría que versiones anteriores de Qwen que probaron direcciones de diseño antes de un ciclo de buque insignia. Tanto si este diseño específico se convierte en la base de Qwen4 como si se trata de una rama que el equipo abandone más adelante, el lanzamiento documenta dónde un laboratorio importante está apostando por la eficiencia.












