AI 모델 및 플랫폼
Qwen3.8-Flash-Next, 6B 활성 파라미터와 함께 Qwen4 아키텍처 미리 보기

Qwen3.8-Flash-Next, 하이브리드 어텐션 및 6B 활성 파라미터로 Qwen4 아키텍처 미리 보기
알리바바의 Qwen 팀은 2026년 8월 26일에 Qwen3.8-Flash-Next를 공개했습니다. 이는 Qwen4의 기반이 될 아키텍처를 미리 보여주는 오픈 웨이트 실험 모델입니다. 이 모델은 1250억 파라미터를 보유하지만 토큰당 60억 파라미터만 활성화하며, 팀은 이를 궁극적인 비용 효율성을 향한 단계라고 설명합니다.
이번 공개는 이 설계 기반으로 만든 최초의 공개 모델입니다. Qwen3.8-Flash-Next 모델 카드는 이를 비전 인코더를 갖춘 인과 언어 모델이라고 설명하고, 사전 학습과 사후 학습을 모두 거쳤으며, 기본 컨텍스트 길이가 262,144 토큰이고 100만 토큰까지 확장 가능하다고 명시합니다. 카드에서는 이 모델을 기능 플래그십이라기보다 구체적인 효율성 단계로 위치짓고 있습니다. 팀이 강조하는 바는 아키텍처 선택이 대규모 추론 비용에 어떤 영향을 미치는가이며, 특히 긴 컨텍스트를 필요로 하는 에이전트형 워크로드가 주요 사용 사례가 되고 있다는 점입니다.
하이브리드 어텐션, 게이트형 잔차, 그리고 N-그램 임베딩
이 아키텍처는 네 가지 주요 변경 사항을 기반으로 합니다. 첫 번째는 재설계된 하이브리드 어텐션 방식입니다. 이전 Qwen 하이브리드 모델은 게이트형 DeltaNet과 게이트형 어텐션을 결합했지만, Qwen3.8-Flash-Next는 후자를 Qwen Sparse Attention(QSA)으로 대체했습니다. QSA는 개별 토큰을 선택하는 대신 마이크로 블록 수준에서 작동합니다. 카드에 따르면 이는 장기 컨텍스트 지연 시간을 크게 감소시킨다고 합니다. 모델은 48개의 레이어를 반복 패턴으로 구성합니다: 게이트형 DeltaNet 세 블록이 혼합 전문가 레이어에 연결되고, 그 뒤에 하나의 QSA 블록이 또 다른 혼합 전문가 레이어에 연결되는 구조가 12번 반복됩니다.
두 번째 변경은 확대된 잔차 스트림을 통해 흐르는 정보를 요소별이며 데이터에 의존하는 읽기 게이트와 분기별 스칼라 쓰기 게이트로 조절하는 게이트형 잔차 메커니즘입니다. 카드에서는 이를 레이어 전반에 걸쳐 보다 세밀한 표현력을 확보하면서도 학습 안정성을 유지하고 추론 오버헤드를 낮추는 방법으로 제시합니다.
세 번째는 n-그램 임베딩 레이어입니다. 추가 전문가를 통해 파라미터를 확장하는 대신, 모델은 2번째 레이어에서 짧은 바이그램과 트라이그램을 인덱스로 하는 별도 임베딩에 510억 파라미터를 추가합니다. 팀은 이를 전문가 혼합보다 계산량이 적고 메모리 제한 가속기에 오프로드하기에 더 적합한 파라미터 스케일링 축이라고 설명합니다. 카드에는 또한 다단계 학습으로 훈련된 40억 파라미터의 다중 토큰 예측 레이어가 있다고 명시되어 있습니다.
네 번째는 훈련 레시피 자체입니다. Muon과 AdamW 옵티마이저를 특정 가중치 카테고리에 적용했으며, 팀은 전통적인 배치 크기 워밍업을 없애고 재조정된 스케일링 법칙에 따라 목표 배치 크기에서 바로 시작했다고 밝혔습니다. 카드에 따르면 이는 전체 옵티마이저 단계 수를 크게 줄이면서도 더 큰 학습률을 지원한다고 합니다.
벤더 보고 벤치마크 및 측정 항목
카드는 Qwen3.8-Flash-Next를 Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, 그리고 Claude-Opus-4.6 (Max)와 비교한 벤치마크 결과를 보고합니다. 이는 벤더가 자체 하네스를 사용해 평가한 수치이며, 그렇게 이해해야 합니다. 에이전트형 코딩에서는 DeepSWE 1.1 점수가 58.7로, Qwen3.8-27B의 42.2와 DeepSeek-V4-Flash의 54.4보다 높습니다. 단, DeepSWE는 Claude Code와 mini-SWE-agent 두 가지 하네스로 실행되었으며, 두 결과 중 최고 점수가 보고되었습니다. SWE-bench Pro에서는 Qwen3.8-Flash-Next가 62.5점을 받아 Qwen3.8-27B(61.7)와 Qwen3.7-Plus(55.8)보다 앞섰으며, 팀이 문제라고 판단한 작업을 수정한 후 개선된 벤치마크 버전으로 모든 모델을 재평가했습니다.
중요한 패턴은 개별 수치가 아니라 효율성 주장입니다. 카드에는 전체 파라미터 1250억 중 60억이 활성화된 것으로, Qwen3.7-Plus는 전체 3970억 중 170억이 활성화된다고 나와 있습니다. 일반 지식 분야에서는 모델이 GPQA Diamond에서 91.7점, LiveCodeBench v6에서 91.9점, 그리고 기본 채점자가 아닌 GPT-4o가 평가한 HLE에서 35.9점을 기록했습니다. 카드에서는 이러한 선택을 투명하게 밝히고 있으며, 이는 많은 릴리스가 제공하는 것보다 자세하지만, 결국 벤더가 선택한 사항임을 강조합니다.
가용성 및 Qwen4 로드맵
Qwen3.8-Flash-Next는 현재 Hugging Face에서 qwen-community-1.0 라이선스로 제공되며, 언어 모델, n-그램 임베딩, 다중 토큰 예측 레이어에 걸쳐 약 1800억 파라미터를 BF16 형식으로 포함하고 있습니다. 카드에서는 SGLang, vLLM 또는 TokenSpeed를 통한 배포를 권장하고 있으며, 기본 100만 토큰 컨텍스트와 공식 내장 도구를 갖춘 생산 지향 버전인 Qwen3.8-Flash가 Qwen Cloud를 통한 관리형 API 사용을 위한 버전이라고 명시합니다.
“Next” 라벨이 이를 나타냅니다. 팀은 이를 Qwen4의 기반이 될 아키텍처에 대한 실험적 미리 보기로 명확히 제시하고 있으며, 이는 주요 플래그십 사이클 이전에 설계 방향을 시험했던 이전 Qwen 릴리스와 같은 범주에 속합니다. 이 설계가 Qwen4의 기반이 될지, 혹은 팀이 나중에 포기할 분기점이 될지는 두고 봐야 하지만, 이번 릴리스는 한 주요 연구실이 효율성에 베팅하고 있는 위치를 문서화하고 있습니다.












