AI 모델 및 플랫폼

Qwen3.8-Flash-Next, 6B 활성 파라미터와 함께 Qwen4 아키텍처 미리 보기

mm
Unite.AI를 Google의 선호 소스에 추가

Qwen3.8-Flash-Next, 하이브리드 어텐션 및 6B 활성 파라미터로 Qwen4 아키텍처 미리 보기

알리바바의 Qwen 팀은 2026년 8월 26일에 Qwen3.8-Flash-Next를 공개했습니다. 이는 Qwen4의 기반이 될 아키텍처를 미리 보여주는 오픈 웨이트 실험 모델입니다. 이 모델은 1250억 파라미터를 보유하지만 토큰당 60억 파라미터만 활성화하며, 팀은 이를 궁극적인 비용 효율성을 향한 단계라고 설명합니다.

이번 공개는 이 설계 기반으로 만든 최초의 공개 모델입니다. Qwen3.8-Flash-Next 모델 카드는 이를 비전 인코더를 갖춘 인과 언어 모델이라고 설명하고, 사전 학습과 사후 학습을 모두 거쳤으며, 기본 컨텍스트 길이가 262,144 토큰이고 100만 토큰까지 확장 가능하다고 명시합니다. 카드에서는 이 모델을 기능 플래그십이라기보다 구체적인 효율성 단계로 위치짓고 있습니다. 팀이 강조하는 바는 아키텍처 선택이 대규모 추론 비용에 어떤 영향을 미치는가이며, 특히 긴 컨텍스트를 필요로 하는 에이전트형 워크로드가 주요 사용 사례가 되고 있다는 점입니다.

하이브리드 어텐션, 게이트형 잔차, 그리고 N-그램 임베딩

이 아키텍처는 네 가지 주요 변경 사항을 기반으로 합니다. 첫 번째는 재설계된 하이브리드 어텐션 방식입니다. 이전 Qwen 하이브리드 모델은 게이트형 DeltaNet과 게이트형 어텐션을 결합했지만, Qwen3.8-Flash-Next는 후자를 Qwen Sparse Attention(QSA)으로 대체했습니다. QSA는 개별 토큰을 선택하는 대신 마이크로 블록 수준에서 작동합니다. 카드에 따르면 이는 장기 컨텍스트 지연 시간을 크게 감소시킨다고 합니다. 모델은 48개의 레이어를 반복 패턴으로 구성합니다: 게이트형 DeltaNet 세 블록이 혼합 전문가 레이어에 연결되고, 그 뒤에 하나의 QSA 블록이 또 다른 혼합 전문가 레이어에 연결되는 구조가 12번 반복됩니다.

두 번째 변경은 확대된 잔차 스트림을 통해 흐르는 정보를 요소별이며 데이터에 의존하는 읽기 게이트와 분기별 스칼라 쓰기 게이트로 조절하는 게이트형 잔차 메커니즘입니다. 카드에서는 이를 레이어 전반에 걸쳐 보다 세밀한 표현력을 확보하면서도 학습 안정성을 유지하고 추론 오버헤드를 낮추는 방법으로 제시합니다.

세 번째는 n-그램 임베딩 레이어입니다. 추가 전문가를 통해 파라미터를 확장하는 대신, 모델은 2번째 레이어에서 짧은 바이그램과 트라이그램을 인덱스로 하는 별도 임베딩에 510억 파라미터를 추가합니다. 팀은 이를 전문가 혼합보다 계산량이 적고 메모리 제한 가속기에 오프로드하기에 더 적합한 파라미터 스케일링 축이라고 설명합니다. 카드에는 또한 다단계 학습으로 훈련된 40억 파라미터의 다중 토큰 예측 레이어가 있다고 명시되어 있습니다.

네 번째는 훈련 레시피 자체입니다. Muon과 AdamW 옵티마이저를 특정 가중치 카테고리에 적용했으며, 팀은 전통적인 배치 크기 워밍업을 없애고 재조정된 스케일링 법칙에 따라 목표 배치 크기에서 바로 시작했다고 밝혔습니다. 카드에 따르면 이는 전체 옵티마이저 단계 수를 크게 줄이면서도 더 큰 학습률을 지원한다고 합니다.

벤더 보고 벤치마크 및 측정 항목

카드는 Qwen3.8-Flash-Next를 Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, 그리고 Claude-Opus-4.6 (Max)와 비교한 벤치마크 결과를 보고합니다. 이는 벤더가 자체 하네스를 사용해 평가한 수치이며, 그렇게 이해해야 합니다. 에이전트형 코딩에서는 DeepSWE 1.1 점수가 58.7로, Qwen3.8-27B의 42.2와 DeepSeek-V4-Flash의 54.4보다 높습니다. 단, DeepSWE는 Claude Code와 mini-SWE-agent 두 가지 하네스로 실행되었으며, 두 결과 중 최고 점수가 보고되었습니다. SWE-bench Pro에서는 Qwen3.8-Flash-Next가 62.5점을 받아 Qwen3.8-27B(61.7)와 Qwen3.7-Plus(55.8)보다 앞섰으며, 팀이 문제라고 판단한 작업을 수정한 후 개선된 벤치마크 버전으로 모든 모델을 재평가했습니다.

중요한 패턴은 개별 수치가 아니라 효율성 주장입니다. 카드에는 전체 파라미터 1250억 중 60억이 활성화된 것으로, Qwen3.7-Plus는 전체 3970억 중 170억이 활성화된다고 나와 있습니다. 일반 지식 분야에서는 모델이 GPQA Diamond에서 91.7점, LiveCodeBench v6에서 91.9점, 그리고 기본 채점자가 아닌 GPT-4o가 평가한 HLE에서 35.9점을 기록했습니다. 카드에서는 이러한 선택을 투명하게 밝히고 있으며, 이는 많은 릴리스가 제공하는 것보다 자세하지만, 결국 벤더가 선택한 사항임을 강조합니다.

가용성 및 Qwen4 로드맵

Qwen3.8-Flash-Next는 현재 Hugging Face에서 qwen-community-1.0 라이선스로 제공되며, 언어 모델, n-그램 임베딩, 다중 토큰 예측 레이어에 걸쳐 약 1800억 파라미터를 BF16 형식으로 포함하고 있습니다. 카드에서는 SGLang, vLLM 또는 TokenSpeed를 통한 배포를 권장하고 있으며, 기본 100만 토큰 컨텍스트와 공식 내장 도구를 갖춘 생산 지향 버전인 Qwen3.8-Flash가 Qwen Cloud를 통한 관리형 API 사용을 위한 버전이라고 명시합니다.

“Next” 라벨이 이를 나타냅니다. 팀은 이를 Qwen4의 기반이 될 아키텍처에 대한 실험적 미리 보기로 명확히 제시하고 있으며, 이는 주요 플래그십 사이클 이전에 설계 방향을 시험했던 이전 Qwen 릴리스와 같은 범주에 속합니다. 이 설계가 Qwen4의 기반이 될지, 혹은 팀이 나중에 포기할 분기점이 될지는 두고 봐야 하지만, 이번 릴리스는 한 주요 연구실이 효율성에 베팅하고 있는 위치를 문서화하고 있습니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.