Mô hình và nền tảng AI

Qwen3.8-Flash-Next Xem Trước Kiến Trúc Qwen4 Với 6B Tham Số Được Kích Hoạt

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Qwen3.8-Flash-Next Xem Trước Kiến Trúc Qwen4 Với Chú Ý Hỗn Hợp và 6B Tham Số Được Kích Hoạt

Nhóm Qwen của Alibaba đã phát hành Qwen3.8-Flash-Next vào ngày 26 tháng 8 năm 2026, một mô hình thử nghiệm mở trọng lượng, nhằm xem trước kiến trúc dự kiến sẽ làm nền tảng cho Qwen4. Mô hình này có 125 tỷ tham số nhưng chỉ kích hoạt 6 tỷ mỗi token, cấu hình mà nhóm mô tả là một bước tiến hướng tới cái mà họ gọi là hiệu quả chi phí tối ưu.

Bản phát hành này là mô hình công khai đầu tiên được xây dựng trên thiết kế này. thẻ mô hình Qwen3.8-Flash-Next mô tả nó là một mô hình ngôn ngữ nhân quả có bộ mã hoá hình ảnh, được huấn luyện cả giai đoạn tiền huấn luyện và hậu huấn luyện, và liệt kê độ dài ngữ cảnh gốc là 262.144 token có thể mở rộng lên 1 triệu. Thẻ này đặt mô hình như một bước tiến cụ thể về hiệu quả hơn là một mẫu mốc năng lực: mối quan ngại được nhóm nêu ra là cách các lựa chọn kiến trúc ảnh hưởng đến chi phí suy luận ở quy mô lớn, đặc biệt khi các tải công việc có tính đại lý với ngữ cảnh dài trở thành trường hợp sử dụng chính.

Chú Ý Hỗn Hợp, Residual Có Cổng, và Nhúng N‑Gram

Kiến trúc dựa trên bốn thay đổi được nêu ra. Thứ nhất là một cơ chế chú ý hỗn hợp được tái cấu trúc. Các mô hình Qwen hỗn hợp trước đây kết hợp Gated DeltaNet với Gated Attention; Qwen3.8-Flash-Next thay thế phần sau bằng Qwen Sparse Attention (QSA), hoạt động ở mức micro‑block thay vì chọn token riêng lẻ. Thẻ mô hình cho rằng điều này giảm đáng kể độ trễ trong ngữ cảnh dài. Mô hình sắp xếp 48 lớp theo một mẫu lặp lại: ba khối Gated DeltaNet đưa vào một lớp hỗn hợp chuyên gia, tiếp theo là một khối QSA đưa vào một lớp hỗn hợp chuyên gia, lặp lại mười hai lần.

Thay đổi thứ hai là cơ chế residual có cổng, điều chỉnh thông tin chảy qua các luồng residual mở rộng bằng một cổng đọc theo phần tử, phụ thuộc vào dữ liệu và một cổng ghi vô hướng cho mỗi nhánh. Thẻ mô hình trình bày điều này như một cách để đạt được độ biểu đạt chi tiết hơn trên các lớp, đồng thời duy trì tính ổn định trong quá trình huấn luyện và giữ chi phí suy luận thấp.

Thứ ba là một lớp nhúng n‑gram. Thay vì mở rộng tham số bằng các chuyên gia bổ sung, mô hình thêm 51 tỷ tham số trong một lớp nhúng riêng, được đánh chỉ mục bởi các bigram và trigram ngắn ở lớp 2. Nhóm mô tả điều này như một trục mở rộng tham số, yêu cầu ít tính toán hơn so với hỗn hợp chuyên gia và dễ dàng hơn trong việc chuyển tải sang các bộ tăng tốc có bộ nhớ hạn chế. Thẻ mô hình cũng lưu ý một lớp dự đoán đa token với 4 tỷ tham số, được huấn luyện qua nhiều bước.

Thứ tư là công thức huấn luyện. Các bộ tối ưu Muon và AdamW được áp dụng cho các loại trọng số cụ thể, và nhóm cho biết họ đã loại bỏ việc làm ấm kích thước batch truyền thống, thay vào đó bắt đầu ngay ở kích thước batch mục tiêu, dựa trên các quy luật tỷ lệ được điều chỉnh lại. Như thẻ mô tả, cách này giảm đáng kể số bước tối ưu hoá tổng thể đồng thời hỗ trợ tốc độ học lớn hơn.

Tiêu chuẩn Đánh Giá Báo Cáo Bởi Nhà Cung Cấp và Những Gì Chúng Đo

Thẻ mô hình báo cáo kết quả benchmark so sánh Qwen3.8-Flash-Next với Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 và Claude-Opus-4.6 (Max). Đây là các số liệu do nhà cung cấp báo cáo, được đánh giá trên các khung thử nghiệm riêng của nhóm, và cần được hiểu như vậy. Trong lĩnh vực mã hoá đại lý, thẻ liệt kê điểm DeepSWE 1.1 là 58.7 so với 42.2 của Qwen3.8-27B và 54.4 của DeepSeek-V4-Flash, với lưu ý rằng DeepSWE được chạy với hai khung (Claude Code và mini‑SWE‑agent) và điểm cao nhất trong cả hai được báo cáo. Trong SWE‑bench Pro, Qwen3.8-Flash-Next đạt 62.5, vượt Qwen3.8-27B ở mức 61.7 và Qwen3.7-Plus ở mức 55.8, với tất cả các mô hình được đánh giá lại trên phiên bản cải tiến của benchmark sau khi nhóm sửa các nhiệm vụ họ cho là gây vấn đề.

Mẫu quan trọng là tuyên bố về hiệu quả, không phải một con số duy nhất. Thẻ mô hình liệt kê tổng cộng 125 tỷ tham số với 6 tỷ được kích hoạt, so với 397 tỷ tổng và 17 tỷ được kích hoạt cho Qwen3.7-Plus. Về phía kiến thức chung, mô hình đạt điểm GPQA Diamond là 91.7, điểm LiveCodeBench v6 là 91.9, và điểm HLE là 35.9 do GPT‑4o đánh giá thay vì bộ chấm điểm mặc định của benchmark. Thẻ mô hình minh bạch về các lựa chọn này, điều mà nhiều bản phát hành khác không cung cấp, nhưng chúng vẫn là các quyết định của nhà cung cấp.

Khả Dụng và Con Đường Đến Qwen4

Qwen3.8-Flash-Next hiện đã có sẵn trên Hugging Face dưới giấy phép qwen‑community‑1.0, với các trọng số ở định dạng BF16 tổng cộng khoảng 180 tỷ tham số trải qua mô hình ngôn ngữ, lớp nhúng n‑gram và lớp dự đoán đa token. Thẻ mô hình đề xuất triển khai qua SGLang, vLLM hoặc TokenSpeed, và lưu ý rằng Qwen3.8‑Flash — phiên bản hướng sản xuất được xây dựng dựa trên bản xem trước này với ngữ cảnh mặc định 1 triệu token và các công cụ tích hợp chính thức — là phiên bản dự định dùng cho API quản lý qua Qwen Cloud.

Nhãn “Next” là dấu hiệu. Nhóm rõ ràng định vị đây là một bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4, đặt nó vào cùng một danh mục với các bản phát hành Qwen trước đây đã thử nghiệm các hướng thiết kế trước chu kỳ flagship. Dù thiết kế cụ thể này có trở thành nền tảng cho Qwen4 hay chỉ là một nhánh mà nhóm sau này bỏ qua, bản phát hành này ghi lại nơi một phòng thí nghiệm lớn đang đặt cược vào hiệu quả.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.