โมเดลและแพลตฟอร์ม AI

Qwen3.8-Flash-Next แสดงตัวอย่างสถาปัตยกรรม Qwen4 พร้อมพารามิเตอร์ที่ทำงาน 6 พันล้าน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Qwen3.8-Flash-Next แสดงตัวอย่างสถาปัตยกรรม Qwen4 ด้วย Hybrid Attention และพารามิเตอร์ที่ทำงาน 6 พันล้าน

ทีม Qwen ของ Alibaba ปล่อย Qwen3.8-Flash-Next เมื่อวันที่ 26 สิงหาคม 2026 ซึ่งเป็นโมเดลทดลองแบบเปิดน้ำหนักที่แสดงตัวอย่างสถาปัตยกรรมที่ตั้งใจจะเป็นพื้นฐานของ Qwen4 โมเดลนี้มีพารามิเตอร์ทั้งหมด 125 พันล้าน แต่เปิดใช้งานเพียง 6 พันล้านต่อโทเคน การกำหนดค่านี้ทีมอธิบายว่าเป็นก้าวสู่สิ่งที่พวกเขาเรียกว่าประสิทธิภาพต้นทุนสูงสุด

การปล่อยนี้เป็นโมเดลสาธารณะแรกที่สร้างบนการออกแบบนี้ บัตรโมเดล Qwen3.8-Flash-Next อธิบายว่าเป็นโมเดลภาษาสาเหตุพร้อมตัวเข้ารหัสภาพ ฝึกฝนผ่านการฝึกล่วงหน้าและการฝึกต่อ และระบุความยาวบริบทพื้นฐานที่ 262,144 โทเคน สามารถขยายได้ถึง 1 ล้าน โบร์ดนี้วางตำแหน่งโมเดลเป็นก้าวที่ชัดเจนด้านประสิทธิภาพ มากกว่าการเป็นเรือธงด้านความสามารถ: ความกังวลที่ทีมระบุคือการที่การเลือกสถาปัตยกรรมส่งผลต่อค่าใช้จ่ายการสรุปผลในระดับใหญ่ โดยเฉพาะอย่างยิ่งเมื่อภาระงานแบบเอเจนต์ที่มีบริบทยาวกลายเป็นกรณีการใช้งานหลัก

Hybrid Attention, Gated Residuals, และ N‑Gram Embeddings

สถาปัตยกรรมนี้อิงอยู่บนการเปลี่ยนแปลงสี่ประการ ประการแรกคือการออกแบบใหม่ของแผนผัง Hybrid Attention โมเดล Qwen hybrid ก่อนหน้านี้จับคู่ Gated DeltaNet กับ Gated Attention; Qwen3.8-Flash-Next แทนที่ Gated Attention ด้วย Qwen Sparse Attention หรือ QSA ซึ่งทำงานระดับไมโครบล็อกแทนการเลือกโทเคนแต่ละตัว บัตรโมเดลอ้างว่าการเปลี่ยนแปลงนี้ลดความหน่วงของบริบทยาวอย่างมีนัยสำคัญ โมเดลจัดเรียง 48 ชั้นในรูปแบบที่วนซ้ำ: สามบล็อกของ Gated DeltaNet ส่งต่อไปยังชั้น mixture‑of‑experts ตามด้วยหนึ่งบล็อก QSA ส่งต่อไปยังชั้น mixture‑of‑experts ทั้งหมดทำซ้ำสิบสองครั้ง

การเปลี่ยนแปลงประการที่สองคือกลไก gated residual ที่ปรับการไหลของข้อมูลผ่านสตรีม residual ที่ขยายโดยใช้ read gate แบบองค์ประกอบ‑ตามข้อมูลและ write gate แบบสเกลาร์ต่อสาขา บัตรโมเดลนำเสนอวิธีนี้เพื่อให้ได้ความแสดงออกที่ละเอียดขึ้นในแต่ละชั้น พร้อมคงความเสถียรของการฝึกและลดภาระการสรุปผลให้น้อยที่สุด

ประการที่สามคือชั้น n‑gram embedding แทนที่จะเพิ่มพารามิเตอร์โดยใช้ผู้เชี่ยวชาญเพิ่มเติม โมเดลเพิ่มพารามิเตอร์ 51 พันล้านใน embedding แยกที่จัดทำดัชนีด้วยบิกรัมและไตรแกรมสั้นที่ชั้น 2 ทีมอธิบายว่าเป็นแนวทางสำหรับการสเกลพารามิเตอร์ที่ต้องการการคำนวณน้อยกว่าการใช้ mixture‑of‑experts และเหมาะกับการโอนงานไปยังตัวเร่งความเร็วที่มีหน่วยความจำจำกัด บัตรโมเดลยังระบุชั้นการทำนายหลายโทเคนขนาด 4 พันล้านพารามิเตอร์ที่ฝึกด้วยหลายขั้นตอน

ประการที่สี่คือสูตรการฝึกเอง ตัวปรับค่า Muon และ AdamW ถูกนำไปใช้กับประเภทน้ำหนักเฉพาะ และทีมระบุว่าการฝึกนี้ยกเลิกการอุ่นค่า batch‑size แบบดั้งเดิมโดยเริ่มต้นตรงที่ขนาด batch ที่ต้องการ ตามกฎสเกลที่ปรับใหม่ บัตรโมเดลกล่าวว่าการทำเช่นนี้ลดจำนวนขั้นตอนของ optimizer อย่างมากในขณะที่รองรับอัตราการเรียนรู้ที่สูงขึ้น

ผลการวัดจากผู้จำหน่ายและสิ่งที่พวกเขาวัด

บัตรโมเดลรายงานผลการทดสอบเปรียบเทียบ Qwen3.8-Flash-Next กับ Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, และ Claude-Opus-4.6 (Max) ตัวเลขเหล่านี้เป็นข้อมูลที่ผู้จำหน่ายรายงานและประเมินด้วย harness ของทีมเอง จึงควรอ่านตามนั้น สำหรับการเขียนโค้ดแบบเอเจนต์ บัตรโมเดลแสดงคะแนน DeepSWE 1.1 ที่ 58.7 เทียบกับ 42.2 ของ Qwen3.8-27B และ 54.4 ของ DeepSeek-V4-Flash โดยมีเงื่อนไขว่า DeepSWE ถูกรันด้วยสอง harness (Claude Code และ mini‑SWE‑agent) และรายงานคะแนนสูงสุดจากทั้งสอง ส่วนใน SWE‑bench Pro Qwen3.8-Flash-Next ได้คะแนน 62.5 สูงกว่า Qwen3.8-27B ที่ 61.7 และ Qwen3.7‑Plus ที่ 55.8 โดยโมเดลทั้งหมดถูกประเมินใหม่บนเวอร์ชันปรับปรุงของ benchmark หลังจากทีมแก้ไขสิ่งที่พวกเขาเรียกว่าภารกิจที่มีปัญหา

รูปแบบที่สำคัญคือการอ้างอิงประสิทธิภาพ ไม่ใช่ตัวเลขใดตัวเลขหนึ่ง บัตรโมเดลระบุพารามิเตอร์ทั้งหมด 125 พันล้านที่เปิดใช้งาน 6 พันล้าน เทียบกับ 397 พันล้านทั้งหมดและเปิดใช้งาน 17 พันล้านสำหรับ Qwen3.7‑Plus ด้านความรู้ทั่วไป โมเดลได้คะแนน GPQA Diamond ที่ 91.7, LiveCodeBench เวอร์ชัน 6 ที่ 91.9, และคะแนน HLE ที่ 35.9 ที่ประเมินโดย GPT‑4o แทนตัวประเมินเริ่มต้นของ benchmark บัตรโมเดลเปิดเผยข้อมูลเหล่านี้อย่างโปร่งใส ซึ่งมากกว่าที่หลายการปล่อยให้ข้อมูล แต่ก็ยังเป็นการเลือกของผู้จำหน่าย

การพร้อมใช้งานและเส้นทางสู่ Qwen4

Qwen3.8-Flash-Next พร้อมให้ใช้งานแล้วบน Hugging Face ภายใต้สัญญาอนุญาต qwen‑community‑1.0 โดยน้ำหนักในรูปแบบ BF16 มีประมาณ 180 พันล้านพารามิเตอร์รวมทั้งโมเดลภาษา, n‑gram embedding, และชั้นการทำนายหลายโทเคน บัตรโมเดลแนะนำให้ทำการปรับใช้ผ่าน SGLang, vLLM หรือ TokenSpeed และระบุว่า Qwen3.8‑Flash — รุ่นที่ออกแบบเพื่อการผลิตซึ่งสร้างจากการพรีวิวนี้พร้อมบริบทเริ่มต้น 1 ล้านโทเคนและเครื่องมือในตัวอย่างเป็นทางการ — เป็นเวอร์ชันที่ตั้งใจให้ใช้ผ่าน API ที่จัดการโดย Qwen Cloud

ป้าย “Next” คือสัญญาณ ทีมชัดเจนว่าเป็นการพรีวิวเชิงทดลองของสถาปัตยกรรมที่จะเป็นพื้นฐานของ Qwen4 ซึ่งทำให้มันอยู่ในหมวดเดียวกับการปล่อย Qwen ก่อนหน้านี้ที่ทดสอบทิศทางการออกแบบก่อนรอบเรือธง ไม่ว่าจะออกแบบนี้กลายเป็นพื้นฐานของ Qwen4 หรือเป็นสาขาที่ทีมทิ้งในภายหลัง การปล่อยนี้บันทึกว่าห้องปฏิบัติการหลักแห่งหนึ่งกำลังวางเดิมพันบนประสิทธิภาพที่ไหน

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย