รายงาน
อาลีบาบาเผยรายงานเทคนิค Qwen3-VL ซึ่งมีรายละเอียดการวิเคราะห์วิดีโอ 2 ชั่วโมง

ทีม Qwen ของอาลีบาบาได้เผยรายงานเทคนิค Qwen3-VL เมื่อวันที่ 26 พฤศจิกายน โดยให้รายละเอียดเกี่ยวกับโมเดลวิชั่น-แลงเกจที่เปิดเผยต่อสาธารณะ ซึ่งถูกเปิดตัวครั้งแรกในเดือนกันยายน โมเดล 64 ผู้เขียนร่วมได้แสดงให้เห็นว่าระบบสามารถประมวลผลวิดีโอ 2 ชั่วโมงภายในหน้าต่างคอนเท็กซ์ 256,000 โทเค็น ขณะที่ยังคงความแม่นยำเกือบ 100% ในการค้นหาฟรेमเฉพาะ
โมเดล Qwen3-VL-235B-A22B ที่เป็นโมเดลหลักได้ทำความแม่นยำ 100% ในการทดสอบ “เข็มในกองฟาง” เมื่อค้นหาวิดีโอ 30 นาที และยังคงความแม่นยำ 99.5% แม้จะสแกนวิดีโอ 2 ชั่วโมงที่มีประมาณ 1 ล้านโทเค็น วิธีการทดสอบจะแทรกเฟรม “เข็ม” ที่มีความหมายทางคำศัพท์เข้าไปในตำแหน่งสุ่มภายในวิดีโอยาว และท้าทายให้โมเดลค้นหาและวิเคราะห์เฟรมนั้น
ความสามารถนี้ทำให้ Qwen3-VL เป็นการพัฒนาที่สำคัญในด้านการทำความเข้าใจวิดีโอยาว – สนามที่โมเดลวิชั่น-แลงเกจส่วนใหญ่ต้องดิ้นรนเพื่อรักษาการวิเคราะห์ที่สอดคล้องกันในช่วงเวลานาน
การแสดงผลเป็นคะแนนเมื่อเทียบกับโมเดลชั้นนำ
รายงานเทคนิคแสดงถึงผลการทำงานของ Qwen3-VL ในหลายมาตรการประเมิน โดยเฉพาะอย่างยิ่งในงานคณิตศาสตร์ทางภาพ โมเดลได้คะแนน 85.8% ใน MathVista ซึ่งมากกว่า GPT-5 ที่ 81.3% และเป็นผู้นำใน MathVision ด้วยความแม่นยำ 74.6% เมื่อเทียบกับ Gemini 2.5 Pro (73.3%) และ GPT-5 (65.8%)
ความสามารถในการประมวลผลเอกสารก็เข้มแข็งเช่นกัน โมเดลได้คะแนน 96.5% ใน DocVQA สำหรับการทำความเข้าใจเอกสาร และ 875 คะแนนใน OCRBench โดยรองรับการตระหนักข้อความใน 39 ภาษา ซึ่งเกือบสี่เท่าของการครอบคลุมภาษาของรุ่นก่อนหน้า Qwen2.5-VL โมเดลสามารถรักษาความแม่นยำมากกว่า 70% ในงาน OCR ใน 32 ภาษาที่รองรับ
โมเดลในครอบครัวนี้มีให้ใช้งานผ่าน Hugging Face และ Alibaba Cloud โดยรวมทั้งรุ่นที่มีความหนาแน่น (2B, 4B, 8B, 32B พารามิเตอร์) และการกำหนดค่าผู้เชี่ยวชาญ (30B-A3B และ 235B-A22B) รุ่น 8B เพียงอย่างเดียวได้มากกว่า 2 ล้านการดาวน์โหลดตั้งแต่การเปิดตัวในเดือนกันยายน
อย่างไรก็ตาม ผลลัพธ์ไม่ได้ครอบงำทุกด้าน ในการทดสอบ MMMU-Pro ที่ซับซ้อน Qwen3-VL ได้คะแนน 69.3% เมื่อเทียบกับ GPT-5 ที่ 78.4% คู่แข่งทางการค้ายังคงรักษาความได้เปรียบในมาตรฐานการถาม-ตอบวิดีโอโดยทั่วไป ซึ่งบ่งชี้ว่าโมเดลมีความเชี่ยวชาญในด้านคณิตศาสตร์ทางภาพและการวิเคราะห์เอกสารมากกว่าการเป็นผู้นำทั่วไป
นวัตกรรมทางสถาปัตยกรรมสามประการ
รายงานเทคนิคอธิบายถึงการอัปเกรดทางสถาปัตยกรรมสามประการที่ขับเคลื่อนความสามารถเหล่านี้ ประการแรก “MRoPE ที่เข้าซ้อนกัน” แทนที่วิธีการฝังตำแหน่งก่อนหน้านี้โดยการกระจายการแสดงทางคณิตศาสตร์อย่างสม่ำเสมอตลอดมิติเวลา ความกว้าง และความสูง แทนที่จะจัดกลุ่มตามมิติ การเปลี่ยนแปลงนี้มุ่งเป้าไปที่การปรับปรุงประสิทธิภาพในวิดีโอยาว
ประการที่สอง การรวม DeepStack ช่วยให้สามารถจับรายละเอียดภาพที่ละเอียดและจัดตำแหน่งภาพ-ข้อความให้เข้าใกล้กันมากขึ้น นวัตกรรมประการที่สามไปไกลกว่าการฝังตำแหน่งแบบโรตารี่ตามเวลาและใช้การวางตำแหน่งตามเวลาแบบข้อความที่ชัดเจน ทำให้สามารถอ้างอิงช่วงเวลาเฉพาะในวิดีโอได้แม่นยำยิ่งขึ้น
ระบบยังแสดงให้เห็นถึงความสามารถของเอเจนต์มากกว่าการรับรู้เพียงอย่างเดียว ในการทดสอบ ScreenSpot Pro ซึ่งประเมินการนำทางภายในอินเทอร์เฟซผู้ใช้กราฟิก โมเดลได้คะแนน 61.8% การทดสอบ AndroidWorld ซึ่งระบบต้องดำเนินการแอปพลิเคชัน Android โดยอิสระ รุ่น 32B ได้คะแนน 63.7%
ภูมิทัศน์ในการแข่งขันแบบโอเพ่นซอร์ส
모델 Qwen3-VL ทั้งหมดที่เผยแพร่ตั้งแต่เดือนกันยายนมีให้ใช้งานภายใต้ใบอนุญาต Apache 2.0 โดยมีน้ำหนักเปิด โมเดลครอบคลุมตั้งแต่รุ่น 2B ที่มีพารามิเตอร์น้อยเหมาะสำหรับการใช้งานแบบเอดจ์ ไปจนถึงรุ่น 235B-A22B ที่ต้องการทรัพยากรการคำนวณจำนวนมาก โดยรุ่นหลังมีขนาด 471 GB
การเผยแพร่เอกสารเทคนิคในเวลานี้มีความสำคัญ Google’s Gemini 1.5 Pro ได้แสดงความสามารถในการค้นหาเฟรมจากวิดีโอยาวในต้นปี 2024 แต่ Qwen3-VL นำฟังก์ชันการทำงานที่เทียบเท่ามาให้กับระบบนิเวศแบบโอเพ่นซอร์ส ด้วยจำนวนผู้ใช้ AI ที่สร้างสรรค์ของจีนเพิ่มขึ้นสองเท่าเป็น 515 ล้านคน ในช่วงไม่กี่เดือนที่ผ่านมา และโมเดล Qwen ได้รับการดาวน์โหลดมากกว่า 300 ล้านครั้งทั่วโลก อาลีบาบาจึงจัดตำแหน่งโมเดลที่เปิดกว้างของตนให้เป็นพื้นฐานสำหรับการพัฒนาอินเทลลิเจนซ์หลายรูปแบบทั่วโลก
โมเดล Qwen2.5-VL ก่อนหน้านี้ได้รับการอ้างอิงมากกว่า 2,800 ครั้งในเวลาไม่ถึง 10 เดือน ซึ่งบ่งชี้ถึงการนำไปใช้ในการวิจัยอย่างกว้างขวาง รายงานเทคนิคที่มีรายละเอียดสำหรับ Qwen3-VL ควรเร่งการเติบโตนี้ โดยให้รายละเอียดทางสถาปัตยกรรมและการฝึกอบรมที่นักวิจัยต้องการเพื่อสร้างหรือแข่งขันกับความสามารถเหล่านี้
สิ่งนี้หมายถึงอะไรสำหรับนักพัฒนา
สำหรับทีมที่ทำงานเกี่ยวกับการวิเคราะห์วิดีโอ การทำความเข้าใจเอกสาร หรือการให้เหตุผลทางภาพ Qwen3-VL มีความสามารถที่พร้อมใช้งานจริงโดยไม่ต้องอาศัย API ความสามารถเฉพาะในคณิตศาสตร์ทางภาพทำให้โมเดลนี้เกี่ยวข้องทันทีสำหรับเทคโนโลยีการศึกษา เครื่องมือวิจัยทางวิทยาศาสตร์ และแอปพลิเคชันใดๆ ที่ต้องการการตีความแผนภูมิ แผนภาพ หรือสัญลักษณ์ทางคณิตศาสตร์ภายในภาพ
ช่องว่างระหว่างโมเดลที่เปิดและปิดยังคงแคบลงในโดเมนบางอย่าง ในขณะที่ยังคงกว้างในโดเมนอื่นๆ Qwen3-VL แสดงให้เห็นว่าโมเดลที่มีน้ำหนักเปิดสามารถเทียบหรือเกินระบบที่เป็นกรรมสิทธิ์ในงานเฉพาะ เช่น คณิตศาสตร์ทางภาพ แม้ว่าจะตามหลังในมาตรฐานการให้เหตุผลที่กว้างขึ้นก็ตาม
สำหรับชุมชน AI แบบโอเพ่นซอร์ส รายงานเทคนิคที่มีรายละเอียดนี้เป็นมากกว่าเอกสาร – เป็นแผนที่ทางที่นักวิจัยสามารถศึกษา วิพากษ์วิจารณ์ และสร้างขึ้นใหม่ได้ ไม่ว่าจะนำไปสู่การนำไปใช้หรือการวิจัยที่เสริมกันหรือไม่นั้น ยังคงมองไม่เห็น แต่มาตรฐานสำหรับอินเทลลิเจนซ์หลายรูปแบบที่เปิดกว้างเพิ่มขึ้นอย่างมีนัยสำคัญ












