โมเดลและแพลตฟอร์ม AI

อาลีบาบาเปิดตัว Qwen-Image-3.0 โดยไม่มีเบンチมาร์กหรือน้ำหนัก

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ทีม Qwen ของอาลีบาบา เปิดตัว Qwen-Image-3.0 เมื่อวันที่ 21 กรกฎาคม 2026 ซึ่งเป็นรุ่นที่สามของโมเดลการสร้างภาพ และสร้างข้อความประกาศโดยมีเป้าหมายเดียวคือการทำให้ภาพที่สร้างขึ้นเป็นเครื่องมือที่ใช้งานได้จริง แทนที่จะเป็นเพียงภาพที่ดูสวยงามเท่านั้น ข้อความประกาศเป็นแกลเลอรี่ของสิ่งที่ระบบสามารถวาดได้ — หน้ากระดาษหนังสือพิมพ์ที่หนาแน่น อินโฟกราฟิกหลายแผง และเอกสารวิชาการที่เต็มไปด้วยสัญลักษณ์ทางคณิตศาสตร์ สิ่งที่ไม่รวมอยู่คือคะแนนเบ็นช์มาร์ก การ์ดโมเดล หรือรายงานทางเทคนิคเพื่อสนับสนุนสิ่งเหล่านั้น

การไม่มีสิ่งเหล่านี้คือเรื่องราวที่แท้จริง ข้อเรียกร้องของ Qwen-Image-3.0 อยู่บนภาพตัวอย่างที่บริษัทเลือกที่จะเผยแพร่ และรุ่นก่อนๆ ในซีรีส์เดียวกันกำหนดมาตรฐานที่สูงกว่าสำหรับหลักฐานมากกว่าที่รุ่นนี้ทำได้

สิ่งที่โมเดลอ้างว่าทำได้

ทีม Qwen จัดระเบียบการเปิดตัวโดยรอบสามความสามารถ ความสามารถแรกคือการรับมือคำสั่งยาวและรายละเอียด: โมเดลยอมรับคำสั่งได้สูงสุด 4,500 โทเค็น ซึ่งบริษัทระบุว่าช่วยให้สามารถสร้างภาพที่มีข้อมูลหนาแน่นได้ในครั้งเดียว ตัวอย่างหลักคือกริด 3×3 ของอินโฟกราฟิกที่ไม่เกี่ยวข้องกัน — ไดอะแกรมฟิสิกส์ การพิสูจน์ทฤษฎีกลุ่ม การอธิบายชีววิทยา และอีกหกอัน — ที่อาลีบาบาระบุว่าผลิตจากคำสั่ง 3,700 โทเค็นเพียงคำสั่งเดียว ไม่ใช่จากภาพที่แยกจากกัน อีกตัวอย่างหนึ่งวางอินเทอร์เฟซไว้ภายในอีกอัน โดยวางตัวแก้ไขโค้ดไว้รอบหน้าต่างแชทรอบแอปส่งข้อความ

ข้อเรียกร้องที่สองคือรายละเอียดเล็กๆ น้อยๆ อาลีบาบาระบุว่าโมเดลแสดงข้อความที่เล็กที่สุด 10 พิกเซลได้อย่างชัดเจน และทำซ้ำข้อความเหมือนภาพถ่าย เช่น ผิวหนัง เส้นผม และกระดาษ ตัวอย่างที่แสดงคือหน้าเต็มของเอกสารวิชาการที่มีสมการหลายบรรทัดและหน้าแรกของหนังสือพิมพ์จำลอง พร้อมกับงานแก้ไข เช่น การเพิ่มคำอธิบายที่เขียนด้วยมือและการฟื้นฟูภาพวาดแบบดั้งเดิมที่เสียหาย

ข้อเรียกร้องที่สามคือสิ่งที่บริษัทเรียกว่า “ความรู้ของโลก” — การแสดงภาษา 12 ภาษาโดยกำเนิด การทำซ้ำอินเทอร์เฟซ เช่น หน้าเว็บและไลฟ์สตรีม และความสามารถในการดึงข้อมูลสดจากอินเทอร์เน็ต ตัวอย่างหนึ่งสร้างกราฟิกการพยากรณ์อากาศสำหรับเมืองและวันที่เฉพาะ ซึ่งเป็นขอบเขตที่ไม่ธรรมดาสำหรับเครื่องกำเนิด และทำให้เส้นแบ่งระหว่างโมเดลภาพและเครื่องมือออกแบบขับเคลื่อนด้วยข้อมูล模糊 อาลีบาบาเสนอแพ็คเกจนี้สำหรับการผลิตเนื้อหา — การวางผังหนังสือพิมพ์ การวางแผนเรื่องราวสั้น การสร้างต้นแบบ UI และภาพสำหรับการค้าทางอิเล็กทรอนิกส์ — ประเภทของการผลิตสื่อที่คำถามเกี่ยวกับการเปิดเผยบทบาทของ AI คือเรื่องที่มีชีวิตอยู่แล้ว ทุกความสามารถเหล่านี้แสดงผ่านเอาต์พุตที่บริษัทเลือก

สิ่งที่การประกาศไม่ได้กล่าวถึง

ข้อความประกาศไม่มีตารางเบ็นช์มาร์ก ไม่มีการนับพารามิเตอร์ ไม่มีใบอนุญาต และไม่มีน้ำหนักที่สามารถดาวน์โหลดได้ และไม่มีรายงานทางเทคนิคที่อธิบายว่าโมเดลถูกฝึกหรือทดสอบอย่างไร ผู้ใช้ถูกส่งไปยัง Qwen Chat เพื่อทดลองใช้

สิ่งนี้เป็นการเปลี่ยนแปลงจากวิธีที่ซีรีส์นี้จัดส่งมาก่อน Qwen-Image 1.0 ได้รับการเปิดตัวในเดือนสิงหาคม 2025 โดยมีน้ำหนักที่เปิดเผยภายใต้ใบอนุญาต Apache 2.0 ที่อนุญาต และรายงานทางเทคนิคในวันเดียวกัน และ Qwen-Image-2.0 ตามด้วย รายงานทางเทคนิค ของตนเอง รุ่นก่อนหน้านี้ระบุข้อจำกัดของมัน: มันรับคำสั่งได้สูงสุดประมาณ 1,000 โทเค็น ซึ่งทำให้การกระโดดไปที่ 4,500 เป็นตัวเลขที่เป็นรูปธรรมที่สุดในการเปิดตัวใหม่ และไม่มีฝ่ายอื่นใดที่ได้ตรวจสอบ

ช่องว่างนี้มีความสำคัญมากกว่าสำหรับโมเดลภาพมากกว่าโมเดลข้อความ คุณภาพของภาพเป็นเรื่องส่วนตัว และการแสดงข้อความเป็นแกนหลักที่เครื่องกำเนิดมักจะดูแข็งแกร่งในตัวอย่างที่เลือกด้วยมือและอ่อนแอภายใต้การทดสอบอย่างเป็นระบบ โดยไม่มีน้ำหนักหรือชุดการประเมิน หลักฐานเดียวที่นักพัฒนาสามารถดำเนินการได้คือคลิปเอาต์พุตของอาลีบาบาเอง คู่แข่งได้แสดงให้เห็นว่าการเปิดตัวแบบแชทเท่านั้นเป็นทางเลือกมากกว่าข้อจำกัด: เทนเซนต์เปิดตัว HunyuanImage 3.0 ในฐานะโมเดลที่มีน้ำหนักเปิด และ Thinking Machines Lab เปิดตัว Inkling โมเดล AI มัลติม็อดัลที่มีน้ำหนักเปิดครั้งแรก โดยรวมน้ำหนักด้วย

ที่ไหนที่รุ่นก่อนหน้านี้ได้รับการจัดอันดับ

อาลีบาบามีจุดข้อมูลที่เปิดเผยและไม่ธรรมดาสำหรับตำแหน่งของโมเดลภาพ ใน Qwen-Image-Bench การประเมินข้อความเป็นภาพที่ทีม Qwen เองเผยแพร่ โมเดล Qwen Image 2.0 Pro ที่เป็นโมเดลรุ่นก่อนหน้าได้รับการจัดอันดับที่ห้าโดยรวม โมเดล GPT Image 2 ของ OpenAI นำหน้า โดยมีโมเดล Nano Banana ของ Google และ GPT Image 1.5 ของ OpenAI เติมอันดับต้นๆ การประเมินนี้อาศัยตัวตัดสินอัตโนมัติที่ผู้เขียนระบุว่าตามผู้ให้คะแนนมนุษย์อย่างใกล้ชิด แต่ยังคงเป็นการประเมินของอาลีบาบาเอง และได้คะแนนรุ่นก่อนหน้า ไม่ใช่ 3.0

บริบทนี้ทำงานต่อต้านการอ่านโมเดลใหม่ว่าเป็นขั้นตอนสู่การเป็นผู้นำในสนาม การเริ่มต้นที่อันดับที่ห้าให้ Qwen-Image-3.0 พื้นที่ที่จะอ้างว่ามีการปรับปรุงจริง แต่การเปิดตัวไม่มีวิธีการวัดที่จะยืนยันสิ่งเหล่านั้น สัญญาณที่น่าสนใจคือการตรวจสอบว่าอาลีบาบาโพสต์น้ำหนักและโมเดลการ์ดหรือไม่ เช่นเดียวกับที่ทำสำหรับการเปิดตัว Qwen-Image ทุกครั้งก่อนหน้านี้ และการประเมินอิสระที่สนับสนุนข้อเรียกร้องของคำสั่งยาวและข้อความเล็กๆ จนกว่าสิ่งหนึ่งในนั้นจะเกิดขึ้น สิ่งที่สามารถพูดได้มากที่สุดคือ Qwen-Image-3.0 ดูแข็งแกร่งในภาพที่ผู้สร้างเลือกที่จะแสดง

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย