มุมมองของ Anderson
ปั๊มจิ๊กซอว์ช่วยเพิ่มความสามารถในการให้เหตุผลด้านภาพของ AI

งานวิจัยใหม่ชี้ว่าโมเดล AI สามารถพัฒนาความสามารถในการมองเห็นด้วยการแก้จิ๊กซอว์ การจัดเรียงภาพ วิดีโอ และฉาก 3 มิติที่สลับตำแหน่งช่วยฝึกทักษะภาพโดยไม่ต้องใช้ข้อมูล ป้ายกำกับ หรือเครื่องมือเพิ่ม
การแข่งขันพัฒนาโมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLM) แทบไม่มีทางลัด แม้โมเดลโอเพนซอร์สจากจีนหลายรุ่นในปี 2025 จะมีต้นทุนสร้างและใช้งานต่ำกว่า แต่ผู้พัฒนาตะวันตกมักเพิ่มข้อมูล กำลังอนุมาน และไฟฟ้า ขณะที่วิธีที่อ้างว่า “ฟรี” ในงานวิจัยมักให้ผลดีขึ้นเพียงเล็กน้อยหรือดีขึ้นในด้านที่ไม่ใช่เป้าหมายหลัก อย่างไรก็ตาม การค้นหาหลักการพื้นฐานที่อาจเร่งความก้าวหน้ายังน่าดึงดูดเกินกว่าจะเลิก
ต่อชิ้นส่วนเข้าด้วยกัน
ความร่วมมือระหว่างสถาบันจีนรายงานว่า การให้ VLM แก้จิ๊กซอว์ช่วยเพิ่มประสิทธิภาพอย่างชัดเจน แม้การใช้การเรียนรู้แบบเสริมกำลังกับงานลักษณะนี้เคยให้ผลไม่ดี และวิธีใหม่ไม่ต้องใช้ระบบ โมเดลเสริม หรือส่วนประกอบอื่น

Visual Jigsaw เป็นกรอบฝึกหลังการเรียนรู้แบบกำกับตนเอง งานจิ๊กซอว์ภาพช่วยการรับรู้รายละเอียด พื้นที่ และองค์ประกอบ งานวิดีโอช่วยเหตุผลเชิงเวลา และงาน 3 มิติช่วยความเข้าใจเรขาคณิต กราฟเรดาร์แสดงผลที่ดีขึ้นอย่างสม่ำเสมอจาก Qwen2.5-VL ที่มา
ระบบชื่อ Visual Jigsaw ฝึก MLLM ที่มีอยู่ด้วยข้อมูลซึ่งถูกแบ่งและสลับแบบจิ๊กซอว์ ผู้เขียนสร้างสามรูปแบบ ได้แก่ ภาพ วิดีโอ และ 3 มิติ และพบว่ากระบวนการที่ดัดแปลงเพียงเล็กน้อยใช้ได้กับทั้งสามด้าน

ภาพถูกแบ่งเป็นชิ้นแล้วสลับเพื่อให้โมเดลคืนตำแหน่ง คลิปวิดีโอถูกสลับเพื่อให้เรียงเวลา และจุดสามมิติที่มีความลึกต่างกันถูกสลับเพื่อให้เรียงจากใกล้ไปไกล คำตอบได้คะแนนเทียบค่าจริงและให้คะแนนบางส่วนเมื่อถูกบางส่วน
การฝึกช่วยให้โมเดลเข้าใจข้อมูลภาพด้วยการประกอบภาพ คลิป หรือจุด 3 มิติที่สลับกันใหม่ กระบวนการตอบเป็นข้อความ ไม่ได้ให้โมเดลสร้างภาพหรือใช้ส่วนประกอบภาพเพิ่ม วิธีนี้อยู่ในกรอบ Reinforcement Learning from Verifiable Rewards (RLVR) ซึ่งให้รางวัลด้วยกฎอัตโนมัติที่ตรวจสอบได้ จึงไม่ต้องมีมนุษย์ติดป้าย
จุดสำคัญคือโมเดลประกอบปริศนาในเชิงความหมายผ่านคำอธิบาย ไม่ใช่ต่อรูปทรงเหมือนมนุษย์

ตัวอย่างงาน RL จากภาคผนวกซึ่งแสดงว่ากระบวนการเรียนรู้เสริมนี้ใช้ข้อความ ภาพที่ป้อนให้ MLLM ไม่ได้แสดงอยู่ในตัวอย่างพรอมป์ต์
MLLM ทำงานภาพอย่างกว้างขวาง แต่ยังเป็นสถาปัตยกรรมภาษา ไม่ได้ออกแบบให้สร้างภาพ วิดีโอ หรือโครงแทนรูปทรงแบบตาข่าย 3 มิติ

แต่ละแถวแสดงชิ้นภาพที่สลับกันซึ่งโมเดลต้องคืนลำดับเดิม โดยคำตอบที่ถูกต้องอยู่ด้านขวา
การฝึกชนิดนี้ทำหลังการเรียนหลัก เมื่อโมเดลเข้าใจภาพอยู่แล้ว งานปี 2017 เรื่อง Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles เคยใช้โจทย์คล้ายกันกับ CNN แต่ประสบความสำเร็จน้อยกว่าและเป็นสถาปัตยกรรมต่างจาก MLLM สมัยใหม่มาก

ตัวอย่างยุคแรกของการใช้ภาพที่แบ่งเป็นชิ้นเป็นโจทย์รางวัลสำหรับระบบประสาท ที่มา
Visual Jigsaw ให้ผลดีขึ้นสม่ำเสมอในเกณฑ์จำนวนมาก งานภาพเพิ่มการรับรู้รายละเอียด การวางตำแหน่ง และการให้เหตุผลเชิงองค์ประกอบ งานวิดีโอเพิ่มการติดตามลำดับเวลาและเหตุการณ์ ส่วนงาน 3 มิติเพิ่มความเข้าใจความลึกและพื้นที่จาก RGB-D โดยไม่เปลี่ยนสถาปัตยกรรม เพิ่มโมดูลภาพ หรือใช้ข้อมูลกำกับเพิ่ม
บทความชื่อ Visual Jigsaw Post-Training Improves MLLMs มาจากนักวิจัยหกคนที่ Nanyang Technological University, Linköping University และ SenseTime Research มีเว็บไซต์โครงการพร้อมตัวอย่างสด และเผยแพร่โค้ดกับน้ำหนักโมเดลแล้ว
วิธีการและรางวัล
ระบบให้รางวัลแบบเป็นระดับ ไม่ใช่แค่ผ่านหรือไม่ผ่าน ถ้าเรียงชิ้นส่วนถูกทั้งหมดจะได้รางวัลเต็ม หากเกือบถูกจะได้บางส่วนซึ่งลดด้วยปัจจัยส่วนลดเพื่อไม่ให้รางวัลคำตอบที่คลาดเคลื่อนมากเกินไป และป้องกันการเดาซ้ำเพื่อเล่นกับระบบ คำตอบไม่ถูกต้อง เช่น ใช้เลขเดิมซ้ำ ได้ศูนย์
เพื่อรักษารูปแบบ โมเดลต้องวางเหตุผลในแท็ก <think> และคำตอบสุดท้ายใน <answer> พร้อมโบนัสเล็กน้อยเมื่อใช้ถูกต้อง
ภาพ
ภาพถูกแบ่งเป็นตารางของชิ้นขนาดเท่ากัน วางลำดับเดิมจากซ้ายบนไปขวาล่างแล้วสุ่มสลับ โมเดลเห็นชิ้นที่สลับและต้องทำนาย permutation ที่คืนเค้าโครงเดิม

ตัวอย่างชิ้นภาพที่ระบบต้องเรียงคืน
การฝึกใช้ภาพ COCO 118,000 ภาพ แต่ละภาพแบ่งเป็นเก้าชิ้น พรอมป์ต์เป็นแบบที่แสดงไว้ก่อนหน้า
วิดีโอ
วิดีโอถูกแบ่งตามเวลาเป็นคลิปแล้วสลับ โมเดลต้องเรียงกลับเป็นลำดับเวลาเดิม

ตัวอย่างบางส่วนของโจทย์วิดีโอจากภาคผนวก
ใช้วิดีโอ LLaVA-Video 100,000 รายการ แบ่งรายการละหกคลิป ตัดเฟรม 5% ที่ต้นและท้ายแต่ละคลิปเพื่อไม่ให้โมเดลอาศัยการจับคู่ขอบเขตง่ายๆ คลิปมีไม่เกิน 12 เฟรม ความละเอียดสูงสุด 128×28×28 พิกเซล และตัดวิดีโอสั้นกว่า 24 วินาทีออก

พรอมป์ต์ RL สำหรับงานวิดีโอ โดยไม่แสดงคลิปที่โมเดลได้รับ
ข้อมูล 3 มิติ
จิ๊กซอว์ 3 มิติเต็มรูปแบบมักแบ่ง voxel หรือ point cloud แล้วให้ประกอบพื้นที่เดิม แต่ MLLM ทั่วไปประมวลผลข้อมูล 3 มิติดิบไม่ได้ จึงใช้ภาพ RGB-D ซึ่งเป็นภาพ 2 มิติที่มีค่าความลึกทุกพิกเซล

ตัวอย่างจากเกณฑ์ 3D Spatial Understanding โมเดล 3D Jigsaw อนุมานความสัมพันธ์ระหว่างมุมมองและทิศหมุนกล้องได้ถูกต้อง เหนือกว่า Qwen2.5-VL-7B
โมเดลได้รับรายการจุดที่สลับกันและมีความลึกต่างกัน ตั้งแต่ใกล้ไปไกล แล้วต้องคืนลำดับความลึกโดยใช้ภาพ 2 มิติเป็นอ้างอิง จุดทุกจุดทำเครื่องหมายบนภาพ และโมเดลต้องบอกว่าใกล้ที่สุด ลำดับสอง และต่อไป โดยไม่เห็นค่าความลึกดิบ

พรอมป์ต์สำหรับงาน 3D Jigsaw
ฝึกด้วยภาพ RGB-D จาก ScanNet จำนวน 300,000 ตัวอย่าง โดยสุ่มจุดความลึกหกจุดต่อภาพ แต่ละจุดอยู่ระหว่าง 0.1–10 เมตร จุดคู่ใดๆ ต้องห่างกันอย่างน้อย 40 พิกเซลในระนาบภาพและ 0.2 เมตรในความลึก

ตัวอย่าง point cloud จาก ScanNet ที่ใช้กับงานจิ๊กซอว์ 3 มิติ ที่มา
การทดสอบ
การทดลองเริ่มจาก Qwen2.5-VL-7B-Instruct ใช้ Group Relative Policy Optimization (GRPO) โดยเอา KL regularization และ entropy loss ออก ปัจจัยส่วนลดคำตอบบางส่วนคือ 0.2 ขนาดแบตช์รวมงานภาพ 256 และวิดีโอกับ 3 มิติ 128 อัตราการเรียนรู้ 1×10-6
แต่ละพรอมป์ต์สร้างคำตอบ 16 ชุดที่อุณหภูมิ 1.0 งานภาพและวิดีโอฝึก 1,000 ขั้น ส่วน 3 มิติ 800 ขั้น
ผลจิ๊กซอว์ภาพ
ทดสอบการรับรู้ละเอียดด้วย MMVP, MMStar, MMBench, HR-Bench, V*, MME-RealWorld lite, LISA-Grounding และ OVD-Eval การเข้าใจพื้นที่จากภาพเดียวด้วย VSR, OmniSpatial และ Depth Anything V2 (DA-2K) และความเข้าใจองค์ประกอบด้วย Winoground กับ SugerCrepe++
ฐานเปรียบเทียบคือ ThinkLite-VL, VL-Cogito และ LLaVA-Critic-R1 ซึ่งทั้งหมดมาจาก Qwen2.5-VL-7B ใช้คำตอบสั้นเท่านั้นเพราะ chain-of-thought บางครั้งลดประสิทธิภาพ

Image Jigsaw เหนือกว่าโมเดลฐานในทุกหมวด ได้แก่ การรับรู้ละเอียด พื้นที่จากภาพเดียว และเหตุผลเชิงองค์ประกอบ และเหนือกว่าวิธีฝึกหลังการเรียนรู้เดิม
ผู้เขียนให้เหตุผลว่าการแก้ภาพจิ๊กซอว์บังคับให้โมเดลสนใจรายละเอียดแต่ละชิ้น อนุมานเค้าโครงทั้งหมด และพิจารณาความสัมพันธ์ระหว่างชิ้น จึงช่วยทักษะละเอียด พื้นที่ และองค์ประกอบโดยตรง
ผลจิ๊กซอว์วิดีโอ
ประเมินกับ AoTBench, Vinoground, TOMATO, FAVOR-Bench, TUNA-Bench, Video-MME, TempCompass, TVBench, MotionBench, LVBench, VSI-Bench, Video-TT และ CVBench เทียบกับ Video-R1 ซึ่งฝึกแบบมีผู้สอนก่อนแล้วตามด้วย RL การประเมินรวมกระบวนการเหตุผลเต็มเพราะดีกว่าคำตอบตรง โมเดลจำกัดความละเอียด 256×28×28 และทดสอบที่ 16, 32 และ 64 เฟรม

Video Jigsaw เหนือกว่าฐานอย่างสม่ำเสมอในทุกงานและทุกจำนวนเฟรม
ผลดีเด่นในงานเหตุผลเชิงเวลาและทิศทางอย่าง AoTBench และงานข้ามวิดีโออย่าง CVBench แสดงว่าการเรียงคลิปช่วยให้โมเดลจับความต่อเนื่อง ความสัมพันธ์ระหว่างวิดีโอ และความสอดคล้องของทิศทางได้ดีขึ้น
ผลข้อมูล 3 มิติ
ประเมินกับ SAT-Real, 3DSRBench, ViewSpatial, All-Angles, OmniSpatial, VSI-Bench, SPARBench tiny และ DA-2K

3D Jigsaw เพิ่มผลทั้งการเปรียบเทียบความลึก DA-2K และเกณฑ์การรับรู้สามมิติจากภาพเดียว หลายมุมมอง และวิดีโอมุมมองบุคคลที่หนึ่ง
ผลเพิ่มมากที่สุดอยู่ที่ DA-2K ซึ่งตรงกับงานเรียงความลึก แต่ยังดีขึ้นสม่ำเสมอใน 3DSRBench และ OmniSpatial แบบมุมเดียว, ViewSpatial และ All-Angles แบบหลายมุม และ VSI-Bench แบบวิดีโอบุคคลที่หนึ่ง แสดงว่าวิธีนี้ไม่ได้สอนแค่การเรียงความลึก แต่เพิ่มความสามารถทั่วไปในการรับรู้และให้เหตุผลเกี่ยวกับโครงสร้างสามมิติ
บทสรุป
สิ่งที่บทความยังอธิบายไม่ชัดเจนทั้งหมดคือความสัมพันธ์ที่แน่นอนระหว่างภาพกับคำอธิบายซึ่งทำให้ MLLM ดีขึ้น การเรียนด้วยจิ๊กซอว์ดูคล้ายการพัฒนาทักษะแรกเริ่มของมนุษย์ แต่การเข้าใจพื้นที่ของมนุษย์ดูไม่ผูกกับภาษาเท่าไร ขณะที่บทความแสดงว่าภาษาทำหน้าที่เป็นสะพานสำคัญระหว่างโลกภาพกับความหมายสำหรับ MLLM
* ผู้เขียนใช้คำว่า Multimodal Large Language Models หรือ MLLMs ซึ่งยังพบไม่บ่อย หมายถึงโมเดลที่วิเคราะห์และให้เหตุผลเชิงพื้นที่จากภาพได้มากแต่ไม่สร้างภาพ ศัพท์ในสาขานี้ยังเปลี่ยนแปลงต่อเนื่อง
เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 2 ตุลาคม 2025












