มุมมองของ Anderson

ปั๊มจิ๊กซอว์ช่วยเพิ่มความสามารถในการให้เหตุผลด้านภาพของ AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

การวิจัยใหม่แสดงให้เห็นว่าโมเดล AI สามารถฉลาดขึ้นในการมองเห็นได้โดยการแก้ปั๊มจิ๊กซอว์ การจัดเรียงภาพที่ถูกสับเปลี่ยน วิดีโอ และฉาก 3 มิติ ช่วยให้พวกมันเพิ่มทักษะการมองเห็นโดยไม่ต้องการข้อมูลเพิ่มเติม เลเบล หรือเครื่องมือ

 

ในสถานการณ์ที่การแข่งขันในการผลักดันโมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLMs) ไปข้างหน้า มีเพียงไม่กี่ชัยชนะที่ง่ายและไม่มีมื้ออาหารฟรี

แม้ว่าหลายๆ รุ่นของ FOSS จีนในปี 2025 จะมีต้นทุนในการพัฒนาและใช้งานที่ต่ำกว่า แต่รุ่นของตะวันตกมักจะใช้การแก้ปัญหาโดยการเพิ่มปริมาณข้อมูล ความสามารถในการอนุมาน และการใช้ไฟฟ้ามากขึ้น (แม้ว่าจะไม่ใช่ผู้กำกับอannotator ที่แท้จริง เนื่องจากสิ่งนี้มีค่าใช้จ่ายสูงเกินไป)

ในเอกสารวิจัย ส่วนใหญ่ของแนวทางที่เรียกว่า “ฟรี” ในการพัฒนาสถาปัตยกรรม AI มักจะให้ผลลัพธ์ที่ดีขึ้นเพียงเล็กน้อย หรือผลลัพธ์ที่ดีขึ้นในพื้นที่ที่ไม่ได้ถูกตาม đuổiอย่างมาก อย่างไรก็ตาม การค้นหาสิ่งที่เรียกว่า “หลักการพื้นฐาน” ที่สามารถเร่งความเร็วในการพัฒนานั้นยังคงเป็นเรื่องที่น่าสนใจ

การเก็บชิ้นส่วน

ในขณะที่ไม่ใช่ในประเภทเดียวกัน การทำงานร่วมกันทางวิชาการระหว่างสถาบันจีนอ้างว่าได้ค้นพบว่าการทำให้ MLLMs แก้ปั๊มจิ๊กซอว์ สามารถปรับปรุงประสิทธิภาพของพวกมันได้อย่างเห็นได้ชัด โดยไม่ต้องใช้ระบบเพิ่มเติม โมเดลเสริม หรือกระบวนการ “ติดปีก” อื่นๆ

Visual Jigsaw เป็นเฟรมเวิร์กการฝึกอบรมหลังการฝึกที่ปรับปรุงทักษะการมองเห็นในโมเดลภาษาขนาดใหญ่หลายรูปแบบ โดยการฝึกอบรมบนงานปั๊มจิ๊กซอว์ข้ามภาพ วิดีโอ และข้อมูล 3 มิติ โมเดลเหล่านี้ได้รับการปรับปรุงความเข้าใจที่แม่นยำ ยาก และเชิงประกอบในภาพ วิดีโอที่มีการให้เหตุผลเชิงเวลา และความเข้าใจเชิงเรขาคณิตในฉาก 3 มิติ

Visual Jigsaw เป็นเฟรมเวิร์กการฝึกอบรมหลังการฝึกที่ปรับปรุงทักษะการมองเห็นในโมเดลภาษาขนาดใหญ่หลายรูปแบบ โดยการฝึกอบรมบนงานปั๊มจิ๊กซอว์ข้ามภาพ วิดีโอ และข้อมูล 3 มิติ โมเดลเหล่านี้ได้รับการปรับปรุงความเข้าใจที่แม่นยำ ยาก และเชิงประกอบในภาพ วิดีโอที่มีการให้เหตุผลเชิงเวลา และความเข้าใจเชิงเรขาคณิตในฉาก 3 มิติ Source: https://arxiv.org/pdf/2509.25190

ระบบที่นักวิจัยออกแบบมาเรียกว่า Visual Jigsaw และเกี่ยวข้องกับการฝึกอบรม MLLMs ที่มีอยู่แล้วบนข้อมูลที่ถูกสับเปลี่ยนและกระจายสุ่ม เช่น ปั๊มจิ๊กซอว์

การแสดงภาพของงานปั๊มจิ๊กซอว์ 3 แบบ ในการแก้ปั๊มจิ๊กซอว์ภาพ ภาพจะถูกแบ่งออกเป็นชิ้นส่วนและผสมสุ่ม และโมเดลจะต้องคาดเดาเลย์เอาต์เดิมที่ถูกต้อง ในการแก้ปั๊มจิ๊กซอว์วิดีโอ คลิปจะถูกผสมสุ่ม และโมเดลจะต้องคืนลำดับเวลาเดิม ในการแก้ปั๊มจิ๊กซอว์ 3 มิติ จุดต่างๆ ที่มีความลึกต่างกันจะถูกผสมสุ่ม และโมเดลจะต้องจัดอันดับจากใกล้ไปไกลที่สุด

การแสดงภาพของงานปั๊มจิ๊กซอว์ 3 แบบ ในการแก้ปั๊มจิ๊กซอว์ภาพ ภาพจะถูกแบ่งออกเป็นชิ้นส่วนและผสมสุ่ม และโมเดลจะต้องคาดเดาเลย์เอาต์เดิมที่ถูกต้อง ในการแก้ปั๊มจิ๊กซอว์วิดีโอ คลิปจะถูกผสมสุ่ม และโมเดลจะต้องคืนลำดับเวลาเดิม ในการแก้ปั๊มจิ๊กซอว์ 3 มิติ จุดต่างๆ ที่มีความลึกต่างกันจะถูกผสมสุ่ม และโมเดลจะต้องจัดอันดับจากใกล้ไปไกลที่สุด

วิธีการฝึกอบรมของ Visual Jigsaw ช่วยให้โมเดล AI มีความเข้าใจที่ดีขึ้นเกี่ยวกับข้อมูลการมองเห็นโดยการทำให้พวกมันประกอบภาพที่ถูกสับเปลี่ยน วิดีโอ หรือข้อมูล 3 มิติใหม่

กระบวนการนี้ขึ้นอยู่กับคำมากกว่าภาพ และดังนั้นจึงไม่ต้องการให้โมเดลสร้างภาพหรือใช้ส่วนประกอบการมองเห็นเพิ่มเติม

วิธีการนี้เป็นส่วนหนึ่งของระบบที่เรียกว่า การเรียนรู้แบบเสริมจากผลตอบแทนที่ตรวจสอบได้ (RLVR) โดยที่โมเดลจะได้รับรางวัลสำหรับการตอบที่ถูกต้องตามกฎที่ชัดเจนและอัตโนมัติ และไม่ต้องการการกำกับดูแลของมนุษย์

ตัวอย่างงาน RL ที่แสดงให้เห็นถึงลักษณะการเรียนรู้แบบเสริมของกระบวนการนี้

ตัวอย่างงาน RL ที่แสดงให้เห็นถึงลักษณะการเรียนรู้แบบเสริมของกระบวนการนี้

แม้ว่า MLLMs จะมีงานที่เกี่ยวข้องกับการมองเห็น แต่พวกมันเป็นสถาปัตยกรรมที่ขึ้นอยู่กับภาษา ไม่ได้ออกแบบมาเพื่อสร้างภาพ วิดีโอ หรือการแสดงภาพ 3 มิติ

ตัวอย่างจากงานปั๊มจิ๊กซอว์ภาพ แต่ละแถวแสดงชิ้นส่วนที่ถูกผสมสุ่มที่โมเดลจะต้องจัดเรียงใหม่ในเลย์เอาต์เดิมที่ถูกต้อง

ตัวอย่างจากงานปั๊มจิ๊กซอว์ภาพ แต่ละแถวแสดงชิ้นส่วนที่ถูกผสมสุ่มที่โมเดลจะต้องจัดเรียงใหม่ในเลย์เอาต์เดิมที่ถูกต้อง

ในกรณีใดๆ การฝึกอบรมประเภทนี้จะทำหลังจากที่โมเดลมีความสามารถในการเข้าใจภาพบางอย่างแล้ว

การเข้าใกล้แบบเดิมๆ เช่น เอกสารของสวิสในปี 2017 การเรียนรู้แบบไม่กำกับดูแลของการแสดงภาพโดยการแก้ปั๊มจิ๊กซอว์ ใช้วิธีการเสริมแบบนี้ด้วย แต่มีประสิทธิภาพน้อยกว่าในเครือข่ายประสาทเทียมแบบโครงข่ายที่เชื่อมโยง (CNNs) ซึ่งเป็นสถาปัตยกรรมที่แตกต่างจาก MLLM สมัยใหม่

จากเอกสารที่เผยแพร่ในปี 2017 'การเรียนรู้แบบไม่กำกับดูแลของการแสดงภาพโดยการแก้ปั๊มจิ๊กซอว์' ตัวอย่างแรกของการใช้การแบ่งภาพเป็นชิ้นส่วนเป็นความท้าทายที่มีผลตอบแทนสำหรับระบบประสาทเทียม

จากเอกสารที่เผยแพร่ในปี 2017 ‘การเรียนรู้แบบไม่กำกับดูแลของการแสดงภาพโดยการแก้ปั๊มจิ๊กซอว์’ ตัวอย่างแรกของการใช้การแบ่งภาพเป็นชิ้นส่วนเป็นความท้าทายที่มีผลตอบแทนสำหรับระบบประสาทเทียม Source: https://arxiv.org/pdf/1603.09246

ในการทดสอบ Visual Jigsaw นำไปสู่การปรับปรุงที่สม่ำเสมอและวัดได้ในการทดสอบที่หลากหลาย

วิธีการ

แม้ว่าเราจะพิจารณาวิธีการแบ่งข้อมูลเพื่อใช้กับโมดาลิตี้ทั้งสาม แต่ก่อนอื่นเราควรพิจารณาการออกแบบรางวัลสำหรับระบบใหม่นี้

วิธีการ Visual Jigsaw ให้คะแนนการตอบสนองของโมเดลโดยใช้รางวัลที่มีระดับ ไม่ใช่แค่ผ่านหรือล้มเหลวเท่านั้น หากโมเดลคาดเดาลำดับที่ถูกต้องของชิ้นส่วนปั๊มจิ๊กซอว์ มันจะได้รับรางวัลเต็ม หากคำตอบไม่สมบูรณ์ แต่ใกล้เคียง มันจะได้รับคะแนนที่ลดลงตามปัจจัยส่วนลดเพื่อหลีกเลี่ยงการให้คะแนนสูงเกินไปสำหรับการเดาที่ไม่สมบูรณ์

ภาพ

ในการสร้างปั๊มจิ๊กซอว์สำหรับโมดาลิตี้ ภาพ ภาพจะถูกแบ่งออกเป็นกริดของชิ้นส่วนโดยการแบ่งออกเป็นบล็อกที่มีขนาดเท่ากัน

ตัวอย่างของชิ้นส่วนภาพที่ระบบจะต้องแก้

ตัวอย่างของชิ้นส่วนภาพที่ระบบจะต้องแก้

ชิ้นส่วนเหล่านี้จะถูกจัดเรียงในลำดับที่ตายตัวจากซ้ายบนไปขวาล่าง เช่นเดียวกับลำดับการอ่านในหน้ากระดาษ ก่อนที่จะถูกผสมสุ่ม โมเดลจะถูกนำเสนอชิ้นส่วนที่ผสมสุ่มนี้ และจะต้องค้นหาลำดับที่ถูกต้องโดยการคาดเดาลำดับที่ถูกต้องที่จะคืนเลย์เอาต์เดิม

วิดีโอ

สำหรับงานปั๊มจิ๊กซอว์วิดีโอ วิดีโอจะถูกตัดออกเป็นลำดับของคลิปโดยการแบ่งออกเท่าๆ กันในเวลา แล้วจึงผสมสุ่ม โมเดลจะถูกนำเสนอลำดับที่ผสมสุ่มนี้ และจะต้องค้นหาลำดับเวลาเดิม

ตัวอย่างที่ตัดออกจากความท้าทายของปั๊มจิ๊กซอว์วิดีโอ

ตัวอย่างที่ตัดออกจากความท้าทายของปั๊มจิ๊กซอว์วิดีโอ

การฝึกอบรมสำหรับโมดาลิตี้นี้ใช้วิดีโอ 100,000 รายการจากชุดข้อมูล LLaVA-Video โดยแต่ละวิดีโอจะถูกแบ่งออกเป็น 6 คลิป

ข้อมูล 3 มิติ

งานปั๊มจิ๊กซอว์ 3 มิติเต็มรูปแบบจะเกี่ยวข้องกับการแบ่งพื้นที่ 3 มิติออกเป็นชิ้นส่วนเล็กๆ แล้วฝึกโมเดลให้สร้างเลย์เอาต์เดิมใหม่

อย่างไรก็ตาม โมเดล MLLM โดยทั่วไปไม่ได้ออกแบบมาเพื่อจัดการข้อมูล 3 มิติโดยตรง แต่ขึ้นอยู่กับการตีความเชิงคำอธิบายของภาพหรือวิดีโอ

ตัวอย่างคำถามจาก 3D Spatial Understanding Benchmark ที่ใช้ในการประเมินผลการทำงานเกี่ยวกับการให้เหตุผลเชิงมุมมองและเคลื่อนไหวของกล้อง

ตัวอย่างคำถามจาก 3D Spatial Understanding Benchmark ที่ใช้ในการประเมินผลการทำงานเกี่ยวกับการให้เหตุผลเชิงมุมมองและเคลื่อนไหวของกล้อง

จากภาพ RGB-D แต่ละภาพ โมเดลจะได้รับชิ้นส่วนที่ผสมสุ่มของจุดที่มีความลึกต่างกัน และจะต้องคืนลำดับความลึกที่ถูกต้องโดยใช้เพียงภาพ 2 มิติเป็นข้อมูลอ้างอิง

คำสั่ง RL สำหรับปั๊มจิ๊กซอว์ 3 มิติ

คำสั่ง RL สำหรับปั๊มจิ๊กซอว์ 3 มิติ

แต่ละจุดจะถูกทำเครื่องหมายบนภาพ (ซึ่งจะแสดงให้โมเดลเห็น แต่ไม่ได้แสดงในตัวอย่างคำสั่งด้านบน) และโมเดลจะต้องคาดเดาว่าจุดไหนที่ใกล้ nhất ที่สองที่ใกล้ nhất และอื่นๆ โดยสร้างลำดับความลึกเดิมใหม่โดยไม่ต้องใช้ค่าความลึกที่แท้จริง

การทดสอบ

ในการทดสอบเบื้องต้น ระบบใช้ Qwen2.5-VL-7B-Instruct เป็นโมเดล MLLM พื้นฐาน

การฝึกอบรมใช้อัลกอริทึม Group Relative Policy Optimization (GRPO) โดยไม่มีการปรับให้เหมาะสมของ KL และความสูญเสียของเอนโทรปี

สำหรับการคาดเดาที่ไม่สมบูรณ์ ปัจจัยส่วนลด 0.2 จะถูกใช้ การฝึกอบรมปั๊มจิ๊กซอว์ภาพใช้ขนาดแบตช์ 256 ในขณะที่ปั๊มจิ๊กซอว์วิดีโอและ 3 มิติใช้ขนาดแบตช์ 128 อัตราการเรียนรู้ถูกตั้งค่าไว้ที่ 1×10⁻⁶

ปั๊มจิ๊กซอว์ภาพ

โมเดลปั๊มจิ๊กซอว์ภาพถูกทดสอบในสามประเภทของการทดสอบที่เกี่ยวข้องกับการมองเห็น

ผลการทดสอบแสดงให้เห็นว่าโมเดลปั๊มจิ๊กซอว์ภาพสามารถปรับปรุงความสามารถในการมองเห็นของ MLLM ได้อย่างสม่ำเสมอ

ปั๊มจิ๊กซอว์วิดีโอ

สำหรับปั๊มจิ๊กซอว์วิดีโอ การประเมินถูกดำเนินการในหลายๆ การทดสอบ

ผลการทดสอบแสดงให้เห็นว่าโมเดลปั๊มจิ๊กซอว์วิดีโอสามารถปรับปรุงความสามารถในการมองเห็นของ MLLM ได้อย่างสม่ำเสมอ

ข้อมูล 3 มิติ

สำหรับโมดาลิตี้ 3 มิติ โมเดลถูกประเมินในหลายๆ การทดสอบ

ผลการทดสอบแสดงให้เห็นว่าโมเดลปั๊มจิ๊กซอว์ 3 มิติสามารถปรับปรุงความสามารถในการมองเห็นของ MLLM ได้อย่างสม่ำเสมอ

สรุป

สิ่งที่ไม่ชัดเจนจากเอกสารนี้คือความสัมพันธ์ที่แน่นอนระหว่างภาพและคำอธิบายที่ทำให้ MLLM มีการปรับปรุงที่ดีขึ้น

ในตอนแรก กระบวนการเรียนรู้ผ่านการแก้ปั๊มจิ๊กซอว์อาจดูเหมือนกับการพัฒนาของมนุษย์ แต่การตรวจสอบเอกสารอย่างใกล้ชิดเผยให้เห็นถึงความสำคัญของภาษาในการเชื่อมโยงระหว่างความเป็นจริงที่มองเห็นและเชิงคำอธิบายให้กับ MLLM

* โปรดทราบว่าผู้เขียนเอกสารนี้ต้องการใช้คำว่า ‘โมเดลภาษาขนาดใหญ่หลายรูปแบบ’ ซึ่งย่อเป็น ‘MLLMs’ นี่เป็นคำที่ใช้ไม่ค่อยได้และเกี่ยวข้องกับโมเดลที่สามารถให้เหตุผลและวิเคราะห์ภาพได้อย่างกว้างขวาง แต่ไม่สร้างภาพ

เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 2 ตุลาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai