มุมมองของ Anderson
การแก้ไขปัญหาการทำความเข้าใจการสะท้อนของโมเดลการกระจายตัว

นับตั้งแต่ปัญญาประดิษฐ์สร้างความสนใจจากสาธารณชน สาขาวิจัยการมองเห็นของคอมพิวเตอร์ได้เพิ่มความสนใจในการพัฒนาโมเดล AI ที่สามารถเข้าใจและจำลองกฎทางกายภาพได้ อย่างไรก็ตาม การสอนระบบการเรียนรู้ของเครื่องให้จำลองปรากฏการณ์เช่นแรงโน้มถ่วงและ พลศาสตร์ของของเหลว เป็นความท้าทายที่สำคัญในการวิจัยมาตั้งแต่ ห้าปีที่ผ่านมา เป็นอย่างน้อย
เมื่อ โมเดลการกระจายตัวแบบแฝง (LDMs) เข้ามาเป็นกระแสหลักใน AI ที่สร้างสรรค์ในปี 2022 นักวิจัยได้ มุ่งเน้นมากขึ้น ในการแก้ไขข้อจำกัดของ LDM ในการเข้าใจและจำลองปรากฏการณ์ทางกายภาพ ปัญหาได้รับการยอมรับมากขึ้นเมื่อมีการพัฒนา โมเดลวิดีโอสร้างสรรค์ของ OpenAI และการเปิดตัว โมเดลวิดีโอแบบเปิด ที่สำคัญกว่านั้นคือ Hunyuan Video และ Wan 2.1
การสะท้อนอย่างไม่ดี
การวิจัยส่วนใหญ่ที่มุ่งปรับปรุงความเข้าใจของ LDM ในเรื่องฟิสิกส์ มุ่งเน้นไปที่ด้านการจำลองการเดิน การฟิสิกส์ของอนุภาค และด้านอื่นๆ ของการเคลื่อนที่ของนิวตัน ด้านเหล่านี้ได้รับความสนใจเพราะความไม่แม่นยำในพฤติกรรมทางกายภาพขั้นพื้นฐานจะทำลายความสมจริงของวิดีโอที่สร้างโดย AI ทันที
อย่างไรก็ตาม มีเส้นการวิจัยที่เล็กแต่กำลังเติบโตที่เน้นไปที่จุดอ่อนที่ใหญ่ที่สุดของ LDM – ความไม่สามารถ ในการสร้างการสะท้อนที่แม่นยำ

จากเอกสารวิจัยเดือนมกราคม 2025 ‘การสะท้อนความเป็นจริง: การทำให้โมเดลการกระจายตัวสร้างการสะท้อนที่สมจริง’ ตัวอย่างของ ‘ความล้มเหลวในการสะท้อน’ เทียบกับวิธีการของนักวิจัย
ปัญหานี้ยังคงเป็นความท้าทายในยุค CGI และยังคงเป็นปัญหาในอุตสาหกรรมวิดีโอเกม โดยที่ การเรย์เทรซซิ่ง ใช้เพื่อจำลองเส้นทางของแสงเมื่อมันโต้ตอบกับพื้นผิว
การเรย์เทรซซิ่งคำนวณว่าแสงจะสะท้อนหรือผ่านวัตถุเพื่อสร้างการสะท้อน การหักเห และเงาที่สมจริง
อย่างไรก็ตาม การเพิ่มการสะท้อนแต่ละครั้งจะเพิ่มต้นทุนการคำนวณอย่างมาก ดังนั้นการนำไปใช้แบบเรียลไทม์จะต้องแลกเปลี่ยนระหว่างความล่าช้าและความแม่นยำโดยการจำกัดจำนวนการสะท้อนของแสง

การแสดงภาพของการคำนวณแสงเสมือนในสถานการณ์ 3D ที่ใช้เทคโนโลยีและหลักการที่พัฒนาครั้งแรกในช่วงทศวรรษ 1960 และมาถึงจุดสูงสุดระหว่างปี 1982-1993
ปัญหาในการสร้างภาพ
สำหรับเหตุผลนี้ เฟรมเวิร์กที่ได้รับความนิยมก่อนการมาถึงของโมเดลการกระจายตัว เช่น ฟิลด์เรเดียนซ์ประสาท (NeRF) และผู้ท้าทายล่าสุดบางคน เช่น การกระจายกอัสเซียน ยังคงเผชิญกับความท้าทายในการสร้างการสะท้อนที่สมจริง
โครงการ REF2-NeRF เสนอวิธีการสร้างแบบจำลอง NeRF สำหรับฉากที่มีเคสแก้ว ในวิธีนี้ การหักเหและการสะท้อนถูกสร้างแบบจำลองโดยใช้องค์ประกอบที่ขึ้นอยู่กับมุมมองของผู้ชมและไม่ขึ้นอยู่กับมุมมองนั้น วิธีการนี้ช่วยให้นักวิจัยสามารถประมาณพื้นผิวที่เกิดการหักเหได้ และแยกและสร้างแบบจำลองของแสงโดยตรงและสะท้อน

ตัวอย่างจากเอกสาร Ref2Nerf
การแก้ปัญหา NeRF อื่นๆ ในช่วง 4-5 ปีที่ผ่านมา ได้แก่ NeRFReN, Reflecting Reality และโครงการ Planar Reflection-Aware Neural Radiance Fields ของ Meta ในปี 2024
สำหรับ GSplat เอกสารเช่น Mirror-3DGS, Reflective Gaussian Splatting และ RefGaussian ได้ให้คำตอบเกี่ยวกับปัญหาในการสะท้อน ในขณะที่โครงการ Nero ในปี 2023 เสนอวิธีการเฉพาะในการรวมคุณสมบัติการสะท้อนเข้ากับการแสดงภาพประสาท
MirrorVerse
การทำให้โมเดลการกระจายตัวเคารพตรรกะการสะท้อนเป็นเรื่องที่ท้าทายมากกว่าการใช้วิธีการที่ไม่ใช่เชิงสัญลักษณ์ เช่น Gaussian Splatting และ NeRF ในโมเดลการกระจายตัว กฎของประเภทนี้มีแนวโน้มที่จะถูกฝังอย่างน่าเชื่อถือหากข้อมูลการฝึกอบรมมีตัวอย่างที่หลากหลายในหลายๆ สถานการณ์ ทำให้ขึ้นอยู่กับการกระจายและคุณภาพของชุดข้อมูลดั้งเดิม
โดยทั่วไป การปรับปรุงโมเดลการกระจายตัวต้องให้ข้อมูลการฝึกอบรมให้ความสนใจกับฟิสิกส์ของการสะท้อนมากขึ้น อย่างไรก็ตาม พื้นที่อื่นๆ ก็จำเป็นต้องได้รับการดูแลพิเศษในลักษณะเดียวกัน ในบริบทของชุดข้อมูลขนาดใหญ่ การดูแลแบบกำหนดเองมีค่าใช้จ่ายสูงและยากต่อการดำเนินการ
อย่างไรก็ตาม มีวิธีแก้ปัญหาในการสะท้อนของ LDM ที่ปรากฏขึ้นเป็นระยะๆ โครงการ MirrorVerse จากอินเดียเป็นหนึ่งในความพยายามล่าสุด โดยให้เซตข้อมูลและวิธีการฝึกอบรมที่ดีขึ้นเพื่อปรับปรุงสถานะปัจจุบันในความท้าทายนี้

ผลลัพธ์จาก MirrorVerse เทียบกับวิธีการก่อนหน้า
ตามที่เห็นในตัวอย่างด้านบน (รูปภาพในเอกสารวิจัยใหม่) MirrorVerse ปรับปรุงจากวิธีการก่อนหน้าที่แก้ไขปัญหาเดียวกัน แต่ยังไม่สมบูรณ์
ในภาพด้านบนขวา เราจะเห็นว่าหม้อเซรามิกอยู่ทางขวาของที่ควรจะอยู่ และในภาพด้านล่างซึ่งไม่ควรแสดงการสะท้อนของถ้วย มีการสะท้อนที่ไม่ถูกต้องในพื้นที่ด้านขวา ซึ่งไม่สมเหตุสมผลตามมุมมองการสะท้อนที่เป็นธรรมชาติ
ดังนั้น เราจะพิจารณาวิธีการใหม่นี้ไม่เพียงแต่เพราะอาจเป็นสถานะปัจจุบันของการสะท้อนแบบการกระจายตัวเท่านั้น แต่ยังเพื่อแสดงให้เห็นว่าปัญหานี้อาจเป็นปัญหาที่ยากแก้ไขสำหรับโมเดลการกระจายตัวทั้งแบบคงที่และวิดีโอ เนื่องจากตัวอย่างข้อมูลที่จำเป็นสำหรับการสะท้อนน่าจะเกี่ยวข้องกับการกระทำและสถานการณ์เฉพาะ
ดังนั้น ฟังก์ชันนี้ของ LDM อาจยังคงไม่ดีเทียบกับวิธีการเฉพาะโครงสร้าง เช่น NeRF, GSplat และวิธีการ CGI แบบดั้งเดิม
เอกสารวิจัยใหม่ชื่อ MirrorVerse: การผลักดันโมเดลการกระจายตัวให้สะท้อนที่สมจริง มาจากนักวิจัยสามคนจาก Vision and AI Lab, IISc Bangalore และ Samsung R&D Institute ที่ Bangalore เอกสารนี้มี หน้าโครงการ และ ชุดข้อมูลที่ Hugging Face พร้อมโค้ดที่ GitHub
วิธีการ
นักวิจัยชี้ให้เห็นตั้งแต่เริ่มต้นว่าโมเดล เช่น Stable Diffusion และ Flux มีปัญหาในการเคารพคำสั่งการสะท้อน

จากเอกสารวิจัย: โมเดลการสร้างภาพจากข้อความที่ดีที่สุดในปัจจุบัน SD3.5 และ Flux มีปัญหาในการสร้างการสะท้อนที่สม่ำเสมอและแม่นยำทางเรขาคณิตเมื่อสร้างการสะท้อนในฉาก
นักวิจัยได้พัฒนา MirrorFusion 2.0 โมเดลการสร้างภาพจากข้อความที่มีเป้าหมายในการปรับปรุงความสมจริงและความแม่นยำทางเรขาคณิตของการสะท้อนในภาพสังเคราะห์ การฝึกอบรมสำหรับโมเดลนี้ใช้ชุดข้อมูล MirrorGen2 ที่นักวิจัยสร้างขึ้นเพื่อแก้ไขความอ่อนแอในการสร้างแบบจำลองทั่วไปที่พบในวิธีการก่อนหน้า
MirrorGen2 ขยายวิธีการก่อนหน้าโดยการแนะนำ การวางตำแหน่งวัตถุแบบสุ่ม, การหมุนแบบสุ่ม และ การยึดวัตถุอย่างชัดเจน โดยมีเป้าหมายในการรับรองว่าการสะท้อนยังคงสมเหตุสมผลข้ามพื้นที่วัตถุและตำแหน่งที่หลากหลายเมื่อเทียบกับพื้นผิวกระจก

สคีม่าสำหรับการสร้างข้อมูลสังเคราะห์ใน MirrorVerse: ชุดข้อมูลการสร้างแบบจำลองใช้การเพิ่มประสิทธิภาพหลักโดยการวางตำแหน่งแบบสุ่ม การหมุน และการยึดวัตถุภายในฉากโดยใช้ 3D-Positioner
เพื่อเพิ่มความสามารถของโมเดลในการจัดการกับการจัดเรียงพื้นที่ที่ซับซ้อน ชุดข้อมูล MirrorGen2 รวมฉากวัตถุหลายชิ้นที่จัดเรียงตามคู่ที่สอดคล้องกันตามหมวดหมู่ ABO
วัตถุหลักถูกวางตำแหน่งและหมุนแบบสุ่ม และใช้เทคนิคการยึดวัตถุเพื่อป้องกัน ‘อาร์ติแฟคต์ที่ลอยอยู่’ ในการสร้างฉากที่ซับซ้อนยิ่งขึ้น ชุดข้อมูลยังรวมวัตถุหลายชิ้นที่จัดเรียงตามคู่ที่สอดคล้องกันตามหมวดหมู่ ABO

ตัวอย่างจากชุดข้อมูลของนักวิจัยที่มีวัตถุหลายชิ้น พร้อมภาพวิเคราะห์ความลึกและแผนที่ความลึก
ข้อมูลและการทดสอบ
SynMirrorV2
ชุดข้อมูล SynMirrorV2 ของนักวิจัยได้รับการออกแบบมาเพื่อปรับปรุงความหลากหลายและความสมจริงของข้อมูลการสะท้อนสำหรับการฝึกอบรม โดยใช้วัตถุ 3D จาก Objaverse และ Amazon Berkeley Objects (ABO) พร้อมการคัดเลือกและกรองเพิ่มเติมผ่าน OBJECT 3DIT และกระบวนการกรองจาก MirrorFusion V1 เพื่อกำจัดสินทรัพย์ที่มีคุณภาพต่ำ
การก่อสร้างฉากเกี่ยวข้องกับการวางวัตถุเหล่านี้บนพื้นปูพรมจาก CC-Textures และพื้นหลัง HDRI จาก PolyHaven โดยใช้กระจกเต็มผนังหรือกระจกสี่เหลี่ยมที่สูง
การวางตำแหน่งวัตถุแบบสุ่มและการหมุนแบบสุ่มถูกนำมาใช้ และใช้เทคนิคการยึดวัตถุเพื่อป้องกัน ‘อาร์ติแฟคต์ที่ลอยอยู่’
เพื่อจำลองฉากที่ซับซ้อนยิ่งขึ้น ชุดข้อมูลยังรวมวัตถุหลายชิ้นที่จัดเรียงตามคู่ที่สอดคล้องกันตามหมวดหมู่ ABO

ตัวอย่างจากชุดข้อมูลของนักวิจัยที่มีวัตถุหลายชิ้น พร้อมภาพวิเคราะห์ความลึกและแผนที่ความลึก
กระบวนการฝึกอบรม
นักวิจัยได้พัฒนากระบวนการฝึกอบรมแบบสามขั้นตอนสำหรับการฝึกอบรม MirrorFusion 2.0
ในขั้นตอนที่ 1 นักวิจัยได้เริ่มต้นการฝึกอบรมด้วยการนำน้ำหนักของ Stable Diffusion V1.5 มาใช้ และฝึกอบรมโมเดลบนชุดข้อมูล MirrorGen2
ในขั้นตอนที่ 2 โมเดลได้รับการฝึกอบรมเพิ่มเติมบนชุดข้อมูลหลายวัตถุเพื่อสอนให้โมเดลจัดการกับการบดบังและพื้นที่ที่ซับซ้อน
สุดท้าย ในขั้นตอนที่ 3 โมเดลได้รับการฝึกอบรมเพิ่มเติมบนชุดข้อมูล MSD โดยใช้แผนที่ความลึกที่สร้างโดย Matterport3D

ตัวอย่างจากชุดข้อมูล MSD พร้อมภาพวิเคราะห์ความลึกและแผนที่ความลึก
ระหว่างการฝึกอบรม คำสั่งภาษาได้ถูก省略ไป 20% ของเวลาในการฝึกอบรมเพื่อส่งเสริมให้โมเดลใช้ข้อมูลความลึกที่มีอยู่ให้เกิดประโยชน์สูงสุด
การฝึกอบรมใช้ GPU ของ NVIDIA A100 สี่ตัว และอัตราการเรียนรู้ 1e-5 บนขนาดแบทช์ 4 ต่อ GPU โดยใช้ AdamW เป็นตัวเพิ่มประสิทธิภาพ
แผนการฝึกอบรมนี้เพิ่มความยากของงานที่นำเสนอให้กับโมเดลอย่างต่อเนื่อง โดยเริ่มต้นจากฉากสังเคราะห์ที่ง่ายและก้าวหน้าไปสู่ฉากที่ซับซ้อนกว่า โดยมีเป้าหมายในการพัฒนาความสามารถในการถ่ายทอดข้อมูลในโลกแห่งความเป็นจริง
การทดสอบ
นักวิจัยได้ทดสอบ MirrorFusion 2.0 กับ MirrorFusion ซึ่งเป็นรุ่นก่อนหน้า และทดสอบบนชุดข้อมูล MirrorBenchV2
การทดสอบคุณภาพเพิ่มเติมได้ถูกดำเนินการบนชุดข้อมูล MSD และ Google Scanned Objects (GSO)
การประเมินใช้ภาพ 2,991 ภาพสำหรับวัตถุเดียวจากหมวดหมู่ที่เห็นและไม่เห็น และ 300 ฉากสำหรับวัตถุสองชิ้นจาก ABO
ผลลัพธ์แสดงให้เห็นว่า MirrorFusion 2.0 มีประสิทธิภาพดีกว่า MirrorFusion ในการสร้างการสะท้อนที่แม่นยำและสมจริง

ตารางผลลัพธ์สำหรับการทดสอบคุณภาพ
นักวิจัยได้แสดงให้เห็นว่า MirrorFusion 2.0 สามารถสร้างการสะท้อนที่สมจริงและแม่นยำได้ดีกว่า MirrorFusion
ผลลัพธ์เหล่านี้แสดงให้เห็นว่า MirrorFusion 2.0 มีประสิทธิภาพดีกว่า MirrorFusion ในการสร้างการสะท้อนที่แม่นยำและสมจริง
สรุป
แม้ว่าผลลัพธ์บางส่วนในเอกสารวิจัยจะแสดงถึงการปรับปรุงที่น่าประทับใจ แต่สถานะปัจจุบันของการสะท้อนในโมเดลการกระจายตัวยังคงเป็นปัญหาใหญ่
การเพิ่มข้อมูลให้กับโมเดลที่มีอยู่เป็นวิธีการมาตรฐานในการแก้ไขปัญหา แต่ก็มีข้อเสียหลายประการ
การแก้ปัญหาเหล่านี้อาจต้องใช้ความพยายามและเงินจำนวนมาก และยังไม่ชัดเจนว่าปัญหาใดที่ควรได้รับการแก้ไขก่อน
การวิจัยนี้แสดงให้เห็นว่า MirrorFusion 2.0 มีประสิทธิภาพดีกว่า MirrorFusion ในการสร้างการสะท้อนที่แม่นยำและสมจริง
อย่างไรก็ตาม ยังคงต้องมีการวิจัยเพิ่มเติมเพื่อแก้ไขปัญหาเหล่านี้และพัฒนาโมเดลการกระจายตัวที่มีประสิทธิภาพมากขึ้น
เอกสารวิจัยนี้เผยแพร่เมื่อวันจันทร์ที่ 28 เมษายน 2025 และมีการแก้ไขคำผิดทางไวยกรณ์ในย่อหน้าสุดท้ายเมื่อวันที่ 29 เมษายน 2025
ภาพที่กู้คืนจากต้นฉบับ

















