มุมมองของ Anderson
AI โมเดลโลกสามารถเข้าใจกฎแห่งฟิสิกส์ได้จริงหรือไม่?

ความหวังที่ยิ่งใหญ่สำหรับโมเดล AI ที่ใช้ภาษาและภาพคือว่าพวกเขาจะกลายเป็นโมเดลที่มีความสามารถและความยืดหยุ่นมากขึ้น โดยสามารถนำหลักการของกฎแห่งฟิสิกส์มาใช้ได้เหมือนกับที่เราได้พัฒนาความเข้าใจที่ไม่ซับซ้อนเกี่ยวกับหลักการเหล่านี้ผ่านประสบการณ์ในช่วงแรกของชีวิต
ตัวอย่างเช่น เกมบอลของเด็กๆ มักจะช่วยให้พวกเขาเข้าใจการเคลื่อนที่และผลกระทบของน้ำหนักและพื้นผิวต่อการเคลื่อนที่ ในทำนองเดียวกัน การมีปฏิสัมพันธ์กับสถานการณ์ทั่วไป เช่น การอาบน้ำ การทำอาหารที่มีน้ำ การเล่นน้ำ หรือการว่ายน้ำ จะช่วยให้เราเข้าใจว่าน้ำเคลื่อนที่และตอบสนองต่อแรงโน้มถ่วงได้อย่างไร
แม้แต่การเรียนรู้เกี่ยวกับเหตุการณ์ที่ไม่ค่อยพบเห็น เช่น การเผาไหม้ การระเบิด หรือการกระจายน้ำหนักของสิ่งปลูกสร้างภายใต้แรงกดดัน จะถูกดูดซับโดยไม่รู้ตัวผ่านการดูทีวี หรือวิดีโอในโซเชียลมีเดีย
เมื่อเราเรียนรู้เกี่ยวกับหลักการเบื้องหลังเหล่านี้ในระดับวิชาการ เราก็แค่ “เพิ่มความเข้าใจ” ให้กับแบบจำลองจิตที่ไม่ซับซ้อน (แต่ไม่ถูกต้อง) ที่เรามีเกี่ยวกับพวกมัน
ผู้เชี่ยวชาญในด้านหนึ่ง
ปัจจุบัน โมเดล AI ส่วนใหญ่เป็นแบบ “เฉพาะด้าน” และหลายๆ โมเดลได้รับการฝึกฝนหรือปรับให้เหมาะสมจากข้อมูลภาพหรือวิดีโอที่เฉพาะเจาะจงสำหรับการใช้งานบางอย่าง มากกว่าที่จะถูกออกแบบมาเพื่อสร้างความเข้าใจที่กว้างขึ้นเกี่ยวกับกฎแห่งฟิสิกส์
บางโมเดลอาจให้ความรู้สึกว่าเข้าใจกฎแห่งฟิสิกส์ แต่จริงๆ แล้วพวกเขาอาจแค่ทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน มากกว่าที่จะเข้าใจหลักการเบื้องหลังของการเคลื่อนที่หรือการกระจายตัวในลักษณะที่สามารถสร้างการแสดงผลที่ใหม่และน่าเชื่อถือจากคำสั่งผู้ใช้
ในขณะเดียวกัน โมเดล AI ที่สามารถสร้างความเข้าใจที่แท้จริงเกี่ยวกับกฎแห่งฟิสิกส์จะสามารถสร้างผลลัพธ์ที่สมจริงและน่าเชื่อถือได้ ซึ่งจะช่วยให้พวกมันสามารถสร้างวิดีโอที่แสดงการระเบิด การน้ำท่วม และการชนกันของวัตถุได้อย่างสมจริง
หนึ่งในบทความที่น่าสนใจที่สุดในเดือนพฤศจิกายน ซึ่งนำโดย Bytedance Research ได้สำรวจประเด็นนี้ โดยตรวจสอบช่องว่างระหว่างความสามารถที่เห็นได้และความสามารถที่แท้จริงของโมเดล AI ที่สามารถสร้างโลกได้ เช่น Sora
งานวิจัยสรุปว่าในสถานะปัจจุบันของเทคโนโลยี โมเดล AI ที่สามารถสร้างโลกได้ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ แต่พวกเขามักจะทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน
ความทรงจำของสิ่งที่ผ่านมา
หากไม่มีการสร้างความเข้าใจที่กว้างขึ้น โมเดล AI ที่ได้รับการฝึกฝนจะไม่มากกว่าเครื่องมือที่สามารถค้นหาตัวอย่างจากข้อมูลการฝึกฝนได้ เมื่อคุณค้นหาคำที่เหมาะสม คุณสามารถเรียกใช้ตัวอย่างจากข้อมูลการฝึกฝนได้
ในสถานการณ์นี้ โมเดล AI จะทำงานเหมือนเครื่องมือค้นหาที่ใช้สมอง ไม่ใช่เครื่องมือที่สามารถสร้างความเข้าใจที่กว้างขึ้นหรือสร้างสรรค์ผลลัพธ์ใหม่ๆ ได้
สิ่งนี้เป็นปัญหาที่ถกเถียงกัน เนื่องจากโมเดล AI ที่มีความสามารถในการสร้างความเข้าใจที่กว้างขึ้นและยืดหยุ่นจะมีข้อจำกัดในการสร้างผลลัพธ์ที่ใหม่และน่าเชื่อถือ
โมเดลโลก
ประเด็นหลักที่เกี่ยวข้องกับการสร้างความเข้าใจที่กว้างขึ้นของโมเดล AI คือการสร้างโมเดลโลกที่สามารถเข้าใจและสร้างผลลัพธ์ที่สมจริงได้
โมเดลโลกเป็นโมเดล AI ที่สามารถสร้างและเข้าใจกฎแห่งฟิสิกส์ได้ และสามารถสร้างผลลัพธ์ที่สมจริงและน่าเชื่อถือได้
โมเดลโลกมีความสำคัญอย่างมากในการสร้างวิดีโอและภาพที่สมจริง และสามารถใช้ในการสร้างผลลัพธ์ที่ใหม่และน่าเชื่อถือได้
การผสมผสานที่ยาก
หนึ่งในความหวังที่ยิ่งใหญ่ของโมเดล AI ที่สามารถสร้างโลกได้คือการสร้างความเข้าใจที่กว้างขึ้นเกี่ยวกับกฎแห่งฟิสิกส์ เช่น การเคลื่อนที่ของวัตถุ การกระจายตัวของของเหลว และการชนกันของวัตถุ
หากโมเดล AI สามารถสร้างความเข้าใจที่กว้างขึ้นเกี่ยวกับกฎแห่งฟิสิกส์ได้ พวกมันจะสามารถสร้างผลลัพธ์ที่สมจริงและน่าเชื่อถือได้ เช่น การระเบิด การน้ำท่วม และการชนกันของวัตถุ
然而 หากโมเดล AI ได้รับการฝึกฝนจากข้อมูลวิดีโอที่แสดงเหตุการณ์เหล่านี้ พวกมันอาจจะสามารถสร้างผลลัพธ์ที่สมจริงได้ แต่ไม่ได้เข้าใจกฎแห่งฟิสิกส์ที่แท้จริง
ข้อจำกัดทางกายภาพ
งานวิจัยใหม่ซึ่งเป็นความร่วมมือระหว่าง Bytedance, Tsinghua University และ Technion แสดงให้เห็นว่าโมเดล AI เช่น Sora ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ แต่พวกเขามักจะทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน
งานวิจัยนี้ตรวจสอบข้อจำกัดของโมเดล AI ในการสร้างความเข้าใจที่กว้างขึ้นเกี่ยวกับกฎแห่งฟิสิกส์ และพบว่าโมเดล AI เหล่านี้ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ แต่พวกเขามักจะทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน
วิธีการและข้อมูล
นักวิจัยใช้โมเดล VAE และ DiT เพื่อสร้างตัวอย่างวิดีโอ และฝึกฝนโมเดลเหล่านี้ด้วยข้อมูลวิดีโอและภาพ
ข้อมูลวิดีโอที่ใช้ในการฝึกฝนมาจากแหล่งข้อมูลต่างๆ เช่น Vimeo-90K, Panda-70m และ HDVG
การพลิกผัน
ในระหว่างการฝึกฝน นักวิจัยพบว่าการพลิกผันของวิดีโอสามารถทำให้โมเดล AI มีความสามารถในการสร้างผลลัพธ์ที่สมจริงได้ แต่ก็สามารถทำให้โมเดล AI มีความสามารถในการสร้างผลลัพธ์ที่ไม่สมจริงได้เช่นกัน
การทดสอบ
นักวิจัยทดสอบโมเดล AI ด้วยการทดสอบสองแบบ คือ การทดสอบการเคลื่อนที่และ碰撞ของวัตถุ และการทดสอบการสร้างผลลัพธ์ที่สมจริง
ผลการทดสอบแสดงให้เห็นว่าโมเดล AI ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ แต่พวกเขามักจะทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน
สรุป
ผลการทดสอบแสดงให้เห็นว่าโมเดล AI ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ แต่พวกเขามักจะทำซ้ำตัวอย่างจากข้อมูลการฝึกฝนของพวกมัน
นี่แสดงให้เห็นว่าโมเดล AI ที่สามารถสร้างโลกได้ไม่ได้เข้าใจกฎแห่งฟิสิกส์จริงๆ และการเพิ่มข้อมูลการฝึกฝนไม่ได้ช่วยให้โมเดล AI เข้าใจกฎแห่งฟิสิกส์ได้ดีขึ้น












