โมเดลและแพลตฟอร์ม AI

Uni3D: การสำรวจการแสดงผล 3D ที่เป็นเอกภาพในระดับใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การขยายขนาดการแสดงผลข้อความและภาพถ่ายเป็นจุดสนใจหลักของการวิจัยในช่วงไม่กี่ปีที่ผ่านมา การพัฒนาและวิจัยที่ดำเนินการในช่วงไม่กี่ปีที่ผ่านมาได้นำไปสู่การปฏิวัติหลายอย่างในด้านการเรียนรู้ภาษาและวิสัยทัศน์ อย่างไรก็ตาม แม้ว่าการขยายขนาดการแสดงผลข้อความและภาพถ่ายจะถูกพูดถึงอย่างมาก แต็นการขยายขนาดการแสดงผลสำหรับฉากและวัตถุ 3 มิติยังไม่ได้รับการอภิปรายอย่างเพียงพอ

วันนี้ เราจะพูดถึง Uni3D ซึ่งเป็นแบบจำลองพื้นฐาน 3 มิติที่มีเป้าหมายในการสำรวจการแสดงผล 3 มิติที่เป็นเอกภาพ Uni3D ใช้โครงสร้าง ViT ที่ถูกเริ่มต้นด้วย 2 มิติและถูกฝึกฝนแบบ end-to-end เพื่อจัดตำแหน่งคุณลักษณะภาพถ่าย-ข้อความกับคุณลักษณะคลาวด์พอยต์ 3 มิติ

Uni3D ใช้งานก่อนการฝึกและโครงสร้างที่เรียบง่ายเพื่อใช้ประโยชน์จากแบบจำลอง 2 มิติที่ถูกฝึกฝนไว้แล้วและแบบจำลองที่จัดตำแหน่งภาพถ่าย-ข้อความเป็นเป้าหมาย โดยใช้แนวทางนี้เพื่อปลดปล่อยศักยภาพเต็มที่ของแบบจำลอง 2 มิติและกลยุทธ์ในการขยายขนาดไปสู่โลก 3 มิติ

ในบทความนี้ เราจะพูดถึงการเรียนรู้การแสดงผล 3 มิติและ Uni3D โดยสำรวจแนวคิดพื้นฐานและโครงสร้างของแบบจำลอง ลองเริ่มต้นกัน

Uni3D และการเรียนรู้การแสดงผล 3 มิติ: การแนะนำ

ในช่วงไม่กี่ปีที่ผ่านมา วิสัยทัศน์คอมพิวเตอร์ได้กลายเป็นหนึ่งในโดเมนที่มีการลงทุนมากที่สุดในอุตสาหกรรม AI หลังจากความก้าวหน้าที่สำคัญในโครงสร้างวิสัยทัศน์ 2 มิติ ผู้พัฒนาได้เปลี่ยนความสนใจไปสู่วิสัยทัศน์ 3 มิติ ซึ่งรวมถึงการเรียนรู้การแสดงผล 3 มิติ การเรียนรู้นี้รวมเอาแง่มุมของกราฟิกคอมพิวเตอร์ การเรียนรู้ของเครื่อง วิสัยทัศน์คอมพิวเตอร์ และคณิตศาสตร์เข้าด้วยกันเพื่อทำให้การประมวลผลและความเข้าใจของเรื่องราว 3 มิติเป็นไปโดยอัตโนมัติ การพัฒนาที่รวดเร็วของเซ็นเซอร์ 3 มิติ เช่น LiDAR และการประยุกต์ใช้ในอุตสาหกรรม AR/VR ได้นำไปสู่การเรียนรู้การแสดงผล 3 มิติที่ได้รับความสนใจมากขึ้น

แม้ว่าโครงสร้างที่มีอยู่จะแสดงความก้าวหน้าที่น่าประทับใจในด้านสถาปัตยกรรมแบบจำลอง 3 มิติ การสร้างแบบจำลองที่มุ่งเน้นไปที่งาน และวัตถุประสงค์การเรียนรู้ แต่ส่วนใหญ่จะสำรวจสถาปัตยกรรม 3 มิติในระดับที่ค่อนข้างเล็ก โดยมีข้อมูลและพารามิเตอร์ที่จำกัด และสถานการณ์งานที่จำกัด ความท้าทายในการเรียนรู้การแสดงผล 3 มิติที่สามารถขยายขนาดและนำไปใช้กับงานในโลกแห่งความเป็นจริงยังคงไม่ได้รับการสำรวจอย่างเต็มที่

การเคลื่อนไหวไปสู่การขยายขนาดแบบจำลองภาษาที่ถูกฝึกฝนไว้แล้วได้ช่วยให้เกิดการปฏิวัติในด้านการประมวลผลภาษา自然 และงานล่าสุดได้แสดงให้เห็นว่าการแปลความก้าวหน้าจากภาษาไปสู่ 2 มิติ โดยใช้ข้อมูลและเทคนิคการขยายขนาดแบบจำลอง ทำให้ผู้พัฒนาได้ลองและพยายามที่จะเรียนรู้การแสดงผล 3 มิติที่สามารถขยายขนาดและนำไปใช้กับงานในโลกแห่งความเป็นจริง

Uni3D เป็นโครงสร้างการฝึกฝนที่มีเป้าหมายในการเรียนรู้การแสดงผล 3 มิติที่มีขนาดใหญ่ โดยทดสอบขีดจำกัดที่ระดับพารามิเตอร์มากกว่า 1 พันล้าน ตัวเลขมากกว่า 10 ล้านภาพที่จับคู่กับข้อความมากกว่า 70 ล้านข้อความ และรูปร่าง 3 มิติมากกว่า 1 ล้านรูป รูปด้านล่างเปรียบเทียบความแม่นยำของการจำแนกประเภท zero-shot กับพารามิเตอร์ภายในโครงสร้าง Uni3D โครงสร้าง Uni3D ขยายขนาดการแสดงผล 3 มิติจาก 6 ล้านไปถึงมากกว่า 1 พันล้าน

โครงสร้าง Uni3D ประกอบด้วย ViT หรือ Vision Transformer เป็นตัวเข้ารหัส 3 มิติที่ถูกฝึกฝนแบบ end-to-end เพื่อจัดตำแหน่งคุณลักษณะภาพถ่าย-ข้อความกับคุณลักษณะคลาวด์พอยต์ 3 มิติ โครงสร้าง Uni3D ใช้งานก่อนการฝึกและโครงสร้างที่เรียบง่ายเพื่อใช้ประโยชน์จากแบบจำลอง 2 มิติที่ถูกฝึกฝนไว้แล้วและแบบจำลองที่จัดตำแหน่งภาพถ่าย-ข้อความเป็นเป้าหมาย โดยใช้แนวทางนี้เพื่อปลดปล่อยศักยภาพเต็มที่ของแบบจำลอง 2 มิติและกลยุทธ์ในการขยายขนาดไปสู่โลก 3 มิติ

  1. การขยายขนาดแบบจำลอง จาก 6M ถึงมากกว่า 1 พันล้านพารามิเตอร์
  2. การเริ่มต้นด้วย 2 มิติและแบบจำลองที่จัดตำแหน่งภาพถ่าย-ข้อความจากวิสัยทัศน์แบบ self-supervised
  3. การขยายขนาดแบบจำลองเป้าหมายภาพถ่าย-ข้อความจาก 150 ล้านถึงมากกว่า 1 พันล้านพารามิเตอร์

ภายใต้โครงสร้างที่มีเอกภาพและยืดหยุ่นของ Uni3D ผู้พัฒนาได้สังเกตเห็นการเพิ่มขึ้นของประสิทธิภาพเมื่อขยายขนาดแต่ละส่วน การเรียนรู้การแสดงผล 3 มิติในระดับใหญ่ยังได้รับประโยชน์อย่างมากจากกลยุทธ์ที่สามารถใช้ร่วมกันระหว่าง 2 มิติและ 3 มิติ

ตามที่เห็นได้จากภาพด้านล่าง โครงสร้าง Uni3D แสดงให้เห็นถึงการเพิ่มขึ้นของประสิทธิภาพเมื่อเทียบกับผลงานก่อนหน้านี้ในสถานการณ์ few-shot และ zero-shot นอกจากนี้ โครงสร้าง Uni3D ยังสามารถให้ผลลัพธ์ที่แม่นยำและดีเยี่ยมเมื่อทำงานอื่นๆ เช่น การแบ่งส่วนส่วนและความเข้าใจโลกเปิด

โครงสร้าง Uni3D มีเป้าหมายที่จะลดช่องว่างระหว่างวิสัยทัศน์ 2 มิติและ 3 มิติ โดยการขยายขนาดแบบจำลองพื้นฐาน 3 มิติ โดยใช้แนวทางการฝึกฝนที่เป็นเอกภาพและเรียบง่ายเพื่อเรียนรู้การแสดงผล 3 มิติที่มีความแข็งแรงมากขึ้นในการทำงานต่างๆ

Uni3D: งานที่เกี่ยวข้อง

โครงสร้าง Uni3D ได้รับแรงบันดาลใจและเรียนรู้จากงานที่เกี่ยวข้องกับการเรียนรู้การแสดงผล 3 มิติและแบบจำลองพื้นฐาน โดยเฉพาะอย่างยิ่งภายใต้โหมดที่แตกต่างกัน

การเรียนรู้การแสดงผล 3 มิติ

การเรียนรู้การแสดงผล 3 มิติใช้คลาวด์พอยต์สำหรับการทำความเข้าใจวัตถุ 3 มิติ และสาขานี้ได้รับการสำรวจโดยผู้พัฒนาหลายคนในช่วงไม่กี่ปีที่ผ่านมา และได้สังเกตเห็นว่าคลาวด์พอยต์เหล่านี้สามารถถูกฝึกฝนแบบ self-supervised โดยใช้งานก่อนการฝึก 3 มิติเฉพาะ เช่น การสร้างแบบจำลอง mask point, การสร้างแบบจำลอง self-reconstruction และการเรียนรู้แบบ contrastive

อย่างไรก็ตาม วิธีการเหล่านี้ทำงานกับข้อมูลที่จำกัดและไม่ได้สำรวจการแสดงผลหลายโหมดจาก 2 มิติหรือ NLP อย่างไรก็ตาม ความสำเร็จล่าสุดของโครงสร้าง CLIP ที่ให้ประสิทธิภาพสูงในการเรียนรู้แนวคิดภาพถ่ายจากข้อความดิบโดยใช้เทคนิคการเรียนรู้แบบ contrastive และพยายามที่จะเรียนรู้การแสดงผล 3 มิติโดยการจัดตำแหน่งคุณลักษณะภาพถ่าย-ข้อความและคลาวด์พอยต์โดยใช้เทคนิคการเรียนรู้แบบ contrastive เช่นกัน

แบบจำลองพื้นฐาน

ผู้พัฒนาได้ทำงานอย่างเต็มที่ในการออกแบบแบบจำลองพื้นฐานเพื่อขยายขนาดและรวมการแสดงผลหลายโหมด สำหรับตัวอย่าง ในโดเมน NLP ผู้พัฒนาได้ทำงานในการสร้างโครงสร้างที่สามารถขยายขนาดแบบจำลองภาษาที่ถูกฝึกฝนไว้แล้ว และได้ปฏิวัติอุตสาหกรรม NLP อย่างช้าๆ นอกจากนี้ การพัฒนายังสามารถสังเกตได้ในโดเมนวิสัยทัศน์ 2 มิติ เนื่องจากผู้พัฒนาได้ทำงานในการสร้างโครงสร้างที่ใช้เทคนิคการขยายขนาดข้อมูลและแบบจำลองเพื่อช่วยให้เกิดความก้าวหน้าจากภาษาไปสู่ 2 มิติ แม้ว่าโครงสร้างเหล่านี้จะยากที่จะทำซ้ำสำหรับแบบจำลอง 3 มิติเนื่องจากข้อมูล 3 มิติที่จำกัดและความท้าทายในการรวมและขยายขนาดโครงสร้าง 3 มิติ

โดยการเรียนรู้จากสองโดเมนนี้ ผู้พัฒนาได้สร้างโครงสร้าง Uni3D ซึ่งเป็นแบบจำลองพื้นฐาน 3 มิติแรกที่มีพารามิเตอร์มากกว่า 1 พันล้าน โดยใช้โครงสร้าง Vision Transformer ที่เป็นเอกภาพ ซึ่งช่วยให้ผู้พัฒนาได้ขยายขนาดโครงสร้าง Uni3D โดยใช้กลยุทธ์การขยายขนาด 2 มิติหรือ NLP

Uni3D: วิธีการและโครงสร้าง

ภาพด้านบนแสดงให้เห็นถึงภาพรวมของโครงสร้าง Uni3D ซึ่งเป็นโครงสร้างการฝึกฝนที่มีเป้าหมายในการเรียนรู้การแสดงผล 3 มิติในระดับใหญ่ ผู้พัฒนาใช้ข้อความมากกว่า 70 ล้านข้อความและภาพถ่ายมากกว่า 10 ล้านภาพที่จับคู่กับรูปร่าง 3 มิติมากกว่า 1 ล้านรูปเพื่อขยายขนาดโครงสร้าง Uni3D ถึงมากกว่า 1 พันล้านพารามิเตอร์ โครงสร้าง Uni3D ใช้ ViT หรือ Vision Transformer เป็นตัวเข้ารหัส 3 มิติที่ถูกฝึกฝนแบบ end-to-end เพื่อจัดตำแหน่งคุณลักษณะภาพถ่าย-ข้อความกับคุณลักษณะคลาวด์พอยต์ 3 มิติ

การขยายขนาดโครงสร้าง Uni3D

งานก่อนหน้านี้เกี่ยวกับการเรียนรู้การแสดงผลคลาวด์พอยต์ традиitionally มุ่งเน้นไปที่การออกแบบโครงสร้างแบบจำลองที่เฉพาะเจาะจงซึ่งให้ประสิทธิภาพที่ดีกว่าในหลายๆ งาน และทำงานกับข้อมูลที่จำกัดเนื่องจากขนาดของชุดข้อมูลที่เล็ก อย่างไรก็ตาม การศึกษาล่าสุดได้พยายามที่จะสำรวจความเป็นไปได้ในการใช้การฝึกฝนแบบ scalable ใน 3 มิติ แต่ไม่มีผลลัพธ์ที่สำคัญเนื่องจากข้อมูล 3 มิติที่จำกัด เพื่อแก้ปัญหาการขยายขนาดของโครงสร้าง 3 มิติ โครงสร้าง Uni3D ใช้โครงสร้าง Transformer ที่เรียบง่ายซึ่งคล้ายกับ Vision Transformer และสามารถแก้ปัญหาการขยายขนาดโดยใช้กลยุทธ์การขยายขนาด 2 มิติหรือ NLP

งานก่อนหน้านี้เกี่ยวกับการเรียนรู้การแสดงผลคลาวด์พอยต์ традиitionally มุ่งเน้นไปที่การออกแบบโครงสร้างแบบจำลองที่เฉพาะเจาะจงซึ่งให้ประสิทธิภาพที่ดีกว่าในหลายๆ งาน และทำงานกับข้อมูลที่จำกัดเนื่องจากขนาดของชุดข้อมูลที่เล็ก อย่างไรก็ตาม การศึกษาล่าสุดได้พยายามที่จะสำรวจความเป็นไปได้ในการใช้การฝึกฝนแบบ scalable ใน 3 มิติ แต่ไม่มีผลลัพธ์ที่สำคัญเนื่องจากข้อมูล 3 มิติที่จำกัด เพื่อแก้ปัญหาการขยายขนาดของโครงสร้าง 3 มิติ โครงสร้าง Uni3D ใช้โครงสร้าง Transformer ที่เรียบง่ายซึ่งคล้ายกับ Vision Transformer และสามารถแก้ปัญหาการขยายขนาดโดยใช้กลยุทธ์การขยายขนาด 2 มิติหรือ NLP

การเริ่มต้น Uni3D

อีกหนึ่งความท้าทายที่งานก่อนหน้านี้พบคือความยากในการรวมและความเสี่ยงของการ overfitting เนื่องจากขนาดของแบบจำลองที่ใหญ่ การเริ่มต้นแบบจำลอง 3 มิติแยกกันโดยใช้งานก่อนการฝึก 3 มิติเฉพาะและตั้งค่าพารามิเตอร์ที่ถูกฝึกฝนไว้แล้วเป็นวิธีการที่มีประสิทธิภาพในการแก้ปัญหานี้ อย่างไรก็ตาม วิธีการนี้มีค่าใช้จ่ายในการฝึกฝนที่สูงและยากที่จะสร้างการเริ่มต้นแบบจำลองที่แข็งแรงสำหรับการเรียนรู้หลายโหมดเนื่องจากข้อมูล 3 มิติที่จำกัด

โครงสร้าง Uni3D ใช้โครงสร้าง Transformer ที่เรียบง่ายซึ่งคล้ายกับ ViT โดยใช้แนวทางนี้ โครงสร้าง Uni3D สามารถใช้แบบจำลองที่ถูกฝึกฝนไว้แล้วจากโหมดอื่นๆ เพื่อเริ่มต้นการฝึกฝน

การเทียบเคียงหลายโหมด

โครงสร้าง Uni3D พยายามที่จะเรียนรู้การเทียบเคียงหลายโหมดระหว่างภาพถ่าย ภาษา และคลาวด์พอยต์ โดยใช้แนวทางที่คล้ายกับ OpenShape และ ULIP เพื่อเปรียบเทียบผลลัพธ์กับวิธีการอื่นๆ โครงสร้าง Uni3D ใช้ชุดข้อมูลที่รวมกันของ OpenShape สำหรับการฝึกฝน ซึ่งประกอบด้วยชุดข้อมูล 3 มิติ 4 ชุด

  1. Objaverse
  2. ShapeNet
  3. 3D-FUTURE
  4. ABO

การทดลองและผลลัพธ์

โครงสร้าง Uni3D ถูกทดสอบในหลายๆ สถานการณ์และหลายๆ งาน รวมถึงการจำแนกประเภท zero-shot และ few-shot การทำความเข้าใจโลกเปิด และอื่นๆ ลองพิจารณาผลลัพธ์เหล่านี้

การจำแนกประเภท zero-shot

เพื่อประเมินประสิทธิภาพของโครงสร้าง Uni3D ในการจำแนกประเภท zero-shot ผู้พัฒนาได้ทดลองใน 3 ชุดข้อมูล รวมถึง ModelNet, ScanObjNN และ Objaverse-LVIS ชุดข้อมูล ModelNet และ ScanObjNN เป็นชุดข้อมูลที่ใช้กันอย่างแพร่หลายสำหรับการจำแนกประเภท และประกอบด้วยวัตถุ 15 และ 40 ชนิดตามลำดับ ในขณะที่ชุดข้อมูล Objaverse-LVIS เป็นชุดข้อมูลที่สะอาดและบำบัดที่ประกอบด้วยวัตถุมากกว่า 40,000 ชิ้นในมากกว่า 1,100 ชนิด

การตรวจสอบเชิงเส้น few-shot

ใน AI การตรวจสอบเชิงเส้นเป็นวิธีการทั่วไปที่ใช้ในการประเมินการแสดงผลที่แบบจำลองเรียนรู้ เพื่อประเมินความสามารถในการตรวจสอบเชิงเส้นของ Uni3D ผู้พัฒนาได้แช่พารามิเตอร์ของ Uni3D โดยใช้การตั้งค่าทั่วไปเช่น OpenShape จากนั้นฝึกแบบจำลองเชิงเส้นสำหรับ Uni3D โดยใช้ป้ายกำกับ few-shot รูปด้านล่างแสดงให้เห็นถึงความสามารถในการตรวจสอบเชิงเส้นของโครงสร้างต่างๆ ในชุดข้อมูล Objaverse-LVIS และแสดงให้เห็นถึงประสิทธิภาพเฉลี่ยของแบบจำลองใน 10 เมล็ดที่สุ่มได้ ตามที่เห็นได้ โครงสร้าง Uni3D ให้ผลลัพธ์ที่ดีกว่าวิธีการอื่นๆ ในสถานการณ์ few-shot

การทำความเข้าใจโลกเปิด

เพื่อประเมินความสามารถของโครงสร้าง Uni3D ในการทำความเข้าใจวัตถุและรูปร่างในโลกแห่งความเป็นจริง ผู้พัฒนาได้ใช้ชุดข้อมูล ScanNet และ CLIP เพื่อสำรวจประสิทธิภาพของ Uni3D ในการทำความเข้าใจโลกเปิด

การค้นหาข้ามโหมด

การแสดงผลหลายโหมดที่เรียนรู้โดยโครงสร้าง Uni3D ช่วยให้โครงสร้างสามารถค้นหารูปร่าง 3 มิติได้จากข้อความหรือภาพถ่ายโดยธรรมชาติ เพื่อค้นหารูปร่าง 3 มิติ โมเดลคำนวณความคล้ายคลึงกันของคอซีนระหว่างการฝังของรูปร่าง 3 มิติและข้อความหรือภาพถ่ายที่ต้องการ จากนั้นใช้อัลกอริทึม KNN หรือ K Nearest Neighbour เพื่อค้นหารูปร่าง 3 มิติที่คล้ายกับข้อความหรือภาพถ่ายที่ต้องการมากที่สุด

ในคอลัมน์แรก โมเดลใช้ภาพถ่าย 2 ภาพที่ต้องการเพื่อค้นหารูปร่าง 3 มิติที่คล้ายกับภาพถ่ายที่ต้องการมากที่สุด ในคอลัมน์ที่สอง โมเดลใช้ภาพถ่าย 2 ภาพที่ต้องการเพื่อค้นหารูปร่าง 3 มิติที่คล้ายกับภาพถ่ายทั้งสองภาพที่ต้องการ ในคอลัมน์สุดท้าย โมเดลใช้ข้อความที่ต้องการเพื่อค้นหารูปร่าง 3 มิติที่คล้ายกับข้อความที่ต้องการมากที่สุด

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง Uni3D ซึ่งเป็นโครงสร้างการฝึกฝนที่มีเป้าหมายในการเรียนรู้การแสดงผล 3 มิติในระดับใหญ่ โดยทดสอบขีดจำกัดที่ระดับพารามิเตอร์มากกว่า 1 พันล้าน ผู้พัฒนาได้สร้างโครงสร้าง Uni3D โดยใช้โครงสร้าง Vision Transformer ที่เป็นเอกภาพ ซึ่งช่วยให้ผู้พัฒนาได้ขยายขนาดโครงสร้าง Uni3D โดยใช้กลยุทธ์การขยายขนาด 2 มิติหรือ NLP นอกจากนี้ โครงสร้าง Uni3D ยังสามารถใช้ประโยชน์จากแบบจำลอง 2 มิติที่ถูกฝึกฝนไว้แล้วและกลยุทธ์ในการขยายขนาดไปสู่โลก 3 มิติ ผลการทดลองได้แสดงให้เห็นถึงศักยภาพที่ยิ่งใหญ่ของโครงสร้าง Uni3D ในการให้ผลลัพธ์ที่แม่นยำและดีเยี่ยมในหลายๆ สถานการณ์ และสามารถเอาชนะโครงสร้างที่มีอยู่ได้

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล