โมเดลและแพลตฟอร์ม AI

รูปภาพกระจาย : การพยายามสร้างแบบจำลอง 3D จากมุมมองเดียวที่เร็วที่สุด

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การสร้างแบบจำลอง 3D จากมุมมองเดียวโดยใช้เครือข่ายการถ่ายทอดมีความสามารถที่น่าประทับใจ การสร้างแบบจำลอง 3D จากมุมมองเดียวสามารถสร้างแบบจำลอง 3D ของวัตถุใดๆ โดยใช้รูปภาพเดียวเป็นข้อมูลอ้างอิง ทำให้เป็นหนึ่งในหัวข้อการวิจัยที่ร้อนแรงที่สุดในด้านการมองเห็นของคอมพิวเตอร์

ตัวอย่างเช่น มองไปที่รถจักรยานยนต์ในรูปภาพข้างบน การสร้างโครงสร้าง 3D ของรถจักรยานยนต์นั้นต้องใช้กระบวนการที่ซับซ้อนซึ่งรวมถึงการผสมผสานสัญญาณจากภาพระดับต่ำกับข้อมูลเชิงวิชาการระดับสูงและความรู้เกี่ยวกับการจัดเรียงโครงสร้างของส่วนต่างๆ

เนื่องจากระบวนการที่ซับซ้อน การสร้างแบบจำลอง 3D จากมุมมองเดียวจึงเป็นความท้าทายที่สำคัญในด้านการมองเห็นของคอมพิวเตอร์ ในการปรับปรุงประสิทธิภาพของการสร้างแบบจำลอง 3D จากมุมมองเดียว ผู้พัฒนาได้ทำงานกับ Splatter Image ซึ่งเป็นวิธีการที่มุ่งหมายเพื่อให้ได้การสร้างรูปทรงและลักษณะ 3D ของวัตถุจากมุมมองเดียวที่เร็วที่สุด

Splatter Image ใช้วิธีการ Gaussian Splatting ซึ่งเป็นวิธีการสร้างภาพ 3D และการแสดงภาพแบบเรียลไทม์ โดยใช้เทคนิคการเรียนรู้ของเครื่องจักรเพื่อเรียนรู้พารามิเตอร์ของแต่ละ Gaussian วิธีการนี้ไม่ต้องการการฝึกอบรมระหว่างการแสดงภาพ ทำให้การแสดงภาพเร็วขึ้น

เมื่อเร็วๆ นี้ วิธีการ Gaussian Splatting ได้ถูกนำไปใช้โดยโมเดลการสร้างแบบจำลอง 3D จากหลายมุมมองสำหรับการแสดงภาพแบบเรียลไทม์ การปรับขนาดที่ดีขึ้น และการฝึกอบรมที่รวดเร็ว แต่ Splatter Image เป็นเฟรมเวิร์กแรกที่ใช้วิธีการ Gaussian Splatting สำหรับการสร้างแบบจำลอง 3D จากมุมมองเดียว

ในบทความนี้ เราจะสำรวจว่า Splatter Image ใช้วิธีการ Gaussian Splatting เพื่อให้ได้การสร้างแบบจำลอง 3D จากมุมมองเดียวที่เร็วที่สุดได้อย่างไร

รูปภาพกระจาย : การพยายามสร้างแบบจำลอง 3D จากมุมมองเดียวที่เร็วที่สุด

ตามที่กล่าวไว้ก่อนหน้านี้ Splatter Image เป็นวิธีการสร้างแบบจำลอง 3D จากมุมมองเดียวที่เร็วที่สุดโดยใช้วิธีการ Gaussian Splatting Splatter Image เป็นเฟรมเวิร์กแรกที่ใช้วิธีการ Gaussian Splatting สำหรับการสร้างแบบจำลอง 3D จากมุมมองเดียว เนื่องจากโดยปกติแล้ววิธีการ Gaussian Splatting จะใช้สำหรับการสร้างแบบจำลอง 3D จากหลายมุมมอง

Splatter Image ขึ้นอยู่กับคุณภาพการแสดงภาพและความเร็วของวิธีการ Gaussian Splatting เพื่อสร้างแบบจำลอง 3D การแสดงภาพ 3D ของ Splatter Image มีการออกแบบที่ตรงไปตรงมา โดยใช้เครือข่ายการถ่ายทอดภาพ 2D เพื่อคาดการณ์ Gaussian 3D ต่อพิกเซลของภาพเข้า และแมปภาพเข้าไปใน Gaussian 3D ต่อพิกเซล

แม้ว่ากระบวนการจะง่ายและตรงไปตรงมา แต่ก็มีบางความท้าทายที่ Splatter Image ต้องเผชิญเมื่อใช้วิธีการ Gaussian Splatting เพื่อสร้าง Gaussian 3D สำหรับการแสดงภาพ 3D จากมุมมองเดียว ความท้าทายหลักคือการออกแบบเครือข่ายที่สามารถรับภาพวัตถุเป็นข้อมูลเข้าและสร้าง Gaussian mixture ที่แสดงถึงทุกด้านของภาพเป็นข้อมูลออก

เพื่อแก้ปัญหานี้ Splatter Image ใช้ประโยชน์จากข้อเท็จจริงที่ว่าแม้ว่า Gaussian mixture ที่สร้างขึ้นจะเป็นชุดหรือคอลเลกชั่นที่ไม่มีลำดับ แต่ก็สามารถจัดเก็บในโครงสร้างข้อมูลที่มีลำดับได้ ดังนั้น เฟรมเวิร์กจึงใช้ภาพ 2D เป็นภาชนะสำหรับ Gaussian 3D ซึ่งเป็นผลให้ทุกพิกเซลในภาชนะมีพารามิเตอร์ของ Gaussian หนึ่งตัว รวมถึงคุณสมบัติเช่นรูปร่าง ความโปร่งใส และสี

โดยการเก็บเซต Gaussian 3D ในภาพ Splatter Image สามารถลดอุปสรรคในการสร้างแบบจำลองที่เกิดขึ้นเมื่อเรียนรู้เครือข่ายการถ่ายทอดภาพ 2D โดยใช้แนวทางนี้ กระบวนการสร้างแบบจำลองสามารถใช้ได้โดยใช้เพียงผู้ดำเนินการ 2D ที่มีประสิทธิภาพแทนการอาศัยผู้ดำเนินการ 3D นอกจากนี้ ใน Splatter Image การแสดงภาพ 3D เป็นผลรวมของ Gaussian 3D ซึ่งทำให้สามารถใช้ประโยชน์จากความเร็วในการแสดงภาพและประสิทธิภาพการใช้หน่วยความจำที่วิธีการ Gaussian Splatting มอบให้

การขยาย Splatter Image ไปยังการสร้างแบบจำลอง 3D จากหลายมุมมองสามารถทำได้โดยการลงทะเบียน Gaussian mixture แต่ละตัวให้กับเฟรมอ้างอิงร่วมกัน แล้วรวม Gaussian mixture ที่คาดการณ์จากมุมมองแต่ละมุม เฟรมเวิร์กยังรวมชั้นการดึงความสนใจที่เบาที่ช่วยให้มุมมองต่างๆ สามารถสื่อสารกันระหว่างการคาดการณ์ได้

จากมุมมองเชิงประจักษ์ เป็นที่น่าสังเกตว่า Splatter Image สามารถสร้างการสร้างแบบจำลอง 3D 360 องศาของวัตถุได้ แม้ว่าจะเห็นเพียงด้านเดียวของวัตถุก็ตาม เฟรมเวิร์กจะจัดสรร Gaussian ที่แตกต่างกันในพื้นที่ 2D เพื่อเข้ารหัสข้อมูล 360 องศาที่สร้างขึ้นในภาพ 2D นอกจากนี้ เฟรมเวิร์กยังตั้งค่าความโปร่งใสของ Gaussian หลายตัวเป็นศูนย์ ซึ่งทำให้สามารถปิดใช้งานได้ระหว่างการประมวลผลหลังการสร้างแบบจำลอง

เพื่อสรุป Splatter Image คือ

  1. วิธีการใหม่ในการสร้างแบบจำลอง 3D จากมุมมองเดียวโดยการนำวิธีการ Gaussian Splatting มาใช้
  2. ขยายวิธีการนี้สำหรับการสร้างแบบจำลอง 3D จากหลายมุมมอง
  3. บรรลุผลการสร้างแบบจำลอง 3D ที่ดีที่สุดในมาตรฐานการสร้างแบบจำลอง 3D ด้วยความเร็วและคุณภาพที่โดดเด่น

รูปภาพกระจาย : วิธีการและสถาปัตยกรรม

Gaussian Splatting

ตามที่กล่าวไว้ก่อนหน้านี้ วิธีการ Gaussian Splatting เป็นวิธีการหลักที่ใช้โดย Splatter Image เพื่อสร้างแบบจำลอง 3D จากมุมมองเดียว ในคำอธิบายง่ายๆ วิธีการ Gaussian Splatting คือวิธีการสร้างภาพ 3D และการแสดงภาพแบบเรียลไทม์ โดยใช้เทคนิคการเรียนรู้ของเครื่องจักรเพื่อเรียนรู้พารามิเตอร์ของแต่ละ Gaussian

การสร้างภาพ 3D โดยใช้วิธีการ Gaussian Splatting เริ่มต้นด้วยการสร้างคลาวด์พอยต์จากเซตของภาพเข้า จากนั้นใช้ภาพเข้าเพื่อประมาณพารามิเตอร์ภายนอกของกล้อง เช่น มุมและตำแหน่ง โดยการ 匹配พิกเซลระหว่างภาพ และใช้พารามิเตอร์เหล่านี้เพื่อคำนวณคลาวด์พอยต์

นอกจากนี้ ฟังก์ชันความโปร่งใสและฟังก์ชันสีใน Gaussian Splatting ให้ผลลัพธ์เป็นสนามรัศมีที่มีทิศทางมองเห็นของจุด 3D เฟรมเวิร์กแสดงฟังก์ชันเหล่านี้เป็นผลรวมของ Gaussian ที่มีสี โดยที่ค่าเฉลี่ยหรือศูนย์กลางของ Gaussian รวมถึงเมทริกซ์ความแปรปรวนช่วยในการกำหนดรูปร่างและขนาดของ Gaussian

รูปภาพกระจาย

ส่วนการแสดงภาพของเฟรมเวิร์กจะแมปเซตของ Gaussian 3D ไปยังภาพ เพื่อสร้างแบบจำลอง 3D จากมุมมองเดียว เฟรมเวิร์กจะพยายามหาฟังก์ชันผกผันสำหรับ Gaussian 3D ซึ่งสร้างผลรวมของ Gaussian 3D จากภาพ

อาจสงสัยว่า Splatter Image สามารถสร้างแบบจำลอง 3D ของวัตถุได้อย่างไร แม้ว่าจะมีมุมมองเดียวเท่านั้น ในการทำงานจริง เฟรมเวิร์กเรียนรู้ที่จะใช้ Gaussian บางตัวเพื่อสร้างมุมมอง และใช้ Gaussian ที่เหลือเพื่อสร้างส่วนของภาพที่ไม่เห็นได้โดยอัตโนมัติ

การสร้างแบบจำลองระดับภาพ

ข้อได้เปรียบหลักของการใช้วิธีการ Gaussian Splatting คือความเร็วและประสิทธิภาพที่มอบให้ ซึ่งช่วยให้เฟรมเวิร์กสามารถแสดงภาพทั้งหมดที่แต่ละการวนซ้ำได้ แม้สำหรับแบตช์ที่มีขนาดใหญ่

การปรับขนาด

เป็นเรื่องที่ท้าทายที่จะประมาณการขนาดของวัตถุโดยดูเพียงมุมมองเดียว และเป็นเรื่องที่ท้าทายที่จะแก้ไขความไม่แน่นอนนี้เมื่อฝึกอบรมด้วยความสูญเสีย ในฐานข้อมูลสังเคราะห์ วัตถุจะถูกแสดงภาพด้วยคุณสมบัติกล้องที่เหมือนกัน และวัตถุจะอยู่ห่างจากกล้องในระยะที่กำหนด ซึ่งจะช่วยแก้ไขความไม่แน่นอนนี้

สีตามมุมมอง

เพื่อแสดงสีตามมุมมอง เฟรมเวิร์กใช้ฮาร์มอนิกสเฟียร์เพื่อสร้างสีให้ครอบคลุมมากกว่าแบบจำลองสีลัมเบอร์เทียน สำหรับ Gaussian ใดๆ โมเดลจะกำหนดสัมประสิทธิ์ที่คาดการณ์โดยเครือข่ายและฮาร์มอนิกสเฟียร์

สถาปัตยกรรมเครือข่ายประสาท

ส่วนใหญ่ของสถาปัตยกรรมของเครือข่ายที่แมปภาพเข้าไปยังผลรวมของ Gaussian นั้นเหมือนกับกระบวนการที่ใช้ในเฟรมเวิร์ก SongUNet ชั้นสุดท้ายของสถาปัตยกรรมถูกแทนที่ด้วยชั้นการถ่ายทอด 1×1 โดยมีช่องทางออกที่กำหนดโดยโมเดลสี

สำหรับการสร้างแบบจำลอง 3D จากหลายมุมมอง เฟรมเวิร์กใช้เครือข่ายเดียวกันกับแต่ละมุมมอง แล้วใช้วิธีมุมมองเพื่อรวมการสร้างแบบจำลองแต่ละตัว นอกจากนี้ เพื่อให้สามารถประสานงานและแลกเปลี่ยนข้อมูลระหว่างมุมมองได้อย่างมีประสิทธิภาพ เฟรมเวิร์กมีการปรับเปลี่ยนสองอย่างในเครือข่าย

รูปภาพกระจาย : การทดลองและผลลัพธ์

เฟรมเวิร์ก Splatter Image วัดคุณภาพของการสร้างแบบจำลองโดยการประเมินคุณภาพการสร้างภาพมุมมองใหม่ เนื่องจากเฟรมเวิร์กใช้มุมมองแหล่งที่มาและแสดงภาพรูปทรง 3D ไปยังมุมมองที่ไม่เห็นได้

การสร้างแบบจำลอง 3D จากมุมมองเดียว

ตารางต่อไปนี้แสดงผลการสร้างแบบจำลอง 3D จากมุมมองเดียวของ Splatter Image ในฐานข้อมูล ShapeNet

ตามที่เห็นได้ เฟรมเวิร์ก Splatter Image มีประสิทธิภาพเหนือกว่าวิธีการสร้างแบบจำลอง 3D จากมุมมองเดียวที่เป็นเชิงกำหนดทั้งหมด โดยเฉพาะอย่างยิ่งในด้าน LPIPS และ SSIM ซึ่งบ่งชี้ว่า Splatter Image สร้างภาพที่มีการสร้างแบบจำลองที่คมชัดกว่า

รูปภาพต่อไปนี้แสดงถึงความสามารถเชิงคุณภาพของ Splatter Image และเห็นได้ชัดว่าโมเดลสามารถสร้างการสร้างแบบจำลองที่มีรูปร่างบางและเรขาคณิตที่น่าสนใจ และจับรายละเอียดของมุมมองที่กำหนด

รูปภาพต่อไปนี้แสดงให้เห็นว่าการสร้างแบบจำลองที่สร้างโดย Splatter Image ไม่เพียงแต่มีการสร้างแบบจำลองที่คมชัดกว่า แต่ยังมีความแม่นยำที่ดีกว่า โดยเฉพาะอย่างยิ่งในสภาพแวดล้อมที่ไม่ปกติ เช่น โครงสร้างบางและความมองเห็นที่จำกัด

การสร้างแบบจำลอง 3D จากหลายมุมมอง

เพื่อประเมินความสามารถในการสร้างแบบจำลอง 3D จากหลายมุมมอง เฟรมเวิร์ก Splatter Image ถูกฝึกอบรมในฐานข้อมูล SpaneNet-SRN Cars สำหรับการคาดการณ์จากสองมุมมอง

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง Splatter Image ซึ่งเป็นวิธีการที่มุ่งหมายเพื่อให้ได้การสร้างรูปทรงและลักษณะ 3D ของวัตถุจากมุมมองเดียวที่เร็วที่สุด โดยใช้วิธีการ Gaussian Splatting ซึ่งเป็นวิธีการสร้างภาพ 3D และการแสดงภาพแบบเรียลไทม์

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล