โมเดลและแพลตฟอร์ม AI

Sapiens: การพัฒนารูปแบบการมองเห็นของมนุษย์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ความสำเร็จที่น่าประทับใจของการฝึกอบรมขนาดใหญ่ตามด้วยการปรับให้เหมาะสมสำหรับการสร้างแบบจำลองภาษาได้กำหนดแนวทางนี้ให้เป็นแนวปฏิบัติที่เป็นมาตรฐาน ในทำนองเดียวกัน วิธีการมองเห็นของคอมพิวเตอร์กำลังยอมรับการใช้ข้อมูลขนาดใหญ่สำหรับการฝึกอบรมก่อน โดยการเกิดขึ้นของชุดข้อมูลขนาดใหญ่ เช่น LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome และ YFCC100M ทำให้สามารถสำรวจข้อมูลได้มากกว่าขอบเขตของมาตรฐานดั้งเดิม งานที่โดดเด่นในโดเมนนี้รวมถึง DINOv2, MAWS และ AIM DINOv2 สามารถสร้างคุณสมบัติแบบจำลองตนเองได้ด้วยการปรับขนาดวิธีการ iBot ที่เปรียบเทียบกันบนชุดข้อมูล LDV-142M MAWS ศึกษาการปรับขนาดของ masked-autoencoders (MAE) บนภาพล้านภาพ AIM ตรวจสอบความสามารถในการปรับขนาดของการฝึกอบรมแบบ Autoregressive ที่คล้ายกับ BERT สำหรับวิชัน Transformer ในทางตรงกันข้ามกับวิธีการเหล่านี้ ซึ่งมุ่งเน้นไปที่การฝึกอบรมภาพทั่วไปหรือการจำแนกภาพแบบ zero-shot สะพานสเปนใช้แนวทางที่มุ่งเน้นไปที่มนุษย์อย่างชัดเจน: โมเดลของสะพานสเปนใช้การรวบรวมภาพมนุษย์ขนาดใหญ่สำหรับการฝึกอบรมก่อน และปรับให้เหมาะสมสำหรับการทำงานที่เกี่ยวข้องกับมนุษย์

ความก้าวหน้าที่สำคัญได้ถูกทำไว้ภายในสภาพแวดล้อมที่ควบคุมหรือในสตูดิโอ แต่ท้าทายยังคงอยู่ในการขยายวิธีการเหล่านี้ไปยังสภาพแวดล้อมที่ไม่มีการควบคุม เพื่อแก้ไขท้าทายเหล่านี้ การพัฒนาวิธีการที่สามารถทำงานได้หลายอย่าง เช่น การประมาณค่าจุดสำคัญ การแบ่งส่วนส่วนของร่างกาย การประมาณค่าความลึก และการคาดการณ์ปกติของพื้นผิวจากภาพในสถานการณ์ธรรมชาติ เป็นสิ่งสำคัญ ในงานนี้ สะพานสเปนมุ่งหวังที่จะพัฒนาวิธีการสำหรับการมองเห็นของมนุษย์ที่จำเป็นเหล่านี้ให้ทำงานในสภาพแวดล้อมที่ไม่มีการควบคุม ในปัจจุบัน โมเดลภาษาที่สามารถเข้าถึงได้มากที่สุดมีขนาดใหญ่ถึง 100B พารามิเตอร์ ในขณะที่โมเดลภาษาที่ใช้บ่อยมีขนาดประมาณ 7B พารามิเตอร์ ในทางตรงกันข้าม Transformer ของการมองเห็น (ViT) แม้ว่าจะมีโครงสร้างที่คล้ายกัน แต่ก็ยังไม่ได้ถูกปรับขนาดให้สำเร็จในระดับนี้

สะพานสเปนแนะนำชุดโมเดลขนาดใหญ่และความละเอียดสูง ViT ที่ฝึกอบรมก่อนแบบพื้นเมืองที่ความละเอียดภาพ 1024 พิกเซล บนล้านภาพของมนุษย์

สะพานสเปน: การพัฒนารูปแบบการมองเห็นของมนุษย์

สะพานสเปนให้เหตุผลว่าโมเดลที่มุ่งเน้นไปที่มนุษย์ควรตอบสนองสามเกณฑ์: การทั่วไป การใช้งานที่กว้างขวาง และคุณภาพสูง การทั่วไปทำให้แน่ใจว่าโมเดลสามารถทำงานได้ดีในสภาพแวดล้อมที่หลากหลาย การใช้งานที่กว้างขวางบ่งชี้ถึงความสามารถของโมเดลในการทำงานได้หลายอย่างโดยมีการปรับเปลี่ยนเพียงเล็กน้อย คุณภาพสูงแสดงถึงความสามารถของโมเดลในการสร้างผลลัพธ์ที่แม่นยำและละเอียดสูง

สะพานสเปนใช้ข้อมูลขนาดใหญ่และโครงสร้างแบบจำลองที่สามารถปรับขนาดได้ ซึ่งเป็นกุญแจสำคัญสำหรับการทั่วไป สำหรับการใช้งานที่กว้างขวาง สะพานสเปนใช้แนวทางการฝึกอบรมก่อนแล้วปรับให้เหมาะสม ซึ่งช่วยให้สามารถปรับให้เหมาะสมกับงานเฉพาะได้โดยไม่ต้องเปลี่ยนแปลงมาก

สะพานสเปน: วิธีการและโครงสร้าง

สะพานสเปนใช้แนวทางการฝึกอบรมแบบ masked-autoencoder (MAE) สำหรับการฝึกอบรมก่อน โมเดลถูกฝึกให้สร้างภาพมนุษย์เดิมจากภาพที่มีการปิดบังบางส่วน

การประมาณค่าจุดสำคัญ 2D

สะพานสเปนปรับให้เหมาะสมกับการประมาณค่าจุดสำคัญ 2D โดยใช้ข้อมูลการฝึกอบรมก่อนที่มีคุณภาพสูง

สะพานสเปน: การทดลองและผลลัพธ์

สะพานสเปน-2B ถูกฝึกอบรมโดยใช้ 1024 A100 GPUs เป็นเวลา 18 วัน โดยใช้ PyTorch สะพานสเปนใช้ AdamW optimizer สำหรับการทดลองทั้งหมด

สรุป

สะพานสเปนเป็นก้าวสำคัญในการพัฒนาวิธีการมองเห็นของมนุษย์ โมเดลของสะพานสเปนแสดงให้เห็นถึงความสามารถในการทั่วไปที่ดีเยี่ยมในการทำงานที่เกี่ยวข้องกับมนุษย์ ผลลัพธ์ที่ดีที่สุดนี้สามารถอธิบายได้ด้วยการฝึกอบรมก่อนที่มีขนาดใหญ่บนชุดข้อมูลที่มีการปรับให้เหมาะสมสำหรับการทำความเข้าใจมนุษย์ โมเดลของสะพานสเปนมีศักยภาพที่จะกลายเป็นบล็อกการสร้างที่สำคัญสำหรับการทำงานที่หลากหลายและให้การเข้าถึงโครงสร้างการมองเห็นที่มีคุณภาพสูงให้กับส่วนสำคัญของชุมชน

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล