โมเดลและแพลตฟอร์ม AI
เปิดตัว SAM 2: โมเดล Open-Source ใหม่ของ Meta สำหรับการแยกส่วนวัตถุในเวลาจริงในภาพและวิดีโอ
ในช่วงไม่กี่ปีที่ผ่านมา โลกของ AI ได้เห็นการก้าวหน้าที่น่าประทับใจในด้าน AI พื้นฐานสำหรับการประมวลผลข้อความ โดยมีการพัฒนาที่เปลี่ยนแปลงอุตสาหกรรมตั้งแต่การบริการลูกค้าไปจนถึงการวิเคราะห์ทางกฎหมาย อย่างไรก็ตาม เมื่อพูดถึงการประมวลผลภาพ เรากำลังเพียงแต่ขีดขยายพื้นผิวของความซับซ้อนของข้อมูลภาพและความท้าทายในการฝึกโมเดลเพื่อตีความและวิเคราะห์ภาพอย่างแม่นยำได้呈现ความท้าทายที่สำคัญ เมื่อนักวิจัยต่อไปสืบเสาะหาด้าน AI พื้นฐานสำหรับภาพและวิดีโอ อนาคตของการประมวลผลภาพใน AI มีศักยภาพในการสร้างนวัตกรรมในด้านการดูแลสุขภาพ ยานพาหนะอัตโนมัติ และอื่นๆ
การแยกส่วนวัตถุ ซึ่งเกี่ยวข้องกับการระบุพิกเซลที่แน่นอนในภาพที่สอดคล้องกับวัตถุของความสนใจ เป็นงานสำคัญในด้านการมองเห็นคอมพิวเตอร์ โดยทั่วไปแล้ว สิ่งนี้เกี่ยวข้องกับการสร้างโมเดล AI พิเศษ ซึ่งต้องใช้โครงสร้างพื้นฐานและข้อมูลที่มีเครื่องหมายมากมาย เมื่อปีที่แล้ว Meta ได้แนะนำ Segment Anything Model (SAM) โมเดล AI พื้นฐานที่ทำให้กระบวนการนี้ง่ายขึ้นโดยอนุญาตให้ผู้ใช้แยกส่วนภาพด้วยคำสั่งง่ายๆ การพัฒนานี้ลดความจำเป็นในด้านความเชี่ยวชาญเฉพาะและทรัพยากรคอมพิวเตอร์อย่างมาก ทำให้การแยกส่วนภาพเข้าถึงได้ง่ายขึ้น
ตอนนี้ Meta ก้าวไปอีกขั้นด้วย SAM 2 การพัฒนานี้ไม่เพียงแต่เพิ่มความสามารถในการแยกส่วนภาพที่มีอยู่ของ SAM แต่ยังขยายไปยังการประมวลผลวิดีโอ SAM 2 สามารถแยกส่วนวัตถุใดๆ ในทั้งภาพและวิดีโอ รวมถึงวัตถุที่ไม่เคยพบมาก่อน การพัฒนานี้เป็นก้าวสำคัญในด้านการมองเห็นคอมพิวเตอร์และการประมวลผลภาพ โดยให้เครื่องมือที่มีพลังและหลากหลายมากขึ้นสำหรับการวิเคราะห์ข้อมูลภาพ ต่อไปนี้ เราจะสำรวจความก้าวหน้าที่น่าตื่นเต้นของ SAM 2 และศักยภาพในการเปลี่ยนแปลงสาขาต่างๆ
การแนะนำ Segment Anything Model (SAM)
วิธีการแยกส่วนแบบดั้งเดิมต้องใช้การปรับแต่งด้วยมือหรือที่เรียกว่าการแยกส่วนแบบโต้ตอบ หรือต้องใช้ข้อมูลที่มีเครื่องหมายมากมายสำหรับการแยกส่วนอัตโนมัติ SAM เป็นโมเดล AI พื้นฐานที่รองรับการแยกส่วนแบบโต้ตอบโดยใช้คำสั่งหลายอย่าง เช่น คลิก กล่อง หรือข้อความเข้า SAM ยังสามารถปรับแต่งได้ด้วยข้อมูลและทรัพยากรคอมพิวเตอร์ขั้นต่ำสำหรับการแยกส่วนอัตโนมัติ โดยฝึกอบรมบนกว่า 1 พันล้านการแสดงภาพที่หลากหลาย SAM สามารถจัดการวัตถุใหม่และภาพใหม่โดยไม่ต้องมีการรวบรวมข้อมูลหรือการปรับแต่งแบบกำหนดเอง
SAM ทำงานด้วยสองส่วนหลัก: ตัวเข้ารหัสภาพที่ประมวลผลภาพและตัวเข้ารหัสคำสั่งที่จัดการข้อมูลเข้า เช่น คลิกหรือข้อความ ส่วนเหล่านี้มารวมกันโดยใช้ตัวถอดรหัสที่เบาเพื่อคาดการณ์หน้ากากการแยกส่วน เมื่อภาพถูกประมวลผลแล้ว SAM สามารถสร้างส่วนได้ภายใน 50 มิลลิวินาทีในเบราว์เซอร์ ทำให้เป็นเครื่องมือที่มีพลังสำหรับการทำงานแบบโต้ตอบในเวลาจริง เพื่อสร้าง SAM นักวิจัยได้พัฒนาการรวบรวมข้อมูลสามขั้นตอน: การทำเครื่องหมายโดยใช้โมเดล การผสมผสานการทำเครื่องหมายอัตโนมัติและช่วยเหลือ และการสร้างหน้ากากอัตโนมัติเต็มรูปแบบ กระบวนการนี้ส่งผลให้เกิด ชุดข้อมูล SA-1B ซึ่งรวมหน้ากากมากกว่า 1.1 พันล้านชิ้นในภาพที่ได้รับอนุญาตมากกว่า 11 ล้านภาพที่มีการคุ้มครองความเป็นส่วนตัว ซึ่งใหญ่กว่าชุดข้อมูลที่มีอยู่ถึง 400 เท่า การทำงานที่น่าประทับใจของ SAM นั้นมาจากชุดข้อมูลที่กว้างขวางและหลากหลายนี้ ซึ่งรับประกันการแสดงภาพที่ดีกว่าในภูมิภาคต่างๆ เมื่อเทียบกับชุดข้อมูลก่อนหน้า
การเปิดตัว SAM 2: ก้าวกระโดดจากภาพถึงการแยกส่วนวิดีโอ
SAM 2 ถูกออกแบบมาเพื่อการแยกส่วนวัตถุในเวลาจริงที่สามารถสั่งการได้สำหรับทั้งภาพและวิดีโอ ไม่เหมือนกับ SAM ซึ่งมุ่งเน้นไปที่ภาพนิ่งเพียงอย่างเดียว SAM 2 ประมวลผลวิดีโอโดยการรักษาแต่ละเฟรมเป็นส่วนหนึ่งของลำดับต่อเนื่อง ทำให้สามารถจัดการฉากที่มีการเคลื่อนไหวและเนื้อหาที่เปลี่ยนแปลงได้อย่างมีประสิทธิภาพมากขึ้น สำหรับการแยกส่วนภาพ SAM 2 ไม่เพียงแต่ปรับปรุงความสามารถของ SAM แต่ยังทำงานได้เร็วขึ้นสามเท่าในงานโต้ตอบ
SAM 2 มีโครงสร้างเหมือนกับ SAM แต่แนะนำกลไกความจำสำหรับการประมวลผลวิดีโอ คุณลักษณะนี้ช่วยให้ SAM 2 สามารถติดตามข้อมูลจากเฟรมก่อนหน้าได้ ทำให้การคาดการณ์หน้ากากการแยกส่วนมีความสม่ำเสมอแม้จะมีการเปลี่ยนแปลงของการเคลื่อนไหว แสงส่องสว่าง หรือการบดบัง
โมเดลนี้ได้รับการฝึกอบรมบนชุดข้อมูลใหม่ที่พัฒนา SA-V dataset ซึ่งรวมการทำเครื่องหมายหน้ากากมากกว่า 600,000 ชิ้นในวิดีโอ 51,000 คลิปจาก 47 ประเทศ ชุดข้อมูลที่หลากหลายนี้ครอบคลุมทั้งวัตถุและส่วนของวัตถุ ซึ่งช่วยเพิ่มความแม่นยำของ SAM 2 ในการแยกส่วนวิดีโอที่แท้จริง
SAM 2 มีให้ใช้แบบเปิดเผยภายใต้ใบอนุญาต Apache 2.0 ทำให้สามารถเข้าถึงได้สำหรับการใช้งานต่างๆ Meta ยังได้แบ่งปันชุดข้อมูลที่ใช้สำหรับ SAM 2 ภายใต้ใบอนุญาต CC BY 4.0 นอกจากนี้ยังมีการแสดงตัวอย่างแบบเว็บที่ช่วยให้ผู้ใช้สามารถสำรวจโมเดลและดูว่ามันทำงานได้ดีเพียงใด
กรณีการใช้งานที่เป็นไปได้
ความสามารถของ SAM 2 ในการแยกส่วนวัตถุในเวลาจริงที่สามารถสั่งการได้สำหรับทั้งภาพและวิดีโอนั้นได้ปลดล็อกการประยุกต์ใช้ใหม่ๆ มากมายในหลายๆ สาขา ตัวอย่างเช่น การใช้งานเหล่านี้รวมถึง:
- การวินิจฉัยทางการแพทย์: SAM 2 สามารถปรับปรุงการช่วยเหลือการผ่าตัดในเวลาจริงโดยการแยกส่วนโครงสร้างทางกายวิภาคและระบุความผิดปกติระหว่างการถ่ายทอดวิดีโอแบบสดในห้องผ่าตัด นอกจากนี้ยังสามารถปรับปรุงการวิเคราะห์ภาพทางการแพทย์โดยการให้การแยกส่วนแม่นยำของอวัยวะหรือเนื้องอกในภาพถ่ายทางการแพทย์
- ยานพาหนะอัตโนมัติ: SAM 2 สามารถปรับปรุงระบบยานพาหนะอัตโนมัติโดยการเพิ่มความแม่นยำในการตรวจจับวัตถุผ่านการแยกส่วนและการติดตามวัตถุอย่างต่อเนื่อง เช่น คนเดินเท้า ยานพาหนะ และป้ายจราจรทั่วเฟรมวิดีโอ ความสามารถในการจัดการฉากที่มีการเคลื่อนไหวยังช่วยสนับสนุนระบบนำทางแบบปรับเปลี่ยนและระบบหลีกเลี่ยงการชนโดยการรับรู้และตอบสนองต่อการเปลี่ยนแปลงสภาพแวดล้อมในเวลาจริง
- สื่อโต้ตอบและความบันเทิง: SAM 2 สามารถปรับปรุงแอปพลิเคชันความเป็นจริงเสริม (AR) โดยการแยกส่วนวัตถุในเวลาจริง ทำให้ง่ายต่อการผสมผสานองค์ประกอบเสมือนจริงกับโลกแห่งความเป็นจริง นอกจากนี้ยังช่วยให้การแก้ไขวิดีโอง่ายขึ้นโดยการทำให้การแยกส่วนวัตถุในคลิปอัตโนมัติ ซึ่งทำให้กระบวนการ เช่น การลบพื้นหลังและการแทนที่วัตถุ เป็นไปอย่างง่ายดาย
- การตรวจสอบสิ่งแวดล้อม: SAM 2 สามารถช่วยในการติดตามสัตว์ป่าโดยการแยกส่วนและติดตามสัตว์ในคลิปวิดีโอ ซึ่งสนับสนุนการวิจัยสายพันธุ์และการศึกษาหมู่บ้าน ในการรับมือเหตุฉุกเฉิน สามารถประเมินความเสียหายและชี้นำความพยายามในการตอบสนองโดยการแยกส่วนพื้นที่และวัตถุที่ได้รับผลกระทบในคลิปวิดีโอ
- การค้าปลีกและอีคอมเมิร์ซ: SAM 2 สามารถปรับปรุงการแสดงผลิตภัณฑ์ในอีคอมเมิร์ซโดยการทำให้สามารถแยกส่วนผลิตภัณฑ์ในภาพและวิดีโอได้อย่างโต้ตอบ ทำให้ลูกค้าสามารถมองเห็นสินค้าจากมุมต่างๆ และในบริบทต่างๆ ได้ สำหรับการจัดการสินค้า ช่วยให้ร้านค้าสามารถติดตามและแยกส่วนสินค้าบนชั้นวางในเวลาจริง ทำให้การนับและสินค้าเป็นไปอย่างมีประสิทธิภาพ
การเอาชนะข้อจำกัดของ SAM 2: วิธีแก้ปัญหาเชิงปฏิบัติและความก้าวหน้าในอนาคต
แม้ว่า SAM 2 จะทำงานได้ดีกับภาพและวิดีโอสั้น แต่ก็มีข้อจำกัดบางประการสำหรับการใช้งานจริง อาจต้องดิ้นรนในการติดตามวัตถุผ่านการเปลี่ยนแปลงมุมมองที่สำคัญ การบดบังที่ยาวนาน หรือในฉากที่มีคนหนาแน่น โดยเฉพาะในวิดีโอที่ยาว การแก้ไขด้วยการคลิกแบบโต้ตอบสามารถช่วยแก้ไขปัญหาเหล่านี้ได้
ในบรรยากาศที่มีคนหนาแน่นที่มีวัตถุที่ดูเหมือนกัน SAM 2 อาจเข้าใจผิดวัตถุเป็นครั้งคราว แต่คำสั่งเพิ่มเติมในเฟรมต่อๆ ไปสามารถแก้ไขปัญหาเหล่านี้ได้ แม้ว่า SAM 2 จะสามารถแยกส่วนวัตถุหลายชิ้นได้ แต่ประสิทธิภาพจะลดลงเนื่องจากประมวลผลวัตถุแต่ละชิ้นแยกกัน การอัปเดตในอนาคตอาจได้รับประโยชน์จากการรวมข้อมูลบริบทที่ใช้ร่วมกันเพื่อเพิ่มประสิทธิภาพ
SAM 2 ยังอาจพลาดรายละเอียดเล็กๆ น้อยๆ กับวัตถุที่เคลื่อนไหวเร็ว และการคาดการณ์อาจไม่เสถียรระหว่างเฟรม อย่างไรก็ตาม การฝึกอบรมเพิ่มเติมสามารถแก้ไขข้อจำกัดนี้ได้ แม้ว่าการสร้างเครื่องหมายอัตโนมัติจะดีขึ้น ผู้ทำเครื่องหมายของมนุษย์ยังคงจำเป็นต้องตรวจสอบคุณภาพและเลือกเฟรม และการทำให้กระบวนการอัตโนมัติมากขึ้นอาจเพิ่มประสิทธิภาพ
สรุป
SAM 2 เป็นตัวแทนของก้าวสำคัญในด้านการแยกส่วนวัตถุในเวลาจริงสำหรับทั้งภาพและวิดีโอ โดยสร้างบนพื้นฐานที่ SAM ตั้งไว้ โดยการเพิ่มความสามารถและขยายฟังก์ชันไปยังเนื้อหาวิดีโอดินามิก SAM 2 มีแนวโน้มที่จะเปลี่ยนแปลงสาขาต่างๆ ตั้งแต่การดูแลสุขภาพและยานพาหนะอัตโนมัติไปจนถึงสื่อโต้ตอบและอีคอมเมิร์ซ แม้ว่าจะมีความท้าทาย แต่ลักษณะการเปิดเผยของ SAM 2 ส่งเสริมการปรับปรุงและปรับเปลี่ยนอย่างต่อเนื่อง ด้วยประสิทธิภาพที่แข็งแกร่งและความสามารถในการเข้าถึงได้ SAM 2 พร้อมที่จะขับเคลื่อนนวัตกรรมและขยายขอบเขตความเป็นไปได้ในด้านการมองเห็นคอมพิวเตอร์และอื่นๆ












