โมเดลและแพลตฟอร์ม AI

เปิดตัว SAM 2: โมเดล Open-Source ใหม่ของ Meta สำหรับการแยกส่วนวัตถุในเวลาจริงในภาพและวิดีโอ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในช่วงไม่กี่ปีที่ผ่านมา โลกของ AI ได้เห็นการก้าวหน้าที่น่าประทับใจในด้าน AI พื้นฐานสำหรับการประมวลผลข้อความ โดยมีการพัฒนาที่เปลี่ยนแปลงอุตสาหกรรมตั้งแต่การบริการลูกค้าไปจนถึงการวิเคราะห์ทางกฎหมาย อย่างไรก็ตาม เมื่อพูดถึงการประมวลผลภาพ เรากำลังเพียงแต่ขีดขยายพื้นผิวของความซับซ้อนของข้อมูลภาพและความท้าทายในการฝึกโมเดลเพื่อตีความและวิเคราะห์ภาพอย่างแม่นยำได้呈现ความท้าทายที่สำคัญ เมื่อนักวิจัยต่อไปสืบเสาะหาด้าน AI พื้นฐานสำหรับภาพและวิดีโอ อนาคตของการประมวลผลภาพใน AI มีศักยภาพในการสร้างนวัตกรรมในด้านการดูแลสุขภาพ ยานพาหนะอัตโนมัติ และอื่นๆ

การแยกส่วนวัตถุ ซึ่งเกี่ยวข้องกับการระบุพิกเซลที่แน่นอนในภาพที่สอดคล้องกับวัตถุของความสนใจ เป็นงานสำคัญในด้านการมองเห็นคอมพิวเตอร์ โดยทั่วไปแล้ว สิ่งนี้เกี่ยวข้องกับการสร้างโมเดล AI พิเศษ ซึ่งต้องใช้โครงสร้างพื้นฐานและข้อมูลที่มีเครื่องหมายมากมาย เมื่อปีที่แล้ว Meta ได้แนะนำ Segment Anything Model (SAM) โมเดล AI พื้นฐานที่ทำให้กระบวนการนี้ง่ายขึ้นโดยอนุญาตให้ผู้ใช้แยกส่วนภาพด้วยคำสั่งง่ายๆ การพัฒนานี้ลดความจำเป็นในด้านความเชี่ยวชาญเฉพาะและทรัพยากรคอมพิวเตอร์อย่างมาก ทำให้การแยกส่วนภาพเข้าถึงได้ง่ายขึ้น

ตอนนี้ Meta ก้าวไปอีกขั้นด้วย SAM 2 การพัฒนานี้ไม่เพียงแต่เพิ่มความสามารถในการแยกส่วนภาพที่มีอยู่ของ SAM แต่ยังขยายไปยังการประมวลผลวิดีโอ SAM 2 สามารถแยกส่วนวัตถุใดๆ ในทั้งภาพและวิดีโอ รวมถึงวัตถุที่ไม่เคยพบมาก่อน การพัฒนานี้เป็นก้าวสำคัญในด้านการมองเห็นคอมพิวเตอร์และการประมวลผลภาพ โดยให้เครื่องมือที่มีพลังและหลากหลายมากขึ้นสำหรับการวิเคราะห์ข้อมูลภาพ ต่อไปนี้ เราจะสำรวจความก้าวหน้าที่น่าตื่นเต้นของ SAM 2 และศักยภาพในการเปลี่ยนแปลงสาขาต่างๆ

การแนะนำ Segment Anything Model (SAM)

วิธีการแยกส่วนแบบดั้งเดิมต้องใช้การปรับแต่งด้วยมือหรือที่เรียกว่าการแยกส่วนแบบโต้ตอบ หรือต้องใช้ข้อมูลที่มีเครื่องหมายมากมายสำหรับการแยกส่วนอัตโนมัติ SAM เป็นโมเดล AI พื้นฐานที่รองรับการแยกส่วนแบบโต้ตอบโดยใช้คำสั่งหลายอย่าง เช่น คลิก กล่อง หรือข้อความเข้า SAM ยังสามารถปรับแต่งได้ด้วยข้อมูลและทรัพยากรคอมพิวเตอร์ขั้นต่ำสำหรับการแยกส่วนอัตโนมัติ โดยฝึกอบรมบนกว่า 1 พันล้านการแสดงภาพที่หลากหลาย SAM สามารถจัดการวัตถุใหม่และภาพใหม่โดยไม่ต้องมีการรวบรวมข้อมูลหรือการปรับแต่งแบบกำหนดเอง

SAM ทำงานด้วยสองส่วนหลัก: ตัวเข้ารหัสภาพที่ประมวลผลภาพและตัวเข้ารหัสคำสั่งที่จัดการข้อมูลเข้า เช่น คลิกหรือข้อความ ส่วนเหล่านี้มารวมกันโดยใช้ตัวถอดรหัสที่เบาเพื่อคาดการณ์หน้ากากการแยกส่วน เมื่อภาพถูกประมวลผลแล้ว SAM สามารถสร้างส่วนได้ภายใน 50 มิลลิวินาทีในเบราว์เซอร์ ทำให้เป็นเครื่องมือที่มีพลังสำหรับการทำงานแบบโต้ตอบในเวลาจริง เพื่อสร้าง SAM นักวิจัยได้พัฒนาการรวบรวมข้อมูลสามขั้นตอน: การทำเครื่องหมายโดยใช้โมเดล การผสมผสานการทำเครื่องหมายอัตโนมัติและช่วยเหลือ และการสร้างหน้ากากอัตโนมัติเต็มรูปแบบ กระบวนการนี้ส่งผลให้เกิด ชุดข้อมูล SA-1B ซึ่งรวมหน้ากากมากกว่า 1.1 พันล้านชิ้นในภาพที่ได้รับอนุญาตมากกว่า 11 ล้านภาพที่มีการคุ้มครองความเป็นส่วนตัว ซึ่งใหญ่กว่าชุดข้อมูลที่มีอยู่ถึง 400 เท่า การทำงานที่น่าประทับใจของ SAM นั้นมาจากชุดข้อมูลที่กว้างขวางและหลากหลายนี้ ซึ่งรับประกันการแสดงภาพที่ดีกว่าในภูมิภาคต่างๆ เมื่อเทียบกับชุดข้อมูลก่อนหน้า

การเปิดตัว SAM 2: ก้าวกระโดดจากภาพถึงการแยกส่วนวิดีโอ

SAM 2 ถูกออกแบบมาเพื่อการแยกส่วนวัตถุในเวลาจริงที่สามารถสั่งการได้สำหรับทั้งภาพและวิดีโอ ไม่เหมือนกับ SAM ซึ่งมุ่งเน้นไปที่ภาพนิ่งเพียงอย่างเดียว SAM 2 ประมวลผลวิดีโอโดยการรักษาแต่ละเฟรมเป็นส่วนหนึ่งของลำดับต่อเนื่อง ทำให้สามารถจัดการฉากที่มีการเคลื่อนไหวและเนื้อหาที่เปลี่ยนแปลงได้อย่างมีประสิทธิภาพมากขึ้น สำหรับการแยกส่วนภาพ SAM 2 ไม่เพียงแต่ปรับปรุงความสามารถของ SAM แต่ยังทำงานได้เร็วขึ้นสามเท่าในงานโต้ตอบ

SAM 2 มีโครงสร้างเหมือนกับ SAM แต่แนะนำกลไกความจำสำหรับการประมวลผลวิดีโอ คุณลักษณะนี้ช่วยให้ SAM 2 สามารถติดตามข้อมูลจากเฟรมก่อนหน้าได้ ทำให้การคาดการณ์หน้ากากการแยกส่วนมีความสม่ำเสมอแม้จะมีการเปลี่ยนแปลงของการเคลื่อนไหว แสงส่องสว่าง หรือการบดบัง

โมเดลนี้ได้รับการฝึกอบรมบนชุดข้อมูลใหม่ที่พัฒนา SA-V dataset ซึ่งรวมการทำเครื่องหมายหน้ากากมากกว่า 600,000 ชิ้นในวิดีโอ 51,000 คลิปจาก 47 ประเทศ ชุดข้อมูลที่หลากหลายนี้ครอบคลุมทั้งวัตถุและส่วนของวัตถุ ซึ่งช่วยเพิ่มความแม่นยำของ SAM 2 ในการแยกส่วนวิดีโอที่แท้จริง

SAM 2 มีให้ใช้แบบเปิดเผยภายใต้ใบอนุญาต Apache 2.0 ทำให้สามารถเข้าถึงได้สำหรับการใช้งานต่างๆ Meta ยังได้แบ่งปันชุดข้อมูลที่ใช้สำหรับ SAM 2 ภายใต้ใบอนุญาต CC BY 4.0 นอกจากนี้ยังมีการแสดงตัวอย่างแบบเว็บที่ช่วยให้ผู้ใช้สามารถสำรวจโมเดลและดูว่ามันทำงานได้ดีเพียงใด

กรณีการใช้งานที่เป็นไปได้

ความสามารถของ SAM 2 ในการแยกส่วนวัตถุในเวลาจริงที่สามารถสั่งการได้สำหรับทั้งภาพและวิดีโอนั้นได้ปลดล็อกการประยุกต์ใช้ใหม่ๆ มากมายในหลายๆ สาขา ตัวอย่างเช่น การใช้งานเหล่านี้รวมถึง:

  • การวินิจฉัยทางการแพทย์: SAM 2 สามารถปรับปรุงการช่วยเหลือการผ่าตัดในเวลาจริงโดยการแยกส่วนโครงสร้างทางกายวิภาคและระบุความผิดปกติระหว่างการถ่ายทอดวิดีโอแบบสดในห้องผ่าตัด นอกจากนี้ยังสามารถปรับปรุงการวิเคราะห์ภาพทางการแพทย์โดยการให้การแยกส่วนแม่นยำของอวัยวะหรือเนื้องอกในภาพถ่ายทางการแพทย์
  • ยานพาหนะอัตโนมัติ: SAM 2 สามารถปรับปรุงระบบยานพาหนะอัตโนมัติโดยการเพิ่มความแม่นยำในการตรวจจับวัตถุผ่านการแยกส่วนและการติดตามวัตถุอย่างต่อเนื่อง เช่น คนเดินเท้า ยานพาหนะ และป้ายจราจรทั่วเฟรมวิดีโอ ความสามารถในการจัดการฉากที่มีการเคลื่อนไหวยังช่วยสนับสนุนระบบนำทางแบบปรับเปลี่ยนและระบบหลีกเลี่ยงการชนโดยการรับรู้และตอบสนองต่อการเปลี่ยนแปลงสภาพแวดล้อมในเวลาจริง
  • สื่อโต้ตอบและความบันเทิง: SAM 2 สามารถปรับปรุงแอปพลิเคชันความเป็นจริงเสริม (AR) โดยการแยกส่วนวัตถุในเวลาจริง ทำให้ง่ายต่อการผสมผสานองค์ประกอบเสมือนจริงกับโลกแห่งความเป็นจริง นอกจากนี้ยังช่วยให้การแก้ไขวิดีโอง่ายขึ้นโดยการทำให้การแยกส่วนวัตถุในคลิปอัตโนมัติ ซึ่งทำให้กระบวนการ เช่น การลบพื้นหลังและการแทนที่วัตถุ เป็นไปอย่างง่ายดาย
  • การตรวจสอบสิ่งแวดล้อม: SAM 2 สามารถช่วยในการติดตามสัตว์ป่าโดยการแยกส่วนและติดตามสัตว์ในคลิปวิดีโอ ซึ่งสนับสนุนการวิจัยสายพันธุ์และการศึกษาหมู่บ้าน ในการรับมือเหตุฉุกเฉิน สามารถประเมินความเสียหายและชี้นำความพยายามในการตอบสนองโดยการแยกส่วนพื้นที่และวัตถุที่ได้รับผลกระทบในคลิปวิดีโอ
  • การค้าปลีกและอีคอมเมิร์ซ: SAM 2 สามารถปรับปรุงการแสดงผลิตภัณฑ์ในอีคอมเมิร์ซโดยการทำให้สามารถแยกส่วนผลิตภัณฑ์ในภาพและวิดีโอได้อย่างโต้ตอบ ทำให้ลูกค้าสามารถมองเห็นสินค้าจากมุมต่างๆ และในบริบทต่างๆ ได้ สำหรับการจัดการสินค้า ช่วยให้ร้านค้าสามารถติดตามและแยกส่วนสินค้าบนชั้นวางในเวลาจริง ทำให้การนับและสินค้าเป็นไปอย่างมีประสิทธิภาพ

การเอาชนะข้อจำกัดของ SAM 2: วิธีแก้ปัญหาเชิงปฏิบัติและความก้าวหน้าในอนาคต

แม้ว่า SAM 2 จะทำงานได้ดีกับภาพและวิดีโอสั้น แต่ก็มีข้อจำกัดบางประการสำหรับการใช้งานจริง อาจต้องดิ้นรนในการติดตามวัตถุผ่านการเปลี่ยนแปลงมุมมองที่สำคัญ การบดบังที่ยาวนาน หรือในฉากที่มีคนหนาแน่น โดยเฉพาะในวิดีโอที่ยาว การแก้ไขด้วยการคลิกแบบโต้ตอบสามารถช่วยแก้ไขปัญหาเหล่านี้ได้

ในบรรยากาศที่มีคนหนาแน่นที่มีวัตถุที่ดูเหมือนกัน SAM 2 อาจเข้าใจผิดวัตถุเป็นครั้งคราว แต่คำสั่งเพิ่มเติมในเฟรมต่อๆ ไปสามารถแก้ไขปัญหาเหล่านี้ได้ แม้ว่า SAM 2 จะสามารถแยกส่วนวัตถุหลายชิ้นได้ แต่ประสิทธิภาพจะลดลงเนื่องจากประมวลผลวัตถุแต่ละชิ้นแยกกัน การอัปเดตในอนาคตอาจได้รับประโยชน์จากการรวมข้อมูลบริบทที่ใช้ร่วมกันเพื่อเพิ่มประสิทธิภาพ

SAM 2 ยังอาจพลาดรายละเอียดเล็กๆ น้อยๆ กับวัตถุที่เคลื่อนไหวเร็ว และการคาดการณ์อาจไม่เสถียรระหว่างเฟรม อย่างไรก็ตาม การฝึกอบรมเพิ่มเติมสามารถแก้ไขข้อจำกัดนี้ได้ แม้ว่าการสร้างเครื่องหมายอัตโนมัติจะดีขึ้น ผู้ทำเครื่องหมายของมนุษย์ยังคงจำเป็นต้องตรวจสอบคุณภาพและเลือกเฟรม และการทำให้กระบวนการอัตโนมัติมากขึ้นอาจเพิ่มประสิทธิภาพ

สรุป

SAM 2 เป็นตัวแทนของก้าวสำคัญในด้านการแยกส่วนวัตถุในเวลาจริงสำหรับทั้งภาพและวิดีโอ โดยสร้างบนพื้นฐานที่ SAM ตั้งไว้ โดยการเพิ่มความสามารถและขยายฟังก์ชันไปยังเนื้อหาวิดีโอดินามิก SAM 2 มีแนวโน้มที่จะเปลี่ยนแปลงสาขาต่างๆ ตั้งแต่การดูแลสุขภาพและยานพาหนะอัตโนมัติไปจนถึงสื่อโต้ตอบและอีคอมเมิร์ซ แม้ว่าจะมีความท้าทาย แต่ลักษณะการเปิดเผยของ SAM 2 ส่งเสริมการปรับปรุงและปรับเปลี่ยนอย่างต่อเนื่อง ด้วยประสิทธิภาพที่แข็งแกร่งและความสามารถในการเข้าถึงได้ SAM 2 พร้อมที่จะขับเคลื่อนนวัตกรรมและขยายขอบเขตความเป็นไปได้ในด้านการมองเห็นคอมพิวเตอร์และอื่นๆ

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI