โมเดลและแพลตฟอร์ม AI

โมเดล Segment Anything – การเพิ่มประสิทธิภาพของการมองเห็นของคอมพิวเตอร์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การมองเห็นของคอมพิวเตอร์ (CV) ได้ถึงความแม่นยำ 99% จาก 50% ในช่วง 10 ปี เทคโนโลยีนี้คาดว่าจะดีขึ้นอย่างมากด้วยอัลกอริทึมสมัยใหม่และเทคนิคการแบ่งส่วนภาพล่าสุด เมื่อเร็วๆ นี้ ห้องปฏิบัติการ FAIR ของ Meta ได้เปิดตัว โมเดล Segment Anything (SAM) – สิ่งที่เปลี่ยนแปลงเกมในด้านการแบ่งส่วนภาพ โมเดลขั้นสูงนี้สามารถสร้างมาสก์วัตถุที่มีรายละเอียดจากคำสั่งป้อนเข้าได้ ทำให้การมองเห็นของคอมพิวเตอร์ถึงระดับใหม่ มันสามารถปฏิวัติวิธีการที่เราสื่อสารกับเทคโนโลยีดิจิทัลในยุคนี้ได้

มาสำรวจการแบ่งส่วนภาพและค้นหาว่า SAM มีผลกระทบต่อ การมองเห็นของคอมพิวเตอร์ อย่างไร

การแบ่งส่วนภาพคืออะไร และมีประเภทไหนบ้าง?

การแบ่งส่วนภาพเป็นกระบวนการในด้านการมองเห็นของคอมพิวเตอร์ที่แบ่งภาพออกเป็นหลายส่วนหรือภูมิภาค แต่ละส่วนแทนวัตถุหรือพื้นที่ที่แตกต่างกันของภาพ วิธีนี้ช่วยให้สามารถแยกส่วนเฉพาะของภาพเพื่อให้ได้ข้อมูลที่มีความหมาย

โมเดลการแบ่งส่วนภาพได้รับการฝึกฝนเพื่อปรับปรุงผลลัพธ์โดยการรับรู้รายละเอียดที่สำคัญของภาพและลดความซับซ้อน โัลกอริทึมเหล่านี้สามารถแยกความแตกต่างระหว่างภูมิภาคต่างๆ ของภาพตามคุณลักษณะ เช่น สี, ขน, คอนทราสต์, เงา และขอบ

โดยการแบ่งส่วนภาพ เราสามารถมุ่งเน้นการวิเคราะห์ของเราไปที่ส่วนที่สนใจเพื่อให้ได้รายละเอียดที่มีประโยชน์ ด้านล่างนี้คือเทคนิคการแบ่งส่วนภาพที่แตกต่างกัน

  • การแบ่งส่วนภาพเชิงความหมาย เกี่ยวข้องกับการระบุพิกเซลเป็นชั้นเรียนเชิงความหมาย
  • การแบ่งส่วนภาพแบบอินสแตนซ์ ไปไกลกว่านั้นโดยการตรวจจับและกำหนดขอบเขตของวัตถุแต่ละตัวในภาพ
  • การแบ่งส่วนภาพแบบพาโนปติก ระบุ ID ของอินสแตนซ์ที่ไม่ซ้ำกันให้กับพิกเซลของวัตถุแต่ละตัว ทำให้ได้การระบุชั้นเรียนที่ครอบคลุมและเป็นบริบทมากขึ้น

การแบ่งส่วนภาพใช้โมเดลการเรียนรู้ลึกที่อาศัยภาพ โมเดลเหล่านี้รวบรวมจุดข้อมูลและคุณลักษณะที่มีค่าจากชุดฝึกอบรม จากนั้นแปลงข้อมูลนั้นเป็นเวกเตอร์และเมทริกซ์เพื่อทำความเข้าใจคุณลักษณะที่ซับซ้อน โมเดลการเรียนรู้ลึกที่ใช้กันอย่างแพร่หลายในการแบ่งส่วนภาพ ได้แก่

  • โครงข่ายประสาทเทียมแบบโคนโวลูชัน (CNNs)
  • โครงข่ายประสาทเทียมแบบเชื่อมต่อเต็ม (FCNs)
  • โครงข่ายประสาทเทียมแบบเรียกซ้ำ (RNNs)

การแบ่งส่วนภาพทำงานอย่างไร?

ใน การมองเห็นของคอมพิวเตอร์ โมเดลการแบ่งส่วนภาพส่วนใหญ่ประกอบด้วยโครงข่ายแบบอินโคเดอร์-ดีコ더 อินโคเดอร์เข้ารหัสการแสดงภาพแบบแฝงของข้อมูลป้อนเข้า ซึ่งดีコเดอร์จะถอดรหัสเพื่อสร้างแผนที่ส่วนหรือแผนที่ที่กำหนดตำแหน่งของวัตถุในภาพ

โดยทั่วไป กระบวนการแบ่งส่วนประกอบด้วย 3 ระยะ:

  • อินโคเดอร์ภาพที่แปลงภาพป้อนเข้าเป็นแบบจำลองทางคณิตศาสตร์ (เวกเตอร์และเมทริกซ์) สำหรับการประมวลผล
  • อินโคเดอร์รวบรวมเวกเตอร์ที่หลายระดับ
  • ดีコเดอร์มาสก์ที่รวดเร็วใช้การฝังภาพเป็นป้อนเข้าและสร้างมาสก์ที่กำหนดขอบเขตของวัตถุแต่ละตัวในภาพแยกจากกัน

สถานะปัจจุบันของการแบ่งส่วนภาพ

เริ่มตั้งแต่ปี 2014 มีการพัฒนาและเปิดตัวอัลกอริทึมการแบ่งส่วนภาพที่อาศัยการเรียนรู้ลึก เช่น CNN+CRF และ FCN ซึ่งได้สร้างความก้าวหน้าที่สำคัญในด้านนี้ ปี 2015 ได้เห็นการเปิดตัว U-Net และ Deconvolution Network ซึ่งได้ปรับปรุงความแม่นยำของผลลัพธ์การแบ่งส่วน

ในปี 2016 Instance Aware Segmentation, V-Net และ RefineNet ได้ปรับปรุงความแม่นยำและความเร็วของการแบ่งส่วน ในปี 2017 Mark-RCNN และ FC-DenseNet ได้นำการตรวจจับวัตถุและการทำนายที่หนาแน่นมาใช้กับการแบ่งส่วน

ในปี 2018 Panoptic Segmentation, Mask-Lab และ Context Encoding Networks ได้เป็นศูนย์กลางของการวิจัยและพัฒนา โดยแนวทางเหล่านี้ได้กล่าวถึงความต้องการการแบ่งส่วนระดับอินสแตนซ์ ในปี 2019 Panoptic FPN, HRNet และ Criss-Cross Attention ได้นำเสนอวิธีการใหม่สำหรับการแบ่งส่วนระดับอินสแตนซ์

ในปี 2020 การพัฒนาดำเนินต่อไปด้วยการเปิดตัว Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS และ Efficient Net + NAS-FPN สุดท้ายในปี 2023 เรามี SAM ซึ่งเราจะพูดถึงต่อไป

โมเดล Segment Anything (SAM) – การแบ่งส่วนภาพทั่วไป

โมเดล Segment Anything (SAM) เป็นแนวทางใหม่ที่สามารถทำงานการแบ่งส่วนแบบโต้ตอบและอัตโนมัติในโมเดลเดียว ก่อนหน้านี้ การแบ่งส่วนแบบโต้ตอบทำให้สามารถแบ่งส่วนชั้นเรียนวัตถุใดๆ ได้ แต่ต้องการให้ผู้ใช้ชี้นำวิธีการโดยการปรับแต่งมาสก์อย่างต่อเนื่อง

การแบ่งส่วนอัตโนมัติใน SAM ช่วยให้สามารถแบ่งส่วนประเภทวัตถุเฉพาะที่กำหนดไว้ล่วงหน้าได้ อินเทอร์เฟซที่สามารถส่งเสริมได้สูงทำให้มีความยืดหยุ่นสูง ดังนั้น SAM จึงสามารถจัดการกับงานการแบ่งส่วนได้หลากหลายโดยใช้คำสั่งป้อนเข้าที่เหมาะสม เช่น คลิก กล่อง ข้อความ และอื่นๆ

SAM ได้รับการฝึกฝนจากชุดข้อมูลที่หลากหลายและมีข้อมูลเชิงลึกซึ่งมีมาสก์มากกว่า 1 พันล้านชิ้น ทำให้สามารถรับรู้วัตถุและภาพใหม่ที่ไม่มีอยู่ในชุดฝึกอบรมได้ โครงสร้างสมัยใหม่นี้จะปฏิวัติ โมเดล CV ในการประยุกต์ เช่น รถยนต์ไร้คนขับ ระบบความปลอดภัย และความเป็นจริงเสริม

SAM สามารถตรวจจับและแบ่งส่วนวัตถุรอบๆ รถในรถยนต์ไร้คนขับ เช่น ยานพาหนะอื่นๆ ผู้เดินถนน และป้ายจราจร ในความเป็นจริงเสริม SAM สามารถแบ่งส่วนสภาพแวดล้อมในโลกแห่งความเป็นจริงเพื่อวางวัตถุเสมือนในตำแหน่งที่เหมาะสม ทำให้เกิดประสบการณ์ผู้ใช้ที่สมจริงและน่าดึงดูดมากขึ้น

ความท้าทายของการแบ่งส่วนภาพในปี 2023

การวิจัยและพัฒนาที่เพิ่มขึ้นในด้านการแบ่งส่วนภาพก็ทำให้เกิดความท้าทายที่สำคัญเช่นกัน ความท้าทายของการแบ่งส่วนภาพในปี 2023 ได้แก่:

  • ความซับซ้อนของชุดข้อมูลที่เพิ่มขึ้น โดยเฉพาะสำหรับการแบ่งส่วนภาพ 3 มิติ
  • การพัฒนาของโมเดลการเรียนรู้ลึกที่สามารถอธิบายได้
  • การใช้โมเดลการเรียนรู้ที่ไม่มีการกำกับซึ่งลดการแทรกแซงจากมนุษย์
  • ความต้องการของโมเดลที่มีประสิทธิภาพในเวลาและหน่วยความจำ
  • การกำจัดอุปสรรคของการแบ่งส่วนจุดคลาวด์ 3 มิติ

อนาคตของการมองเห็นของคอมพิวเตอร์

ตลาดการมองเห็นของคอมพิวเตอร์ทั่วโลกซึ่งมีผลกระทบต่ออุตสาหกรรมหลายแห่งคาดว่าจะมีมูลค่าเกิน $41 พันล้านดอลลาร์ในปี 2030 เทคนิคการแบ่งส่วนภาพสมัยใหม่ เช่น โมเดล Segment Anything ร่วมกับอัลกอริทึมการเรียนรู้ลึกอื่นๆ จะเสริมสร้างโครงสร้างพื้นฐานของการมองเห็นของคอมพิวเตอร์ในภูมิทัศน์ดิจิทัล ดังนั้น เราจะได้เห็นโมเดลการมองเห็นของคอมพิวเตอร์ที่มีประสิทธิภาพและสมาร์ทมากขึ้นในอนาคต

หากต้องการเรียนรู้เพิ่มเติมเกี่ยวกับ AI และ ML คุณสามารถสำรวจ Unite.ai – วิธีแก้ปัญหาแบบ all-in-one สำหรับคำถามทั้งหมดเกี่ยวกับเทคโนโลยีและสถานะสมัยใหม่ของคุณ

Haziqa เป็นนักวิทยาศาสตร์ข้อมูลที่มีประสบการณ์อย่างกว้างขวางในการเขียนเนื้อหาทางเทคนิคสำหรับบริษัท AI และ SaaS