โมเดลและแพลตฟอร์ม AI

TinySAM : โมเดลการแบ่งส่วนอย่างมีประสิทธิภาพ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การแบ่งส่วนวัตถุเป็นสาขาที่สำคัญและเป็นพื้นฐานในด้านการมองเห็นของคอมพิวเตอร์สมัยใหม่ มีบทบาทสำคัญในแอปพลิเคชันที่ต้องการส่วนประกอบภาพที่กว้างขวาง เช่น การระบุตำแหน่งวัตถุและการระบุวัตถุ และต้องการการแบ่งส่วนในเวลาจริงที่รวดเร็วและแม่นยำ ความสำคัญนี้ทำให้การแบ่งส่วนวัตถุเป็นหัวข้อการวิจัยที่ได้รับความนิยมอย่างต่อเนื่อง โดยมีการทำงานที่สำคัญในด้านการแบ่งส่วนแบบอินสแตนซ์ การแบ่งส่วนแบบเซมานติก และการแบ่งส่วนแบบพาโนปติก

ด้วยการพัฒนาของการแบ่งส่วนวัตถุ โมเดลการแบ่งส่วนใดๆ (SAM) ได้ปรากฏตัวขึ้นเป็นเครื่องมือที่น่าประทับใจ โดยแสดงให้เห็นถึงความสามารถในการแบ่งส่วนอย่างโดดเด่น และได้รับการนำไปใช้ในแอปพลิเคชันการมองเห็นของคอมพิวเตอร์หลายอย่าง แฟรมเวิร์กที่ใช้โครงสร้าง SAM ที่ได้รับการฝึกอบรมแล้วได้แสดงผลลัพธ์ที่น่าประทับใจในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์ อย่างไรก็ตาม แม้ว่า SAM จะมีความสามารถและความแม่นยำสูงในการแบ่งส่วน แต่โครงสร้างที่ซับซ้อนและหนักหน่วงของ SAM ต้องการพลังการคำนวณที่มาก ซึ่งทำให้การนำไปใช้บนอุปกรณ์ที่มีการจำกัดทรัพยากรการคำนวณเป็นเรื่องที่ท้าทาย

เพื่อแก้ไขปัญหาการคำนวณของ SAM นักวิจัยได้พัฒนา Tiny Segment Anything Model (TinySAM) ซึ่งรักษาความสามารถในการแบ่งส่วนแบบ zero-shot ของโครงสร้างเดิมไว้ ในขณะเดียวกันก็เป็นโมเดลที่มีน้ำหนักเบา hơn TinySAM ใช้วิธีการส่งผ่านความรู้แบบเต็มขั้นตอน โดยใช้การแสดงตัวอย่างที่ยากออนไลน์เพื่อสร้างโมเดลนักเรียนที่มีประสิทธิภาพมากขึ้น การปรับขนาดหลังการฝึกอบรมที่ปรับให้เหมาะสมกับการแบ่งส่วนแบบ promptable ยังช่วยลดความต้องการการคำนวณเพิ่มเติม นอกจากนี้ การออกแบบของ TinySAM มีเป้าหมายในการแบ่งส่วนแบบ階層 ซึ่งเพิ่มความเร็วในการอนุมานเกือบสองเท่าโดยไม่ส่งผลกระทบต่อประสิทธิภาพ

บทความนี้จะเจาะลึกถึงโครงสร้าง TinySAM โดยสำรวจหลักการ พื้นฐาน โครงสร้าง และประสิทธิภาพเมื่อเทียบกับโครงสร้างการแบ่งส่วนอื่นๆ ที่มีคุณภาพสูงสุด มาทำความรู้จักกับด้านเหล่านี้ในรายละเอียดมากขึ้น

TinySAM : โมเดลการแบ่งส่วนอย่างมีประสิทธิภาพ

โมเดลการแบ่งส่วนใดๆ ได้ช่วยให้การวิจัยในด้านการมองเห็นของคอมพิวเตอร์หลายอย่างก้าวหน้าอย่างรวดเร็ว เนื่องจากความสามารถในการแบ่งส่วนอย่างน่าประทับใจ และชุดข้อมูลการแบ่งส่วนขนาดใหญ่ที่มีภาพมากกว่า 11 ล้านภาพ และมาสก์ภาพมากกว่า 1 พันล้านภาพ โมเดลนี้เป็นพื้นฐานสำหรับโครงสร้างที่ทำงานในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์หลายอย่าง เช่น การเติมภาพ การติดตามวัตถุ การมองเห็น 3 มิติ และอื่นๆ นอกจากนี้ โมเดลการแบ่งส่วนใดๆ ยังแสดงให้เห็นถึงความสามารถในการแบ่งส่วนแบบ zero-shot ที่น่าประทับใจ ซึ่งได้ประโยชน์จากอุตสาหกรรมที่ทำงานกับข้อมูลที่จำกัด รวมถึงการวิจัยทางการแพทย์และการถ่ายภาพทางการแพทย์

แม้ว่าไม่สามารถตั้งคำถามถึงความสามารถในการแบ่งส่วนของโมเดลการแบ่งส่วนใดๆ ในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์หลายอย่าง แต่โมเดลนี้ก็มีจุดอ่อนในด้านโครงสร้างที่ซับซ้อนและต้องการพลังการคำนวณสูง ซึ่งทำให้การนำไปใช้บนอุปกรณ์ที่มีการจำกัดทรัพยากรการคำนวณเป็นเรื่องที่ท้าทาย เพื่อแก้ไขปัญหานี้ โครงสร้างอย่าง MobileSAM และ FastSAM ได้พยายามพัฒนาโมเดล SAM ที่มีประสิทธิภาพการคำนวณมากขึ้น โครงสร้าง MobileSAM พยายามที่จะแทนที่ส่วนประกอบหนักในตัวเข้ารหัสภาพด้วยโครงสร้าง TinyViT ในขณะที่โมเดล FastSAM จะถ่ายโอนงานแบ่งส่วนไปยังงานแบ่งส่วนแบบอินสแตนซ์โดยมีแคตตัวเดียวโดยใช้โมเดล YoloV8 แม้ว่าวิธีการเหล่านี้จะสามารถลดความต้องการการคำนวณได้บ้าง แต่ก็ไม่สามารถรักษาความสามารถในการแบ่งส่วนได้ โดยเฉพาะอย่างยิ่งในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์แบบ zero-shot

TinySAM หรือ Tiny Segment Anything Model เป็นความพยายามที่จะลดความต้องการการคำนวณของโมเดล SAM ปัจจุบันโดยไม่ส่งผลกระทบต่อประสิทธิภาพในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์แบบ zero-shot นอกจากนี้ โครงสร้าง TinySAM ยังเสนอให้ใช้วิธีการส่งผ่านความรู้แบบเต็มขั้นตอนในโครงสร้าง โดยมีเป้าหมายในการปรับปรุงความสามารถของโมเดลนักเรียนที่มีขนาดกะทัดรัด โครงสร้าง TinySAM จะส่งผ่านโมเดลนักเรียนในลักษณะแบบ end-to-end ภายใต้การดูแลของโมเดลครูจากขั้นต่างๆ เพื่อเพิ่มประสิทธิภาพเพิ่มเติม โครงสร้างจะอนุญาตให้กระบวนการส่งผ่านความรู้ให้ความสำคัญกับตัวอย่างที่ยากมากขึ้นโดยใช้กลยุทธ์การแสดงตัวอย่างที่ยากออนไลน์ นอกจากนี้ เพื่อลดค่าใช้จ่ายในการคำนวณเพิ่มเติม โครงสร้าง TinySAM จะเปิดเผยงานแบ่งส่วนแบบ promptable ให้กับส่วนประกอบการปรับขนาดหลังการฝึกอบรม

TinySAM : โครงสร้างและวิธีการ

ก่อนที่จะพูดถึงโครงสร้างและวิธีการของโครงสร้าง TinySAM มันเป็นเรื่องสำคัญที่จะต้องมองย้อนกลับไปที่โครงสร้าง SAM ก่อน โมเดลการแบ่งส่วนใดๆ ได้แสดงให้เห็นถึงความสามารถที่น่าประทับใจและความสามารถในการปรับเปลี่ยนในงานวิชาการด้านการมองเห็นของคอมพิวเตอร์หลายอย่าง ตั้งแต่การแนะนำมา

ที่核心 โมเดล SAM ประกอบด้วยสามส่วนหลัก: ตัวเข้ารหัส prompt, ตัวเข้ารหัสภาพ, และตัวถอดรหัสมาสก์ เป้าหมายหลักของตัวเข้ารหัส prompt คือการเข้ารหัสมาสก์ที่มีรูปทรงไม่แน่นอน จุดและกล่องข้อความ และข้อความที่มีข้อมูลตำแหน่ง ตัวเข้ารหัสภาพเป็นเครือข่ายหนักแบบ ViT หรือการแปลงมองเห็นที่เปลี่ยนภาพเข้ามาเป็นการฝังตัว โมเดลใช้เครือข่ายที่แตกต่างกันเพื่อประมวลผลสัญญาณที่เป็นรูปทรงและข้อความ ตัวถอดรหัสมาสก์ประกอบด้วยทรานส์ฟอร์เมอร์สองทางที่รับผลลัพธ์ของตัวเข้ารหัส prompt และตัวเข้ารหัสภาพเพื่อสร้างการคาดการณ์มาสก์แบบสุดท้าย

การถ่ายทอดความรู้

การถ่ายทอดความรู้เป็นวิธีการที่สำคัญในการเพิ่มประสิทธิภาพของเครือข่ายที่มีขนาดกะทัดรัดในช่วงการฝึกอบรม วิธีการการถ่ายทอดความรู้ที่ใช้ผลลัพธ์ของโมเดลครูในการดูแลการฝึกอบรมของโมเดลนักเรียนที่มีขนาดกะทัดรัด

การปรับขนาดแบบเต็มขั้นตอน

การปรับขนาดแบบเต็มขั้นตอนเป็นวิธีการที่ใช้ในการส่งผ่านความรู้จากโมเดลครูไปยังโมเดลนักเรียนในลักษณะแบบ end-to-end

การปรับขนาด

การปรับขนาดเป็นวิธีการที่ใช้ในการลดความต้องการการคำนวณโดยการปรับขนาดตัวเลขทศนิยมให้กลายเป็นตัวเลขจำนวนเต็ม

การแบ่งส่วนแบบ階層

การแบ่งส่วนแบบ階層เป็นวิธีการที่ใช้ในการแบ่งส่วนวัตถุโดยใช้การสร้างมาสก์แบบ階層

TinySAM : การทดลองและผลลัพธ์

เพื่อเร่งกระบวนการถ่ายทอดความรู้ โครงสร้าง TinySAM จะคำนวณและเก็บการฝังตัวของภาพจากโมเดลครูไว้ล่วงหน้า ซึ่งไม่จำเป็นต้องคำนวณตัวเข้ารหัสภาพที่หนักของโมเดลครูซ้ำๆ ในช่วงการฝึกอบรม

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง TinySAM ซึ่งเป็นโครงสร้างที่เสนอเพื่อการแบ่งส่วนใดๆ โดยมีเป้าหมายในการได้รับโมเดลที่มีประสิทธิภาพและต้องการการคำนวณน้อยลง โดยไม่ส่งผลกระทบต่อความแม่นยำ

Kunal Kejriwal เป็นวิศวกรแบ็กเอนด์ที่เชี่ยวชาญด้าน Python, PostgreSQL, Redis และโครงสร้างพื้นฐานคลาวด์บน GCP และ AWS. ด้วยประสบการณ์สามปีในการสร้างและขยายระบบการผลิต เขาเขียนเกี่ยวกับโครงสร้างพื้นฐาน AI, ระบบกระจาย, และสถาปัตยกรรมที่อยู่เบื้องหลังการปรับใช้งานแมชชีนเลิร์นนิง