โมเดลและแพลตฟอร์ม AI

วิชัน ทรานส์ฟอร์เมอร์ โซลูชันใหม่ ‘การให้ความสนใจแบบแพทช์-คลัสเตอร์’ ที่จะเอาชนะความท้าทาย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เทคโนโลยีภาวะที่มีประสิทธิภาพสูง (AI) โดยเฉพาะวิชัน ทรานส์ฟอร์เมอร์ (ViTs) ได้แสดงให้เห็นถึงศักยภาพที่น่าประทับใจในการระบุและจัดประเภทวัตถุในภาพ อย่างไรก็ตาม การใช้งานในทางปฏิบัติได้ถูกจำกัดโดยสองความท้าทายที่สำคัญ: ความต้องการพลังการประมวลผลสูงและความไม่ชัดเจนในการตัดสินใจ ตอนนี้ กลุ่มของนักวิจัยได้พัฒนาโซลูชันใหม่: วิธีการใหม่ที่เรียกว่า “การให้ความสนใจแบบแพทช์-คลัสเตอร์” (PaCa) PaCa มีเป้าหมายที่จะเพิ่มความสามารถของ ViTs ในการระบุวัตถุในภาพ การจำแนกประเภทและการแบ่งส่วนภาพ ในขณะเดียวกันก็แก้ไขปัญหาความต้องการพลังการประมวลผลสูงและความไม่ชัดเจนในการตัดสินใจที่ยาวนาน

การแก้ไขความท้าทายของ ViTs: การมองเห็นโซลูชันใหม่

ทรานส์ฟอร์เมอร์ เนื่องจากความสามารถที่เหนือกว่า เป็นหนึ่งในโมเดลที่มีอิทธิพลมากที่สุดในโลก AI ความสามารถของโมเดลเหล่านี้ได้ถูกขยายไปสู่ข้อมูลภาพผ่าน ViTs ซึ่งเป็นคลาสของทรานส์ฟอร์เมอร์ที่ได้รับการฝึกฝนจากข้อมูลภาพ尽管 ViTs มีศักยภาพที่น่าประทับใจในการตีความและเข้าใจภาพ แต่ก็ถูกจำกัดโดยสองปัญหาที่สำคัญ

ประการแรก เนื่องจากภาพมีข้อมูลจำนวนมาก ViTs ต้องการพลังการประมวลผลและหน่วยความจำที่มาก ซับซ้อนสามารถทำให้ระบบหลายระบบต้องเผชิญกับความท้าทาย โดยเฉพาะอย่างยิ่งเมื่อจัดการกับภาพที่มีความละเอียดสูง ประการที่สอง การตัดสินใจภายใน ViTs มักจะซับซ้อนและไม่ชัดเจน ผู้ใช้พบว่ามันยากที่จะเข้าใจว่า ViTs แยกแยะระหว่างวัตถุหรือคุณลักษณะต่างๆ ในภาพอย่างไร ซึ่งเป็นสิ่งสำคัญสำหรับการใช้งานหลายอย่าง

อย่างไรก็ตาม วิธีการ PaCa ใหม่นี้เสนอวิธีแก้ปัญหาทั้งสองประเด็นนี้ “เราจะแก้ไขความท้าทายที่เกี่ยวข้องกับความต้องการพลังการประมวลผลและหน่วยความจำโดยใช้เทคนิคการคลัสเตอร์ ซึ่งช่วยให้โครงสร้างทรานส์ฟอร์เมอร์สามารถระบุและเน้นย้ำวัตถุในภาพได้ดีขึ้น” Tianfu Wu อธิบาย ผู้เขียนหลักของเอกสารวิจัยและรองศาสตราจารย์ภาควิชาวิศวกรรมไฟฟ้าและคอมพิวเตอร์ มหาวิทยาลัยรัฐนอร์ทแคโรไลนา

การใช้เทคนิคการคลัสเตอร์ใน PaCa ลดความต้องการพลังการประมวลผลอย่างมาก ทำให้ปัญหานี้กลายเป็นกระบวนการที่จัดการได้ Wu อธิบายกระบวนการนี้ “ด้วยการคลัสเตอร์ เราสามารถทำให้กระบวนการนี้เป็นกระบวนการที่线性 โดยที่แต่ละหน่วยเล็กๆ จะต้องเปรียบเทียบกับจำนวนคลัสเตอร์ที่กำหนดไว้ล่วงหน้าเท่านั้น”

การคลัสเตอร์ยังช่วยให้กระบวนการตัดสินใจใน ViTs ชัดเจนขึ้น กระบวนการสร้างคลัสเตอร์แสดงให้เห็นว่า ViTs ตัดสินใจว่าคุณลักษณะใดที่สำคัญในการจัดกลุ่มส่วนของข้อมูลภาพ เมื่อ AI สร้างคลัสเตอร์จำนวนจำกัด ผู้ใช้สามารถเข้าใจและตรวจสอบกระบวนการตัดสินใจได้ง่ายขึ้น ทำให้โมเดลมีความสามารถในการตีความที่ดีขึ้น

วิธีการ PaCa มีประสิทธิภาพเหนือกว่า ViTs รุ่นอื่นๆ

ผ่านการทดสอบอย่างครอบคลุม นักวิจัยพบว่าวิธีการ PaCa มีประสิทธิภาพเหนือกว่า ViTs รุ่นอื่นๆ ในหลายด้าน Wu อธิบาย “เราพบว่า PaCa มีประสิทธิภาพเหนือกว่า SWin และ PVT ในทุกด้าน” การทดสอบแสดงให้เห็นว่า PaCa มีประสิทธิภาพในการจำแนกและระบุวัตถุในภาพ และการแบ่งส่วนภาพ โดยการวาดเส้นรอบรูปวัตถุในภาพได้อย่างมีประสิทธิภาพ นอกจากนี้ยังพบว่า PaCa มีประสิทธิภาพในการใช้เวลาในการทำงานมากกว่า ViTs รุ่นอื่นๆ

ได้รับแรงบันดาลใจจากความสำเร็จของ PaCa ทีมวิจัยมีเป้าหมายที่จะพัฒนามันให้ไกลกว่านี้โดยการฝึกอบรมมันบนเซตข้อมูลขนาดใหญ่ โดยหวังว่าจะขยายขอบเขตของสิ่งที่เป็นไปได้กับ AI ที่ใช้ภาพ

เอกสารวิจัย “PaCa-ViT: การเรียนรู้การให้ความสนใจแบบแพทช์-คลัสเตอร์ในวิชัน ทรานส์ฟอร์เมอร์” จะนำเสนอที่การประชุม IEEE/CVF Conference on Computer Vision and Pattern Recognition ที่กำลังจะมาถึง ซึ่งเป็น 里程碑ที่สำคัญที่อาจเปิดทางให้กับระบบ AI ที่มีประสิทธิภาพ มีความโปร่งใส และสามารถเข้าถึงได้มากขึ้น

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก