โมเดลและแพลตฟอร์ม AI
MambaOut: คุณจำเป็นต้องใช้ Mamba สำหรับการมองเห็นหรือไม่?
ในกรอบการทำงานของการเรียนรู้ของเครื่องและปัญญาประดิษฐ์สมัยใหม่ Transformer เป็นหนึ่งในส่วนประกอบที่ใช้กันอย่างแพร่หลายทั่วหลายโดเมน รวมถึง GPT series และ BERT ในการประมวลผลภาษาธรรมชาติ และ Vision Transformers ในงานที่เกี่ยวข้องกับการมองเห็น แม้ว่าการรวม Transformer ในโครงสร้างแบบจำลองจะช่วยเพิ่มประสิทธิภาพของแบบจำลองอย่างมาก แต่โมดูลความสนใจใน Transformer จะเพิ่มขึ้นตามความยาวของลำดับ ทำให้เกิดปัญหาการคำนวณที่ท้าทาย ในช่วงหลายปีที่ผ่านมา โมเดลต่างๆ ได้สำรวจกลยุทธ์ต่างๆ เพื่อแก้ไขปัญหาการคำนวณ รวมถึงวิธีการเช่น kernelization, การบีบอัดหน่วยความจำ, การจำกัดช่วงการผสมโทเค็น และการเข้าใกล้ด้วยอันดับต่ำ เมื่อเร็วๆ นี้ โมเดลเครือข่ายประสาทที่เกิดซ้ำ (Recurrent Neural Networks) เช่น Mamba และ RWKV ได้รับความสนใจอย่างมากเนื่องจากผลลัพธ์ที่น่าสนใจในโมเดลภาษาขนาดใหญ่
Mamba ซึ่งเป็นครอบครัวของโมเดล มีโครงสร้างที่มีการผสมโทเค็นแบบเครือข่ายประสาทที่เกิดซ้ำของโมเดลพื้นที่状态 และได้รับการแนะนำเพื่อแก้ไขปัญหาความซับซ้อนของกลไกความสนใจ และได้รับการประยุกต์ใช้กับงานที่เกี่ยวข้องกับการมองเห็นต่อมา นักวิจัยได้สำรวจวิธีการรวม Mamba และ SSM หรือ State Space Model เข้ากับงานการรู้จำภาพ และ Vision Mamba ที่รวม Mamba เพื่อพัฒนามデルการมองเห็นแบบอิซโตรอปิก类似กับ Vision Transformer เป็นตัวอย่างที่ดีของสิ่งนี้ ในทางกลับกัน LocalMamba รวมการบิดเบือนแบบอุปนัยท้องถิ่นเพื่อเพิ่มประสิทธิภาพของโมเดลการมองเห็นของ Mamba และ VMamba ใช้โมเดล Mamba พื้นฐานเพื่อสร้างโมเดลแบบ階層ที่คล้ายกับ ResNet และ AlexNet อย่างไรก็ตาม โมเดล Mamba จริงๆ แล้วจำเป็นต่อการทำงานที่เกี่ยวข้องกับการมองเห็นหรือไม่? คำถามนี้เกิดขึ้นเพราะประสิทธิภาพของโมเดล Mamba สำหรับงานที่เกี่ยวข้องกับการมองเห็นยังไม่น่าประทับใจเมื่อเทียบกับโมเดลที่ใช้ความสนใจแบบดั้งเดิมและโมเดลที่ใช้การบิดเบือนแบบคอนโวลูชัน
MambaOut พยายามที่จะตอบว่า Mamba เหมาะสมกับงานที่มีลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว MambaOut คาดการณ์ว่า Mamba ไม่จำเป็นต่องานที่เกี่ยวข้องกับการมองเห็น เนื่องจากการจำแนกประเภทภาพไม่สอดคล้องกับทั้งลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว แม้ว่างานการตรวจจับวัตถุและงานการแบ่งส่วนแบบอินสแตนซ์ไม่ใช่การสร้างลำดับแบบอัตโนมัติ แต่ก็แสดงลักษณะของลำดับที่ยาว ทำให้ MambaOut คาดการณ์ถึงศักยภาพของ Mamba สำหรับงานเหล่านี้ MambaOut เป็นโครงสร้างที่สร้างโดยการวางบล็อก Mamba ทับกันโดยไม่มีโมเดลพื้นที่สถานะ และผลการทดลองสนับสนุนสมมติฐานที่ MambaOut เสนอ เนื่องจากสามารถเอาชนะโมเดล Mamba ที่มี SSM ในการจำแนกประเภทภาพ ImageNet ได้ ซึ่งบ่งชี้ว่า Mamba ไม่จำเป็นต่องานที่เกี่ยวข้องกับการมองเห็น ในทางกลับกัน สำหรับงานการตรวจจับวัตถุและงานการแบ่งส่วนแบบอินสแตนซ์ MambaOut ไม่สามารถทำซ้ำประสิทธิภาพที่โมเดล Mamba ที่มีคุณภาพสูงสุดได้ ซึ่งแสดงถึงศักยภาพของโมเดล Mamba สำหรับงานที่เกี่ยวข้องกับการมองเห็นที่มีลำดับยาว
บทความนี้มีจุดมุ่งหมายเพื่อครอบคลุมโครงสร้าง MambaOut อย่างลึกซึ้ง และเราจะสำรวจกลไก วิธีการ โครงสร้างของโครงสร้างนี้พร้อมกับการเปรียบเทียบกับโครงสร้างที่มีคุณภาพสูงสุด ดังนั้น มาเริ่มต้นกัน
MambaOut: คุณจำเป็นต้องใช้ Mamba สำหรับการมองเห็นหรือไม่?
ด้วยความก้าวหน้าของการประยุกต์ใช้การเรียนรู้ของเครื่องและความสามารถ Transformers ได้กลายเป็นโครงสร้างหลักสำหรับงานต่างๆ รวมถึง Vision Transformers, GPT series, BERT และอื่นๆ อย่างไรก็ตาม โมดูลผสมโทเค็นของ Transformer มีความซับซ้อนที่เพิ่มขึ้นตามความยาวของลำดับ ทำให้เกิดปัญหาที่ท้าทายในการคำนวณ ในช่วงหลายปีที่ผ่านมา โมเดลต่างๆ ได้สำรวจกลยุทธ์ต่างๆ เพื่อแก้ไขปัญหานี้ รวมถึงวิธีการเช่น kernelization, การบีบอัดหน่วยความจำ, การจำกัดช่วงการผสมโทเค็น และการเข้าใกล้ด้วยอันดับต่ำ เมื่อเร็วๆ นี้ โมเดลเครือข่ายประสาทที่เกิดซ้ำได้รับความสนใจอย่างมากเนื่องจากผลลัพธ์ที่น่าสนใจในโมเดลภาษาขนาดใหญ่
MambaOut เป็นความพยายามที่จะสำรวจลักษณะของโมเดล Mamba และสรุปว่า Mamba เหมาะสมกับงานที่มีลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว เนื่องจากโมเดลพื้นที่สถานะมีกลไกเครือข่ายประสาทที่เกิดซ้ำที่มีศักยภาพ อย่างไรก็ตาม ส่วนใหญ่ของงานที่เกี่ยวข้องกับการมองเห็นไม่มีลักษณะทั้งสองนี้ และตามผลการทดลอง MambaOut เสนอสมมติฐานสองประการ ประการแรก โมเดลพื้นที่สถานะไม่จำเป็นต่อการจำแนกประเภทภาพ เนื่องจากการจำแนกประเภทภาพไม่สอดคล้องกับทั้งลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว ประการที่สอง โมเดลพื้นที่สถานะอาจมีประโยชน์สำหรับงานการตรวจจับวัตถุและงานการแบ่งส่วนแบบอินสแตนซ์ เนื่องจากงานเหล่านี้มีลักษณะของลำดับที่ยาว แม้ว่าจะไม่ใช่การสร้างลำดับแบบอัตโนมัติก็ตาม
งานใดที่ Mamba เหมาะสม?
โมดูลผสมโทเค็นของ Mamba เป็นโมเดลพื้นที่สถานะที่เลือกซึ่งกำหนดพารามิเตอร์ขึ้นอยู่กับอินพุตสี่ตัว คุณสมบัติการเกิดซ้ำของ Mamba ทำให้โมเดล Mamba แตกต่างจากโมเดลความสนใจแบบก่อให้เกิดผลลัพธ์ โมเดล Mamba มีหน่วยความจำที่มีขนาดคงที่ซึ่งเก็บข้อมูลจากลำดับก่อนหน้า ความจำที่มีขนาดคงที่นี้ทำให้ความซับซ้อนในการรวมข้อมูลจากลำดับก่อนหน้าและอินพุตปัจจุบันคงที่ ในทางกลับกัน โมเดลความสนใจแบบก่อให้เกิดผลลัพธ์เก็บคีย์และค่าจากโทเค็นก่อนหน้าและเพิ่มคีย์และค่าของโทเค็นปัจจุบันเมื่อมีอินพุตใหม่ ทำให้ความจำมีขนาดใหญ่ขึ้นและความซับซ้อนในการรวมข้อมูลจากลำดับก่อนหน้าและอินพุตปัจจุบันเพิ่มขึ้น

เนื่องจากโมเดล Mamba มีความจำที่มีขนาดคงที่และความจำที่สูญเสียไป ทำให้ไม่สามารถแสดงศักยภาพในการจัดการลำดับสั้นได้ดีเท่ากับโมเดลความสนใจแบบก่อให้เกิดผลลัพธ์ อย่างไรก็ตาม ในสถานการณ์ที่ต้องจัดการลำดับที่ยาว โมเดล Mamba สามารถจัดการลำดับได้อย่างมีประสิทธิภาพและราบรื่น ซึ่งบ่งชี้ว่า Mamba เหมาะสมกับงานที่มีลำดับที่ยาว
นอกจากนี้ โมเดล Mamba ยังมีข้อจำกัดในการเข้าถึงข้อมูลจากลำดับก่อนหน้าและปัจจุบันเท่านั้น ทำให้ไม่สามารถเข้าถึงข้อมูลจากลำดับอนาคตได้ ซึ่งทำให้โมเดล Mamba เหมาะสมกับงานที่ต้องสร้างลำดับแบบอัตโนมัติ

โหมดที่มองเห็นทั้งหมดเหมาะสมกับงานที่ต้องเข้าใจข้อมูลทั้งหมดในครั้งเดียว ในทางกลับกัน โหมดที่มีการผสมโทเค็นแบบก่อให้เกิดผลลัพธ์เหมาะสมกับงานที่ต้องสร้างลำดับแบบอัตโนมัติ
งานการรู้จำภาพ การผสมโทเค็นแบบก่อให้เกิดผลลัพธ์ และลำดับที่ยาวมาก
ตามที่กล่าวไว้ก่อนหน้านี้ โหมดที่มองเห็นทั้งหมดทำให้สามารถผสมโทเค็นได้อย่างไม่มีข้อจำกัด ในทางกลับกัน โหมดที่มีการผสมโทเค็นแบบก่อให้เกิดผลลัพธ์จำกัดการเข้าถึงข้อมูลจากลำดับก่อนหน้าเท่านั้น นอกจากนี้ การรู้จำภาพเป็นงานที่ต้องเข้าใจข้อมูลทั้งหมดในครั้งเดียว ทำให้ไม่ต้องการข้อจำกัดในการผสมโทเค็น
การยืนยันผลลัพธ์ทางทดลอง
ขั้นตอนต่อไปคือการยืนยันสมมติฐานที่ MambaOut เสนอทางทดลอง ตามที่แสดงในภาพต่อไปนี้ บล็อก Mamba มีพื้นฐานมาจากบล็อก Gated Convolutional Neural Network และโครงสร้างของ Mamba และ Gated CNN สามารถถือเป็นการรวมกันของโมดูลผสมโทเค็นของ MetaFormer และ MLP

บล็อก Mamba ขยาย Gated Convolutional Neural Network ด้วยโมเดลพื้นที่สถานะเพิ่มเติม และการมีอยู่ของโมเดลพื้นที่สถานะคือสิ่งที่ทำให้ Gated CNN และบล็อก Mamba แตกต่างกัน

งานการจำแนกประเภทภาพ
ImageNet เป็นมาตรฐานสำหรับงานการจำแนกประเภทภาพ โดยมีคลาสที่พบบ่อยกว่า 1,000 คลาส ภาพฝึกอบรมมากกว่า 1.3 ล้านภาพ และภาพทดสอบมากกว่า 50,000 ภาพ การเพิ่มประสิทธิภาพข้อมูลที่ใช้ในการทดลองประกอบด้วยการคัดลอกภาพแบบสุ่ม การผสมสี การลบสีแบบสุ่ม และการเพิ่มประสิทธิภาพอื่นๆ ตารางต่อไปนี้สรุปประสิทธิภาพของโมเดล Mamba, MambaOut และโมเดลอื่นๆ ที่ใช้ความสนใจและคอนโวลูชันบน ImageNet

ตัวอย่างเช่น โมเดล MambaOut-Small ให้คะแนนความแม่นยำสูงสุดมากกว่า 84% ซึ่งสูงกว่าโมเดล Mamba ที่ใกล้เคียงที่สุด 0.4% ผลลัพธ์นี้สนับสนุนสมมติฐานแรกที่ระบุว่าการแนะนำโมเดลพื้นที่สถานะสำหรับงานการจำแนกประเภทภาพไม่จำเป็น
งานการตรวจจับวัตถุและการแบ่งส่วนแบบอินสแตนซ์
COCO เป็นมาตรฐานสำหรับงานการตรวจจับวัตถุและการแบ่งส่วนแบบอินสแตนซ์ แม้ว่า MambaOut จะสามารถเอาชนะโมเดล Mamba บางตัวได้ แต่ก็ยังต่ำกว่าโมเดล Mamba ที่มีคุณภาพสูงสุด รวมถึง LocalVMamba และ VMamba ความแตกต่างในประสิทธิภาพของ MambaOut เทียบกับโมเดล Mamba ที่มีคุณภาพสูงสุดเน้นย้ำถึงประโยชน์ของการรวมโมเดล Mamba ในงานที่มีลำดับที่ยาว

ความคิดสุดท้าย
โมเดล Mamba ดูเหมือนจะเหมาะสมกับงานที่มีลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว MambaOut คาดการณ์ว่า Mamba ไม่จำเป็นต่องานที่เกี่ยวข้องกับการมองเห็น เนื่องจากการจำแนกประเภทภาพไม่สอดคล้องกับทั้งลักษณะการสร้างลำดับแบบอัตโนมัติหรือลำดับที่ยาว แม้ว่างานการตรวจจับวัตถุและการแบ่งส่วนแบบอินสแตนซ์ไม่ใช่การสร้างลำดับแบบอัตโนมัติ แต่ก็แสดงลักษณะของลำดับที่ยาว ทำให้ MambaOut คาดการณ์ถึงศักยภาพของ Mamba สำหรับงานเหล่านี้ MambaOut เป็นโครงสร้างที่สร้างโดยการวางบล็อก Mamba ทับกันโดยไม่มีโมเดลพื้นที่สถานะ และผลการทดลองสนับสนุนสมมติฐานที่ MambaOut เสนอ เนื่องจากสามารถเอาชนะโมเดล Mamba ที่มี SSM ในการจำแนกประเภทภาพ ImageNet ได้ ซึ่งบ่งชี้ว่า Mamba ไม่จำเป็นต่องานที่เกี่ยวข้องกับการมองเห็น ในทางกลับกัน สำหรับงานการตรวจจับวัตถุและการแบ่งส่วนแบบอินสแตนซ์ MambaOut ไม่สามารถทำซ้ำประสิทธิภาพที่โมเดล Mamba ที่มีคุณภาพสูงสุดได้ ซึ่งแสดงถึงศักยภาพของโมเดล Mamba สำหรับงานที่มีลำดับที่ยาว












