โมเดลและแพลตฟอร์ม AI
มินิ-เจมินี่: การเพิ่มความเร็วของโมเดลภาษาและวิชั่นที่มีหลายรูปแบบ
ความก้าวหน้าใน โมเดลภาษาขนาดใหญ่ ได้เร่งการ разработкаของ การประมวลผลภาษาแบบธรรมชาติ หรือ NLP อย่างมาก การแนะนำเฟรมเวิร์กทรานส์ฟอร์เมอร์เป็น 里程碑ที่สำคัญในการพัฒนาโมเดลภาษาใหม่ รวมถึง OPT และ BERT ซึ่งมีความเข้าใจภาษาที่ลึกซึ้ง นอกจากนี้ การเริ่มต้นของ GPT หรือโมเดลทรานส์ฟอร์เมอร์แบบเจเนอเรตีฟได้แนะนำพาราได้มใหม่ด้วยการสร้างแบบอัตโนมัติและกำหนดวิธีการที่แข็งแกร่งสำหรับการคาดการณ์และสร้างภาษา การมาถึงของโมเดลภาษา เช่น GPT-4, ChatGPT, Mixtral, LLaMA และอื่นๆ ได้เร่งการพัฒนาอย่างรวดเร็ว โดยแต่ละโมเดลแสดงถึงประสิทธิภาพที่ดีขึ้นในงานที่เกี่ยวข้องกับการประมวลผลภาษาที่ซับซ้อน
นอกจากนี้ การมาบรรจบกันของโมเดลภาษาแบบธรรมชาติและคอมพิวเตอร์วิชั่นได้ให้กำเนิดโมเดลภาษาและวิชั่น หรือ VLMs ซึ่งรวมโมเดลภาษาและวิชั่นเพื่อให้เข้าใจและเหตุผลข้ามโหมด การบูรณาการและกำเนิดของโมเดลวิชั่นและภาษาได้เล่นบทบาทสำคัญในการพัฒนางานที่ต้องการทั้งการประมวลผลภาษาและความเข้าใจวิชั่น การเกิดขึ้นของโมเดลเช่น CLIP ได้ลดช่องว่างระหว่างงานวิชั่นและโมเดลภาษา โดยแสดงให้เห็นถึงความเป็นไปได้และความเป็นไปได้ของการประยุกต์ใช้ข้ามโหมดที่หลากหลาย

ด้วยเหตุนี้ และ尽管มีการพัฒนาอย่างรวดเร็วในโมเดลภาษาและวิชั่นที่ช่วยให้เกิดการให้เหตุผลและวิชั่นพื้นฐาน แต่ยังคงมีช่องว่างการแสดงผลที่สำคัญระหว่างโมเดลที่ซับซ้อน เช่น GPT-4 และโมเดลภาษาและวิชั่น มินิ-เจมินี่เป็นความพยายามในการลดช่องว่างระหว่างโมเดลภาษาและวิชั่นและโมเดลที่ทันสมัยกว่า โดยการขุดค้นศักยภาพของ VLMs จากสามด้าน: VLM-การสร้างแบบเจเนอเรตีฟ, ข้อมูลคุณภาพสูง, และโทเค็นวิชั่นที่มีความละเอียดสูง เพื่อเพิ่มโทเค็นวิชั่น มินิ-เจมินี่เสนอให้ใช้เครื่องบินวิชั่นเพิ่มเติมสำหรับการปรับปรุงความละเอียดสูงโดยไม่เพิ่มจำนวนโทเค็นวิชั่น
มินิ-เจมินี่: การเพิ่มความเร็วของโมเดลภาษาและวิชั่นที่มีหลายรูปแบบ
ในช่วงหลายปีที่ผ่านมา โมเดลภาษาขนาดใหญ่ได้พัฒนาและตอนนี้มีความสามารถหลายรูปแบบที่น่าประทับใจ และกลายเป็นส่วนสำคัญของโมเดลภาษาและวิชั่นในปัจจุบัน อย่างไรก็ตาม ยังคงมีช่องว่างระหว่างการแสดงผลหลายรูปแบบของโมเดลภาษาขนาดใหญ่และโมเดลภาษาและวิชั่น โดยการวิจัยล่าสุดกำลังมองหาวิธีการรวมวิชั่นเข้ากับโมเดลภาษาขนาดใหญ่โดยใช้ภาพและวิดีโอ
มินิ-เจมินี่: วิธีการและสถาปัตยกรรม
มินิ-เจมินี่เป็นเฟรมเวิร์กที่เรียบง่ายและประกอบด้วยสามส่วน
- เฟรมเวิร์กใช้เครื่องบินวิชั่นแบบคู่เพื่อให้ได้การเชื่อมต่อวิชั่นที่มีความละเอียดต่ำและคุณภาพสูง
- เฟรมเวิร์กเสนอให้ใช้การขุดค้นข้อมูลเพื่อทำการขุดค้นข้อมูลที่ระดับพื้นที่ระหว่างการเชื่อมต่อวิชั่นที่มีความละเอียดต่ำและพื้นที่ที่มีความละเอียดสูง
- มินิ-เจมินี่ใช้โมเดลภาษาขนาดใหญ่เพื่อรวมภาษาและภาพสำหรับการสร้างและความเข้าใจพร้อมๆ กัน
เครื่องบินวิชั่นแบบคู่
มินิ-เจมินี่สามารถประมวลผลทั้งภาษาและภาพเข้าและออก โดยสามารถจัดการทั้งสองอย่างได้ทั้งแบบแยกกันและแบบรวมกัน

จากนั้นเฟรมเวิร์กจะประมวลผลภาพเหล่านี้และเข้ารหัสเป็นการเชื่อมต่อวิชั่นแบบหลายกริดในสองกระแสภาพแบบขนาน
การขุดค้นข้อมูล
ด้วยเครื่องบินวิชั่นแบบคู่ที่สร้างการเชื่อมต่อวิชั่นที่มีความละเอียดต่ำและคุณสมบัติที่มีความละเอียดสูง มินิ-เจมินี่เสนอให้ใช้การขุดค้นข้อมูลเพื่อขยายศักยภาพของโมเดลภาษาและวิชั่นด้วยโทเค็นวิชั่นที่มีความละเอียดสูง

สูตรนี้แสดงถึงกระบวนการของการปรับปรุงและสร้างข้อมูลวิชั่นที่นำไปสู่การสร้างโทเค็นวิชั่นที่มีความละเอียดสูงสำหรับการประมวลผลโมเดลภาษาขนาดใหญ่ต่อไป
การสร้างภาษาและภาพ
มินิ-เจมินี่รวมโทเค็นวิชั่นและโทเค็นภาษาเข้าด้วยกันเป็นข้อมูลเข้าสำหรับโมเดลภาษาขนาดใหญ่สำหรับการสร้างแบบอัตโนมัติ

มินิ-เจมินี่: การทดลองและผลลัพธ์
ในการประเมินประสิทธิภาพ มินิ-เจมินี่ถูกสร้างขึ้นด้วยเฟรมเวิร์ก ConvNext-L สำหรับเครื่องบินวิชั่นที่มีความละเอียดสูง และด้วย Vision Transformer ที่ได้รับการฝึกจาก CLIP สำหรับเครื่องบินวิชั่นที่มีความละเอียดต่ำ

ตารางต่อไปนี้เปรียบเทียบประสิทธิภาพของมินิ-เจมินี่กับโมเดลที่ทันสมัยอื่นๆ ในหลายๆ สถานการณ์ และยังพิจารณาโมเดลส่วนตัวด้วย

ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึงมินิ-เจมินี่ ซึ่งเป็นเฟรมเวิร์กที่มีประสิทธิภาพและเป็นระบบสำหรับโมเดลภาษาและวิชั่นที่มีหลายรูปแบบ












