โมเดลและแพลตฟอร์ม AI
MiniGPT-5 : การสร้างเนื้อหาที่เป็นภาพและภาษาแบบแทรกซ้อนผ่าน Generative Vokens
ในช่วงไม่กี่ปีที่ผ่านมา โมเดลภาษาขนาดใหญ่ (LLMs) ได้รับความสนใจจากนักพัฒนา AI ทั่วโลกเนื่องจากความก้าวหน้าในด้านการประมวลผลภาษาธรรมชาติ (NLP) โมเดลเหล่านี้ได้ตั้งมาตรฐานใหม่ในการสร้างและเข้าใจข้อความ อย่างไรก็ตาม แม้ว่าจะมีการพัฒนาการสร้างข้อความ แต่การสร้างภาพที่สอดคล้องกับเรื่องราวข้อความยังคงเป็นเรื่องที่ท้าทาย เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงได้แนะนำแนวทางใหม่ในการสร้างภาพและภาษาโดยใช้ “generative vokens” ซึ่งเป็นแนวทางที่เชื่อมช่องว่างระหว่างการสร้างข้อความและภาพ
รากฐานของ MiniGPT-5 คือยุทธวิธีการฝึกอบรมสองขั้นตอนที่เน้นการสร้างข้อมูลหลายรูปแบบโดยไม่ต้องมีการอธิบายภาพที่ครอบคลุม นอกจากนี้ เพื่อเพิ่มความสมบูรณ์ของโมเดล โมเดลนี้ยังรวมถึงระบบการแนะนำที่ไม่ต้องมีการจัดประเภท ซึ่งช่วยเพิ่มประสิทธิภาพของ voken ในการสร้างภาพ ในขั้นตอนแรกของการฝึกอบรม MiniGPT-5 แสดงให้เห็นถึงประสิทธิภาพที่แข็งแกร่งและความก้าวหน้าที่สำคัญเมื่อเทียบกับโมเดล Divter ที่ฝึกอบรมบนชุดข้อมูล MMDialog และแสดงให้เห็นถึงความสามารถในการส่งมอบผลลัพธ์หลายรูปแบบที่เทียบเท่าหรือเหนือกว่าในแบบทดสอบของมนุษย์ที่ดำเนินการบนชุดข้อมูล VIST ซึ่งเน้นย้ำถึงประสิทธิภาพและประสิทธิผลของโมเดลนี้
MiniGPT5 : การแนะนำ
ด้วยการพัฒนาของโครงสร้าง LLM ล่าสุด และการประยุกต์ใช้โครงสร้างเหล่านี้ การบูรณาการคุณลักษณะมัลติมีเดียเป็นสาขาที่ได้รับความนิยมมากขึ้น เนื่องจากเป็นการพัฒนาที่สำคัญซึ่งให้พลังงานแก่แอปพลิเคชันต่างๆ ตั้งแต่เครื่องมือสร้างเนื้อหาที่ทันสมัยจนถึงตัวแทนการ 대화 มัลติม็อดัลที่ทันสมัย ด้วยการวิจัยและพัฒนาอย่างต่อเนื่อง โมเดลภาษาและภาพถึงจุดที่สามารถสร้างข้อความและข้อมูลภาพได้อย่างราบรื่น ความสามารถของ LLM ในการสร้างข้อมูลหลายรูปแบบได้อย่างราบรื่นจะช่วยปรับปรุงการโต้ตอบระหว่างโดเมนต่างๆ รวมถึงอีคอมเมิร์ซ สื่อ และความเป็นจริงเสมือน

สุดท้าย เป้าหมายคือการทำให้โมเดลสามารถสังเคราะห์ รับรู้ และตอบสนองในลักษณะที่สอดคล้องกันและตรรกะโดยใช้ทั้งรูปแบบข้อความและภาพ ดังนั้นจึงมีบทบาทสำคัญในการสร้างความสม่ำเสมอของการไหลของข้อมูล และสร้างเรื่องราวที่สอดคล้องกันและสม่ำเสมอ ความจำเป็นในการบรรลุการผสมผสานระหว่างรูปแบบข้อความและภาพถูกขับเคลื่อนด้วยความต้องการการโต้ตอบมัลติม็อดัลที่มีการโต้ตอบและสม่ำเสมอใน LLMs และสุดท้ายคือการบรรลุการสร้างภาษาและภาพแบบแทรกซ้อน อย่างไรก็ตาม การบรรลุการโต้ตอบมัลติม็อดัลที่มีการโต้ตอบใน LLMs เป็นงานที่ซับซ้อนและมีหลายความท้าทาย รวมถึง
- แม้ว่า LLMs ปัจจุบันจะมีประสิทธิภาพและสามารถสร้างข้อความได้ดี แต่ก็ไม่สามารถสร้างภาพได้ดี
- การพัฒนาของโมเดลเหล่านี้ขึ้นอยู่กับข้อมูลที่มี焦点 ซึ่งทำให้โมเดลมีความยากในการจัดตำแหน่งข้อความที่สอดคล้องกับภาพที่สอดคล้องกัน
- สุดท้าย มีความจำเป็นในการค้นหาวิธีการที่มีประสิทธิภาพมากขึ้น เนื่องจากเมื่อความสามารถของ LLMs เพิ่มขึ้น ความต้องการหน่วยความจำของ LLMs ก็เพิ่มขึ้นด้วย โดยเฉพาะอย่างยิ่งเมื่อทำงานที่มีหน้าที่ลูกเล่น
MiniGPT-5 เป็นเทคนิคการสร้างภาษาและภาพแบบแทรกซ้อนโดยใช้ “generative vokens” เพื่อแก้ไขความท้าทายเหล่านี้ โมเดลนี้เสนอแนวทางใหม่ในการสร้างข้อมูลหลายรูปแบบโดยการผสมผสาน LLMs ที่มีเทคนิคการกระจายเสถียรภาพโดยใช้ตัวแทนภาพพิเศษ

แต่สิ่งที่ทำให้ MiniGPT-5 แตกต่างจากโครงสร้างที่มีอยู่คือการฝึกอบรมที่ไม่มีการอธิบายภาพ นอกจากนี้ เพื่อให้แน่ใจว่าข้อความและภาพที่สร้างขึ้นเป็นไปตามกัน MiniGPT-5 ใช้กลยุทธ์ dual-loss ที่เพิ่มประสิทธิภาพของการสร้าง vokens และการแนะนำที่ไม่ต้องมีการจัดประเภท
เพื่อให้ได้สรุปอย่างรวดเร็ว MiniGPT-5
- เสนอวิธีการที่ใช้การเข้ารหัสหลายรูปแบบที่เป็นวิธีการใหม่และทั่วไปที่มีประสิทธิภาพมากกว่า LLMs แบบดั้งเดิม และใช้ตัวแทนการสร้างภาพร่วมกับเทคนิคการกระจายเสถียรภาพเพื่อสร้างผลลัพธ์ภาษาและภาพแบบแทรกซ้อน
- เสนอการฝึกอบรมสองขั้นตอนสำหรับการสร้างข้อมูลหลายรูปแบบโดยไม่ต้องมีการอธิบาย และการแนะนำที่ไม่ต้องมีการจัดประเภทเพื่อเพิ่มคุณภาพของข้อมูลที่สร้างขึ้น
MiniGPT-5 ได้รับแรงบันดาลใจจากงานวิจัยและงานที่ทำในด้าน
- การสร้างภาพจากข้อความ : การเปลี่ยนข้อความเป็นภาพที่สอดคล้องกัน และการสร้างภาพจากข้อความ
- MLLMs หรือโมเดลภาษาขนาดใหญ่มัลติม็อดัล : การใช้ LLMs ที่ฝึกอบรมไว้เพื่อสำรวจการประยุกต์ใช้และประสิทธิภาพในการสร้างข้อมูลหลายรูปแบบ
- การสร้างหลายรูปแบบด้วย LLMs : การเพิ่มความสามารถของ LLMs เพื่อสร้างข้อมูลหลายรูปแบบได้อย่างราบรื่น
MiniGPT-5 : วิธีการ อาร์กิตเทคเจอร์ และโครงสร้าง
เพื่อให้ LLMs มีความสามารถในการสร้างข้อมูลหลายรูปแบบ MiniGPT-5 นำเสนอโครงสร้างที่รวม LLMs ที่มีเทคนิคการสร้างภาพจากข้อความและโมเดลภาษาขนาดใหญ่มัลติม็อดัลที่ฝึกอบรมไว้ โครงสร้างนี้ยังรวมถึง “generative vokens” ซึ่งเป็นตัวแทนภาพพิเศษที่ช่วยให้นักพัฒนาสามารถแก้ไขปัญหาที่เกิดขึ้นระหว่างโดเมนต่างๆ ได้
ขั้นตอนการรับข้อมูลหลายรูปแบบ
การพัฒนาของ LLMs ในช่วงไม่กี่ปีที่ผ่านมาได้แสดงให้เห็นถึงความสามารถในการประมวลผลภาพเป็นข้อมูลรับเข้า MiniGPT-5 ใช้ตัวแทนภาพพิเศษเพื่อสร้างคุณลักษณะภาพในความพยายามที่จะขยายความสามารถในการประมวลผลหลายรูปแบบของ LLMs
การเข้ารหัสหลายรูปแบบ
ตัวเข้ารหัสภาพที่ฝึกอบรมไว้ใน MiniGPT-5 แปลงภาพที่รับเข้ามาเป็นคุณลักษณะ และตัวแทนข้อความที่ฝึกอบรมไว้จะถูกสร้างเป็นเวกเตอร์ และคุณลักษณะการรับเข้าจะถูกสร้างขึ้นเมื่อเวกเตอร์เหล่านี้ถูกต่อกัน
การเพิ่มตัวแทนภาพใน LLMs
โดยทั่วไป ตัวอักษรของ LLMs จะประกอบด้วยตัวอักษรข้อความเท่านั้น ซึ่งทำให้นักพัฒนาของ MiniGPT-5 ต้องสร้างช่องว่างระหว่างการสร้างภาพและ LLMs แบบดั้งเดิม โครงสร้างนี้รวมถึงชุดตัวแทนภาพพิเศษที่เรียกว่า “generative vokens” ในตัวอักษรของ LLMs
PEFT หรือการฝึกอบรมที่มีประสิทธิภาพ
PEFT หรือการฝึกอบรมที่มีประสิทธิภาพเป็นแนวคิดที่สำคัญในการฝึกอบรม LLMs แต่การประยุกต์ใช้ PEFT ในการสร้างหลายรูปแบบยังคงเป็นเรื่องที่ไม่ได้สำรวจอย่างเต็มที่ MiniGPT-5 ใช้การฝึกอบรมที่มีประสิทธิภาพบนเครื่องรับข้อมูลของ MiniGPT-4 เพื่อฝึกอบรมโมเดลให้เข้าใจคำสั่งได้ดีขึ้นและเพิ่มประสิทธิภาพของโมเดลในสถานการณ์ใหม่ๆ
การสร้างหลายรูปแบบ
เพื่อจัดตำแหน่งโมเดลการสร้างภาพให้ตรงกับตัวแทนภาพพิเศษ MiniGPT-5 สร้างโมดูลการแมปที่กะทัดรัดเพื่อจัดตำแหน่งมิติและรวมถึงการขาดทุนการกำกับดูแล เช่น การขาดทุนการกระจายเสถียรภาพและการขาดทุนพื้นที่ข้อความ การขาดทุนการกำกับดูแลการกระจายเสถียรภาพจะจัดตำแหน่งคุณลักษณะภาพที่เหมาะสมกับตัวแทนภาพพิเศษโดยตรง ในขณะที่การขาดทุนพื้นที่ข้อความจะช่วยให้โมเดลเรียนรู้ตำแหน่งที่ถูกต้องของตัวแทนภาพพิเศษ
การสร้างพื้นที่ข้อความ
MiniGPT-5 ใช้วิธีการสร้างภาษาแบบสุ่มเพื่อสร้างตัวแทนภาพพิเศษและข้อความในพื้นที่ข้อความร่วมกัน และในระหว่างการฝึกอบรม ตัวแทนภาพพิเศษจะถูกเพิ่มเข้าไปในตำแหน่งของภาพที่แท้จริง และโมเดลจะถูกฝึกอบรมให้ทำนายตัวแทนภาพพิเศษในระหว่างการสร้างข้อความ
การแมปคุณลักษณะตัวแทนภาพสำหรับการสร้างภาพ
หลังจากสร้างพื้นที่ข้อความแล้ว โครงสร้างจะจัดตำแหน่งสถานะการออกของโมเดลให้ตรงกับพื้นที่คุณลักษณะของโมเดลการสร้างภาพจากข้อความ และโครงสร้างยังรวมถึงโมดูลการแมปคุณลักษณะที่ประกอบด้วยโมเดลการแปลงแบบ dual-layer MLP และโมเดลทรานส์ฟอร์เมอร์แบบ four-layer encoder-decoder
การสร้างภาพด้วย LDM หรือโมเดลการกระจายเสถียรภาพ
เพื่อสร้างภาพที่ต้องการในกระบวนการกำจัดเสียง โครงสร้างจะใช้คุณลักษณะการแมปเป็นข้อมูลรับเข้า และโครงสร้างยังใช้ LDM หรือโมเดลการกระจายเสถียรภาพเพื่อการกำกับดูแล และในระหว่างการฝึกอบรม ภาพที่แท้จริงจะถูกแปลงเป็นคุณลักษณะ 潜ในโดยใช้ VAE ที่ฝึกอบรมไว้ และคุณลักษณะเสียงจะถูกได้รับโดยการเพิ่มเสียงบางส่วน
แนวทางที่ครอบคลุมของ MiniGPT-5 ช่วยให้นักพัฒนาสามารถเข้าใจและสร้างเนื้อหาที่เป็นภาพและภาษาได้อย่างสอดคล้องกัน โดยใช้ตัวแทนภาพพิเศษ การใช้ความสามารถของโมเดลที่ฝึกอบรมไว้ และการฝึกอบรมที่มีประสิทธิภาพ
MiniGPT-5 : การฝึกอบรมและการทดสอบ
เมื่อทำงานกับ MiniGPT-5 นักพัฒนาพบว่าการฝึกอบรมโดยตรงบนชุดข้อมูลที่มีการแทรกภาพและข้อความอาจทำให้ได้ภาพที่มีคุณภาพลดลง และการไม่สอดคล้องกันเนื่องจากการเปลี่ยนแปลงโดเมนที่สำคัญระหว่างโดเมนภาพและข้อความ เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงใช้กลยุทธ์การฝึกอบรมสองแบบ
- การรวมถึงเทคนิคการแนะนำที่ไม่ต้องมีการจัดประเภทเพื่อเพิ่มประสิทธิภาพของตัวแทนภาพพิเศษในระหว่างการกระจายเสถียรภาพ
- กลยุทธ์ที่สองแบ่งออกเป็นสองขั้นตอน
- ขั้นตอนการฝึกอบรมเบื้องต้นซึ่งเน้นการปรับตำแหน่งคุณลักษณะที่หยาบ
- ขั้นตอนการฝึกอบรมที่สองซึ่งอำนวยความสะดวกในการเรียนรู้คุณลักษณะ
CFG หรือการแนะนำที่ไม่ต้องมีการจัดประเภท
แนวคิดในการใช้ CFG สำหรับการสร้างหลายรูปแบบมาจากความพยายามที่จะเพิ่มความสอดคล้องกันและตรรกะระหว่างภาพและข้อความที่สร้างขึ้น และ CFG ถูกนำมาใช้ในระหว่างการกระจายเสถียรภาพจากข้อความเป็นภาพ
กลยุทธ์การฝึกอบรมสองขั้นตอน
เนื่องจากการเปลี่ยนแปลงโดเมนที่สำคัญระหว่างการสร้างภาพและข้อความ MiniGPT-5 ใช้กลยุทธ์การฝึกอบรมสองขั้นตอน
- ขั้นตอนการฝึกอบรมแบบไม่มีการแทรกภาพหรือ UAS
- ขั้นตอนการเรียนรู้หลายรูปแบบหรือ MLS
ในขั้นตอนแรก โครงสร้างจะจัดตำแหน่งคุณลักษณะการสร้างภาพให้ตรงกับตัวแทนภาพพิเศษในชุดข้อมูลภาพและข้อความที่ไม่มีการแทรก และในขั้นตอนนี้ โครงสร้างจะทำให้ LLMs สามารถสร้างตัวแทนภาพพิเศษได้โดยใช้คำบรรยายภาพเป็นข้อมูลรับเข้า
หลังจากที่ UAS สำเร็จแล้ว โมเดลสามารถสร้างภาพสำหรับคำบรรยายภาพเดี่ยวได้ แต่จะพบปัญหาในการสร้างภาพและข้อความที่แทรกซ้อน รวมถึงการให้เหตุผลที่ซับซ้อนในการสร้างภาพและข้อความ เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงได้ปรับโมเดล MiniGPT-5 โดยใช้ PEFT และชุดข้อมูลที่มีการแทรกภาพและข้อความ เช่น VIST ในระหว่างขั้นตอนนี้ โครงสร้างจะสร้างงานที่แตกต่างกันสามงานจากชุดข้อมูล
- การสร้างข้อความเท่านั้น : สร้างข้อความที่เกี่ยวข้องกับภาพถัดไป
- การสร้างภาพเท่านั้น : สร้างภาพที่เกี่ยวข้องกับข้อความถัดไป
- การสร้างหลายรูปแบบ : สร้างภาพและข้อความที่เกี่ยวข้องกันโดยใช้ข้อมูลรับเข้า
MiniGPT-5 : การทดสอบและการประเมิน
เพื่อประเมินประสิทธิภาพของ MiniGPT-5 ในการสร้างหลายรูปแบบอย่างครอบคลุม ทีมพัฒนาของ MiniGPT-5 ได้เปรียบเทียบประสิทธิภาพของโมเดลนี้กับโมเดลที่มีอยู่ เช่น Divter, GILL และโมเดลการสร้างภาพที่ไม่มีการแทรกที่ฝึกอบรมไว้ และการเปรียบเทียบนี้แสดงไว้ในตารางด้านล่าง

MiniGPT-5 ตระหนักว่าผลลัพธ์หลายรูปแบบอาจมีความหมายตามบริบท แต่อาจแตกต่างจากความเป็นจริง ซึ่งเป็นเหตุผลหลักที่ MiniGPT-5 รวมถึงการรับเข้าจากมนุษย์เพื่อประเมินและประเมินประสิทธิภาพของโมเดลโดยรวม ประสิทธิภาพของ MiniGPT-5 ในการสร้างหลายรูปแบบจะถูกวัดจากสามมุมมอง
- ความต่อเนื่องของภาษา : ประเมินว่าข้อความที่สร้างขึ้นเป็นไปตามบริบทที่ให้มาหรือไม่
- คุณภาพของภาพ : ประเมินความเกี่ยวข้องและความชัดเจนของภาพที่สร้างขึ้น
- ความสอดคล้องของหลายรูปแบบ : ประเมินว่าผลลัพธ์ภาพและข้อความที่สร้างขึ้นเป็นไปตามกันหรือไม่
การประเมินขั้นตอนสุดท้ายของ VIST
ในขั้นตอนแรกของการทดสอบ MiniGPT-5 มีเป้าหมายในการสร้างภาพที่เกี่ยวข้องกับข้อความ และตารางด้านล่างสรุปผลลัพธ์ที่ได้รับจากการตั้งค่านี้

ดังที่เห็น MiniGPT-5 สามารถทำได้ดีกว่าโมเดล SD2 ที่ฝึกอบรมไว้ในทั้งสามการตั้งค่า ซึ่งแสดงให้เห็นถึงประสิทธิภาพของ MiniGPT-5

รูปด้านบนเปรียบเทียบประสิทธิภาพของ MiniGPT-5 กับโมเดล MiniGPT-4 ที่ฝึกอบรมไว้บน S-BERT, Rouge-L และ Meteor ผลลัพธ์แสดงให้เห็นว่าการใช้ตัวแทนภาพพิเศษไม่ส่งผลเสียต่อประสิทธิภาพของโมเดลเมื่อทำการสร้างหลายรูปแบบ และ MiniGPT-5 สามารถใช้ข้อมูลรับเข้าหลายรูปแบบที่ยาวและกว้างเพื่อสร้างภาพที่มีคุณภาพและสอดคล้องกันโดยไม่สูญเสียความสามารถในการสร้างหลายรูปแบบ

ตารางด้านบนเปรียบเทียบประสิทธิภาพของสามโมเดลบน 5,000 ตัวอย่างสำหรับการสร้างหลายรูปแบบจากมุมมองของความสอดคล้องของหลายรูปแบบ คุณภาพของภาพ และความต่อเนื่องของภาษา ดังที่เห็น MiniGPT-5 สามารถทำได้ดีกว่าโมเดลอื่นๆ มากกว่า 70% ของกรณี และตารางด้านล่างแสดงถึงประสิทธิภาพของ MiniGPT-5 บนชุดข้อมูล CC3M สำหรับการสร้างภาพเดี่ยว


สรุป
ในบทความนี้ เราได้พูดถึง MiniGPT-5 ซึ่งเป็นเทคนิคการสร้างภาษาและภาพแบบแทรกซ้อนโดยใช้ “generative vokens” เพื่อใช้ความสามารถของ LLMs ในการสร้างข้อมูลหลายรูปแบบโดยการผสมผสาน LLMs ที่มีเทคนิคการสร้างภาพจากข้อความ และโมเดลภาษาขนาดใหญ่มัลติม็อดัลที่ฝึกอบรมไว้ เราได้พูดถึงส่วนประกอบที่สำคัญและโครงสร้างโดยรวมของ MiniGPT-5 พร้อมด้วยผลลัพธ์ที่แสดงถึงความก้าวหน้าที่สำคัญในด้านประสิทธิภาพและประสิทธิผลเมื่อเทียบกับโมเดลที่มีอยู่และโมเดลที่เป็นรากฐาน MiniGPT-5 มีเป้าหมายที่จะสร้างมาตรฐานใหม่ในด้านการสร้างเนื้อหาที่เป็นภาพและภาษา และมีเป้าหมายที่จะแก้ไขปัญหาที่เกิดขึ้นกับโมเดลก่อนหน้านี้ที่พยายามแก้ไขปัญหาเดียวกัน












