โมเดลและแพลตฟอร์ม AI

MiniGPT-5 : การสร้างเนื้อหาที่เป็นภาพและภาษาแบบแทรกซ้อนผ่าน Generative Vokens

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในช่วงไม่กี่ปีที่ผ่านมา โมเดลภาษาขนาดใหญ่ (LLMs) ได้รับความสนใจจากนักพัฒนา AI ทั่วโลกเนื่องจากความก้าวหน้าในด้านการประมวลผลภาษาธรรมชาติ (NLP) โมเดลเหล่านี้ได้ตั้งมาตรฐานใหม่ในการสร้างและเข้าใจข้อความ อย่างไรก็ตาม แม้ว่าจะมีการพัฒนาการสร้างข้อความ แต่การสร้างภาพที่สอดคล้องกับเรื่องราวข้อความยังคงเป็นเรื่องที่ท้าทาย เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงได้แนะนำแนวทางใหม่ในการสร้างภาพและภาษาโดยใช้ “generative vokens” ซึ่งเป็นแนวทางที่เชื่อมช่องว่างระหว่างการสร้างข้อความและภาพ

รากฐานของ MiniGPT-5 คือยุทธวิธีการฝึกอบรมสองขั้นตอนที่เน้นการสร้างข้อมูลหลายรูปแบบโดยไม่ต้องมีการอธิบายภาพที่ครอบคลุม นอกจากนี้ เพื่อเพิ่มความสมบูรณ์ของโมเดล โมเดลนี้ยังรวมถึงระบบการแนะนำที่ไม่ต้องมีการจัดประเภท ซึ่งช่วยเพิ่มประสิทธิภาพของ voken ในการสร้างภาพ ในขั้นตอนแรกของการฝึกอบรม MiniGPT-5 แสดงให้เห็นถึงประสิทธิภาพที่แข็งแกร่งและความก้าวหน้าที่สำคัญเมื่อเทียบกับโมเดล Divter ที่ฝึกอบรมบนชุดข้อมูล MMDialog และแสดงให้เห็นถึงความสามารถในการส่งมอบผลลัพธ์หลายรูปแบบที่เทียบเท่าหรือเหนือกว่าในแบบทดสอบของมนุษย์ที่ดำเนินการบนชุดข้อมูล VIST ซึ่งเน้นย้ำถึงประสิทธิภาพและประสิทธิผลของโมเดลนี้

MiniGPT5 : การแนะนำ

ด้วยการพัฒนาของโครงสร้าง LLM ล่าสุด และการประยุกต์ใช้โครงสร้างเหล่านี้ การบูรณาการคุณลักษณะมัลติมีเดียเป็นสาขาที่ได้รับความนิยมมากขึ้น เนื่องจากเป็นการพัฒนาที่สำคัญซึ่งให้พลังงานแก่แอปพลิเคชันต่างๆ ตั้งแต่เครื่องมือสร้างเนื้อหาที่ทันสมัยจนถึงตัวแทนการ 대화 มัลติม็อดัลที่ทันสมัย ด้วยการวิจัยและพัฒนาอย่างต่อเนื่อง โมเดลภาษาและภาพถึงจุดที่สามารถสร้างข้อความและข้อมูลภาพได้อย่างราบรื่น ความสามารถของ LLM ในการสร้างข้อมูลหลายรูปแบบได้อย่างราบรื่นจะช่วยปรับปรุงการโต้ตอบระหว่างโดเมนต่างๆ รวมถึงอีคอมเมิร์ซ สื่อ และความเป็นจริงเสมือน

สุดท้าย เป้าหมายคือการทำให้โมเดลสามารถสังเคราะห์ รับรู้ และตอบสนองในลักษณะที่สอดคล้องกันและตรรกะโดยใช้ทั้งรูปแบบข้อความและภาพ ดังนั้นจึงมีบทบาทสำคัญในการสร้างความสม่ำเสมอของการไหลของข้อมูล และสร้างเรื่องราวที่สอดคล้องกันและสม่ำเสมอ ความจำเป็นในการบรรลุการผสมผสานระหว่างรูปแบบข้อความและภาพถูกขับเคลื่อนด้วยความต้องการการโต้ตอบมัลติม็อดัลที่มีการโต้ตอบและสม่ำเสมอใน LLMs และสุดท้ายคือการบรรลุการสร้างภาษาและภาพแบบแทรกซ้อน อย่างไรก็ตาม การบรรลุการโต้ตอบมัลติม็อดัลที่มีการโต้ตอบใน LLMs เป็นงานที่ซับซ้อนและมีหลายความท้าทาย รวมถึง

  1. แม้ว่า LLMs ปัจจุบันจะมีประสิทธิภาพและสามารถสร้างข้อความได้ดี แต่ก็ไม่สามารถสร้างภาพได้ดี
  2. การพัฒนาของโมเดลเหล่านี้ขึ้นอยู่กับข้อมูลที่มี焦点 ซึ่งทำให้โมเดลมีความยากในการจัดตำแหน่งข้อความที่สอดคล้องกับภาพที่สอดคล้องกัน
  3. สุดท้าย มีความจำเป็นในการค้นหาวิธีการที่มีประสิทธิภาพมากขึ้น เนื่องจากเมื่อความสามารถของ LLMs เพิ่มขึ้น ความต้องการหน่วยความจำของ LLMs ก็เพิ่มขึ้นด้วย โดยเฉพาะอย่างยิ่งเมื่อทำงานที่มีหน้าที่ลูกเล่น

MiniGPT-5 เป็นเทคนิคการสร้างภาษาและภาพแบบแทรกซ้อนโดยใช้ “generative vokens” เพื่อแก้ไขความท้าทายเหล่านี้ โมเดลนี้เสนอแนวทางใหม่ในการสร้างข้อมูลหลายรูปแบบโดยการผสมผสาน LLMs ที่มีเทคนิคการกระจายเสถียรภาพโดยใช้ตัวแทนภาพพิเศษ

แต่สิ่งที่ทำให้ MiniGPT-5 แตกต่างจากโครงสร้างที่มีอยู่คือการฝึกอบรมที่ไม่มีการอธิบายภาพ นอกจากนี้ เพื่อให้แน่ใจว่าข้อความและภาพที่สร้างขึ้นเป็นไปตามกัน MiniGPT-5 ใช้กลยุทธ์ dual-loss ที่เพิ่มประสิทธิภาพของการสร้าง vokens และการแนะนำที่ไม่ต้องมีการจัดประเภท

เพื่อให้ได้สรุปอย่างรวดเร็ว MiniGPT-5

  1. เสนอวิธีการที่ใช้การเข้ารหัสหลายรูปแบบที่เป็นวิธีการใหม่และทั่วไปที่มีประสิทธิภาพมากกว่า LLMs แบบดั้งเดิม และใช้ตัวแทนการสร้างภาพร่วมกับเทคนิคการกระจายเสถียรภาพเพื่อสร้างผลลัพธ์ภาษาและภาพแบบแทรกซ้อน
  2. เสนอการฝึกอบรมสองขั้นตอนสำหรับการสร้างข้อมูลหลายรูปแบบโดยไม่ต้องมีการอธิบาย และการแนะนำที่ไม่ต้องมีการจัดประเภทเพื่อเพิ่มคุณภาพของข้อมูลที่สร้างขึ้น

MiniGPT-5 ได้รับแรงบันดาลใจจากงานวิจัยและงานที่ทำในด้าน

  • การสร้างภาพจากข้อความ : การเปลี่ยนข้อความเป็นภาพที่สอดคล้องกัน และการสร้างภาพจากข้อความ
  • MLLMs หรือโมเดลภาษาขนาดใหญ่มัลติม็อดัล : การใช้ LLMs ที่ฝึกอบรมไว้เพื่อสำรวจการประยุกต์ใช้และประสิทธิภาพในการสร้างข้อมูลหลายรูปแบบ
  • การสร้างหลายรูปแบบด้วย LLMs : การเพิ่มความสามารถของ LLMs เพื่อสร้างข้อมูลหลายรูปแบบได้อย่างราบรื่น

MiniGPT-5 : วิธีการ อาร์กิตเทคเจอร์ และโครงสร้าง

เพื่อให้ LLMs มีความสามารถในการสร้างข้อมูลหลายรูปแบบ MiniGPT-5 นำเสนอโครงสร้างที่รวม LLMs ที่มีเทคนิคการสร้างภาพจากข้อความและโมเดลภาษาขนาดใหญ่มัลติม็อดัลที่ฝึกอบรมไว้ โครงสร้างนี้ยังรวมถึง “generative vokens” ซึ่งเป็นตัวแทนภาพพิเศษที่ช่วยให้นักพัฒนาสามารถแก้ไขปัญหาที่เกิดขึ้นระหว่างโดเมนต่างๆ ได้

ขั้นตอนการรับข้อมูลหลายรูปแบบ

การพัฒนาของ LLMs ในช่วงไม่กี่ปีที่ผ่านมาได้แสดงให้เห็นถึงความสามารถในการประมวลผลภาพเป็นข้อมูลรับเข้า MiniGPT-5 ใช้ตัวแทนภาพพิเศษเพื่อสร้างคุณลักษณะภาพในความพยายามที่จะขยายความสามารถในการประมวลผลหลายรูปแบบของ LLMs

การเข้ารหัสหลายรูปแบบ

ตัวเข้ารหัสภาพที่ฝึกอบรมไว้ใน MiniGPT-5 แปลงภาพที่รับเข้ามาเป็นคุณลักษณะ และตัวแทนข้อความที่ฝึกอบรมไว้จะถูกสร้างเป็นเวกเตอร์ และคุณลักษณะการรับเข้าจะถูกสร้างขึ้นเมื่อเวกเตอร์เหล่านี้ถูกต่อกัน

การเพิ่มตัวแทนภาพใน LLMs

โดยทั่วไป ตัวอักษรของ LLMs จะประกอบด้วยตัวอักษรข้อความเท่านั้น ซึ่งทำให้นักพัฒนาของ MiniGPT-5 ต้องสร้างช่องว่างระหว่างการสร้างภาพและ LLMs แบบดั้งเดิม โครงสร้างนี้รวมถึงชุดตัวแทนภาพพิเศษที่เรียกว่า “generative vokens” ในตัวอักษรของ LLMs

PEFT หรือการฝึกอบรมที่มีประสิทธิภาพ

PEFT หรือการฝึกอบรมที่มีประสิทธิภาพเป็นแนวคิดที่สำคัญในการฝึกอบรม LLMs แต่การประยุกต์ใช้ PEFT ในการสร้างหลายรูปแบบยังคงเป็นเรื่องที่ไม่ได้สำรวจอย่างเต็มที่ MiniGPT-5 ใช้การฝึกอบรมที่มีประสิทธิภาพบนเครื่องรับข้อมูลของ MiniGPT-4 เพื่อฝึกอบรมโมเดลให้เข้าใจคำสั่งได้ดีขึ้นและเพิ่มประสิทธิภาพของโมเดลในสถานการณ์ใหม่ๆ

การสร้างหลายรูปแบบ

เพื่อจัดตำแหน่งโมเดลการสร้างภาพให้ตรงกับตัวแทนภาพพิเศษ MiniGPT-5 สร้างโมดูลการแมปที่กะทัดรัดเพื่อจัดตำแหน่งมิติและรวมถึงการขาดทุนการกำกับดูแล เช่น การขาดทุนการกระจายเสถียรภาพและการขาดทุนพื้นที่ข้อความ การขาดทุนการกำกับดูแลการกระจายเสถียรภาพจะจัดตำแหน่งคุณลักษณะภาพที่เหมาะสมกับตัวแทนภาพพิเศษโดยตรง ในขณะที่การขาดทุนพื้นที่ข้อความจะช่วยให้โมเดลเรียนรู้ตำแหน่งที่ถูกต้องของตัวแทนภาพพิเศษ

การสร้างพื้นที่ข้อความ

MiniGPT-5 ใช้วิธีการสร้างภาษาแบบสุ่มเพื่อสร้างตัวแทนภาพพิเศษและข้อความในพื้นที่ข้อความร่วมกัน และในระหว่างการฝึกอบรม ตัวแทนภาพพิเศษจะถูกเพิ่มเข้าไปในตำแหน่งของภาพที่แท้จริง และโมเดลจะถูกฝึกอบรมให้ทำนายตัวแทนภาพพิเศษในระหว่างการสร้างข้อความ

การแมปคุณลักษณะตัวแทนภาพสำหรับการสร้างภาพ

หลังจากสร้างพื้นที่ข้อความแล้ว โครงสร้างจะจัดตำแหน่งสถานะการออกของโมเดลให้ตรงกับพื้นที่คุณลักษณะของโมเดลการสร้างภาพจากข้อความ และโครงสร้างยังรวมถึงโมดูลการแมปคุณลักษณะที่ประกอบด้วยโมเดลการแปลงแบบ dual-layer MLP และโมเดลทรานส์ฟอร์เมอร์แบบ four-layer encoder-decoder

การสร้างภาพด้วย LDM หรือโมเดลการกระจายเสถียรภาพ

เพื่อสร้างภาพที่ต้องการในกระบวนการกำจัดเสียง โครงสร้างจะใช้คุณลักษณะการแมปเป็นข้อมูลรับเข้า และโครงสร้างยังใช้ LDM หรือโมเดลการกระจายเสถียรภาพเพื่อการกำกับดูแล และในระหว่างการฝึกอบรม ภาพที่แท้จริงจะถูกแปลงเป็นคุณลักษณะ 潜ในโดยใช้ VAE ที่ฝึกอบรมไว้ และคุณลักษณะเสียงจะถูกได้รับโดยการเพิ่มเสียงบางส่วน

แนวทางที่ครอบคลุมของ MiniGPT-5 ช่วยให้นักพัฒนาสามารถเข้าใจและสร้างเนื้อหาที่เป็นภาพและภาษาได้อย่างสอดคล้องกัน โดยใช้ตัวแทนภาพพิเศษ การใช้ความสามารถของโมเดลที่ฝึกอบรมไว้ และการฝึกอบรมที่มีประสิทธิภาพ

MiniGPT-5 : การฝึกอบรมและการทดสอบ

เมื่อทำงานกับ MiniGPT-5 นักพัฒนาพบว่าการฝึกอบรมโดยตรงบนชุดข้อมูลที่มีการแทรกภาพและข้อความอาจทำให้ได้ภาพที่มีคุณภาพลดลง และการไม่สอดคล้องกันเนื่องจากการเปลี่ยนแปลงโดเมนที่สำคัญระหว่างโดเมนภาพและข้อความ เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงใช้กลยุทธ์การฝึกอบรมสองแบบ

  1. การรวมถึงเทคนิคการแนะนำที่ไม่ต้องมีการจัดประเภทเพื่อเพิ่มประสิทธิภาพของตัวแทนภาพพิเศษในระหว่างการกระจายเสถียรภาพ
  2. กลยุทธ์ที่สองแบ่งออกเป็นสองขั้นตอน
    1. ขั้นตอนการฝึกอบรมเบื้องต้นซึ่งเน้นการปรับตำแหน่งคุณลักษณะที่หยาบ
    2. ขั้นตอนการฝึกอบรมที่สองซึ่งอำนวยความสะดวกในการเรียนรู้คุณลักษณะ

CFG หรือการแนะนำที่ไม่ต้องมีการจัดประเภท

แนวคิดในการใช้ CFG สำหรับการสร้างหลายรูปแบบมาจากความพยายามที่จะเพิ่มความสอดคล้องกันและตรรกะระหว่างภาพและข้อความที่สร้างขึ้น และ CFG ถูกนำมาใช้ในระหว่างการกระจายเสถียรภาพจากข้อความเป็นภาพ

กลยุทธ์การฝึกอบรมสองขั้นตอน

เนื่องจากการเปลี่ยนแปลงโดเมนที่สำคัญระหว่างการสร้างภาพและข้อความ MiniGPT-5 ใช้กลยุทธ์การฝึกอบรมสองขั้นตอน

  1. ขั้นตอนการฝึกอบรมแบบไม่มีการแทรกภาพหรือ UAS
  2. ขั้นตอนการเรียนรู้หลายรูปแบบหรือ MLS

ในขั้นตอนแรก โครงสร้างจะจัดตำแหน่งคุณลักษณะการสร้างภาพให้ตรงกับตัวแทนภาพพิเศษในชุดข้อมูลภาพและข้อความที่ไม่มีการแทรก และในขั้นตอนนี้ โครงสร้างจะทำให้ LLMs สามารถสร้างตัวแทนภาพพิเศษได้โดยใช้คำบรรยายภาพเป็นข้อมูลรับเข้า

หลังจากที่ UAS สำเร็จแล้ว โมเดลสามารถสร้างภาพสำหรับคำบรรยายภาพเดี่ยวได้ แต่จะพบปัญหาในการสร้างภาพและข้อความที่แทรกซ้อน รวมถึงการให้เหตุผลที่ซับซ้อนในการสร้างภาพและข้อความ เพื่อแก้ไขปัญหานี้ นักพัฒนาจึงได้ปรับโมเดล MiniGPT-5 โดยใช้ PEFT และชุดข้อมูลที่มีการแทรกภาพและข้อความ เช่น VIST ในระหว่างขั้นตอนนี้ โครงสร้างจะสร้างงานที่แตกต่างกันสามงานจากชุดข้อมูล

  1. การสร้างข้อความเท่านั้น : สร้างข้อความที่เกี่ยวข้องกับภาพถัดไป
  2. การสร้างภาพเท่านั้น : สร้างภาพที่เกี่ยวข้องกับข้อความถัดไป
  3. การสร้างหลายรูปแบบ : สร้างภาพและข้อความที่เกี่ยวข้องกันโดยใช้ข้อมูลรับเข้า

MiniGPT-5 : การทดสอบและการประเมิน

เพื่อประเมินประสิทธิภาพของ MiniGPT-5 ในการสร้างหลายรูปแบบอย่างครอบคลุม ทีมพัฒนาของ MiniGPT-5 ได้เปรียบเทียบประสิทธิภาพของโมเดลนี้กับโมเดลที่มีอยู่ เช่น Divter, GILL และโมเดลการสร้างภาพที่ไม่มีการแทรกที่ฝึกอบรมไว้ และการเปรียบเทียบนี้แสดงไว้ในตารางด้านล่าง

MiniGPT-5 ตระหนักว่าผลลัพธ์หลายรูปแบบอาจมีความหมายตามบริบท แต่อาจแตกต่างจากความเป็นจริง ซึ่งเป็นเหตุผลหลักที่ MiniGPT-5 รวมถึงการรับเข้าจากมนุษย์เพื่อประเมินและประเมินประสิทธิภาพของโมเดลโดยรวม ประสิทธิภาพของ MiniGPT-5 ในการสร้างหลายรูปแบบจะถูกวัดจากสามมุมมอง

  1. ความต่อเนื่องของภาษา : ประเมินว่าข้อความที่สร้างขึ้นเป็นไปตามบริบทที่ให้มาหรือไม่
  2. คุณภาพของภาพ : ประเมินความเกี่ยวข้องและความชัดเจนของภาพที่สร้างขึ้น
  3. ความสอดคล้องของหลายรูปแบบ : ประเมินว่าผลลัพธ์ภาพและข้อความที่สร้างขึ้นเป็นไปตามกันหรือไม่

การประเมินขั้นตอนสุดท้ายของ VIST

ในขั้นตอนแรกของการทดสอบ MiniGPT-5 มีเป้าหมายในการสร้างภาพที่เกี่ยวข้องกับข้อความ และตารางด้านล่างสรุปผลลัพธ์ที่ได้รับจากการตั้งค่านี้

ดังที่เห็น MiniGPT-5 สามารถทำได้ดีกว่าโมเดล SD2 ที่ฝึกอบรมไว้ในทั้งสามการตั้งค่า ซึ่งแสดงให้เห็นถึงประสิทธิภาพของ MiniGPT-5

รูปด้านบนเปรียบเทียบประสิทธิภาพของ MiniGPT-5 กับโมเดล MiniGPT-4 ที่ฝึกอบรมไว้บน S-BERT, Rouge-L และ Meteor ผลลัพธ์แสดงให้เห็นว่าการใช้ตัวแทนภาพพิเศษไม่ส่งผลเสียต่อประสิทธิภาพของโมเดลเมื่อทำการสร้างหลายรูปแบบ และ MiniGPT-5 สามารถใช้ข้อมูลรับเข้าหลายรูปแบบที่ยาวและกว้างเพื่อสร้างภาพที่มีคุณภาพและสอดคล้องกันโดยไม่สูญเสียความสามารถในการสร้างหลายรูปแบบ

ตารางด้านบนเปรียบเทียบประสิทธิภาพของสามโมเดลบน 5,000 ตัวอย่างสำหรับการสร้างหลายรูปแบบจากมุมมองของความสอดคล้องของหลายรูปแบบ คุณภาพของภาพ และความต่อเนื่องของภาษา ดังที่เห็น MiniGPT-5 สามารถทำได้ดีกว่าโมเดลอื่นๆ มากกว่า 70% ของกรณี และตารางด้านล่างแสดงถึงประสิทธิภาพของ MiniGPT-5 บนชุดข้อมูล CC3M สำหรับการสร้างภาพเดี่ยว

สรุป

ในบทความนี้ เราได้พูดถึง MiniGPT-5 ซึ่งเป็นเทคนิคการสร้างภาษาและภาพแบบแทรกซ้อนโดยใช้ “generative vokens” เพื่อใช้ความสามารถของ LLMs ในการสร้างข้อมูลหลายรูปแบบโดยการผสมผสาน LLMs ที่มีเทคนิคการสร้างภาพจากข้อความ และโมเดลภาษาขนาดใหญ่มัลติม็อดัลที่ฝึกอบรมไว้ เราได้พูดถึงส่วนประกอบที่สำคัญและโครงสร้างโดยรวมของ MiniGPT-5 พร้อมด้วยผลลัพธ์ที่แสดงถึงความก้าวหน้าที่สำคัญในด้านประสิทธิภาพและประสิทธิผลเมื่อเทียบกับโมเดลที่มีอยู่และโมเดลที่เป็นรากฐาน MiniGPT-5 มีเป้าหมายที่จะสร้างมาตรฐานใหม่ในด้านการสร้างเนื้อหาที่เป็นภาพและภาษา และมีเป้าหมายที่จะแก้ไขปัญหาที่เกิดขึ้นกับโมเดลก่อนหน้านี้ที่พยายามแก้ไขปัญหาเดียวกัน

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล