โมเดลและแพลตฟอร์ม AI

การแก้ไขภาพแบบมีคำแนะนำโดยใช้โมเดลภาษาขนาดใหญ่หลายรูปแบบ หรือ MGIE: การแนะนำ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เครื่องมือออกแบบภาพและโมเดลภาษาแบบมองเห็นมีการใช้งานอย่างกว้างขวางในอุตสาหกรรมมัลติมีเดีย แม้ว่าจะมีการพัฒนาอย่างมากในช่วงไม่กี่ปีที่ผ่านมา แต่ยังคงต้องการความเข้าใจที่ดีเกี่ยวกับเครื่องมือเหล่านี้เพื่อใช้งานได้ เพื่อเพิ่มความสามารถในการเข้าถึงและควบคุม อุตสาหกรรมมัลติมีเดียได้เริ่มใช้เทคนิคการแก้ไขภาพแบบมีคำแนะนำหรือการแก้ไขภาพตามคำสั่ง ซึ่งใช้คำสั่งภาษาธรรมชาติแทนการสร้างหน้ากากภูมิภาคหรือคำอธิบายที่ซับซ้อน ทำให้สามารถแก้ไขภาพได้มากขึ้นและควบคุมได้มากขึ้น อย่างไรก็ตาม วิธีการแก้ไขภาพตามคำแนะนำมักจะให้คำแนะนำที่สั้นและอาจทำให้โมเดลที่มีอยู่ยากที่จะเข้าใจและดำเนินการตามคำแนะนำได้อย่างเต็มที่ นอกจากนี้ โมเดลการกระจายยังเป็นที่ต้องการอย่างมากในภาคการแก้ไขภาพ เนื่องจากสามารถสร้างภาพที่สมจริงได้

นอกจากนี้ โมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLMs) ได้แสดงผลลัพธ์ที่น่าประทับใจในงานที่เกี่ยวข้องกับการสร้างคำตอบที่มองเห็นและความเข้าใจระหว่างรูปแบบต่างๆ MLLM Guided Image Editing (MGIE) เป็นการศึกษาที่ได้รับแรงบันดาลใจจาก MLLMs ซึ่งประเมินความสามารถและวิเคราะห์วิธีการที่ MLLMs สนับสนุนการแก้ไขภาพโดยใช้คำสั่งภาษาหรือคำแนะนำแบบมีคำแนะนำ การเข้าใกล้นี้เกี่ยวข้องกับการเรียนรู้เพื่อให้คำแนะนำที่ชัดเจนและได้รับคำแนะนำที่แสดงออกอย่างชัดเจน โมเดลการแก้ไขภาพของ MGIE เข้าใจข้อมูลภาพและดำเนินการแก้ไขโดยใช้การฝึกอบรมแบบต่อเนื่อง ในบทความนี้ เราจะสำรวจ MGIE อย่างลึกซึ้ง โดยประเมินผลกระทบต่อการปรับภาพระดับโลก การแก้ไขภาพแบบ Photoshop และการแก้ไขภาพท้องถิ่น เรายังจะพูดถึงความสำคัญของ MGIE ในงานแก้ไขภาพตามคำแนะนำที่อาศัยคำแนะนำที่แสดงออกอย่างชัดเจน มาเริ่มการสำรวจกัน

การแก้ไขภาพแบบมีคำแนะนำโดยใช้โมเดลภาษาขนาดใหญ่หลายรูปแบบ หรือ MGIE: การแนะนำ

โมเดลภาษาขนาดใหญ่หลายรูปแบบและโมเดลการกระจายเป็นสองเฟรมเวิร์ก AI และ ML ที่ใช้กันอย่างแพร่หลายในปัจจุบัน เนื่องจากความสามารถในการสร้างเนื้อหาที่น่าประทับใจ โมเดลการกระจายมีชื่อเสียงในเรื่องการสร้างภาพที่สมจริงและน่าดึงดูด ในขณะที่โมเดลภาษาขนาดใหญ่หลายรูปแบบมีชื่อเสียงในเรื่องการสร้างเนื้อหาที่หลากหลาย รวมถึงข้อความ ภาษา เสียง และภาพ/วิดีโอ

โมเดลการกระจายสามารถสลับแผนที่ระหว่างรูปแบบต่างๆ เพื่อแก้ไขภาพตามคำแนะนำ และสามารถใช้หน้ากากที่มีคำแนะนำเพื่อแก้ไขส่วนเฉพาะของภาพได้ แต่เหตุผลหลักที่โมเดลการกระจายถูกใช้กันอย่างแพร่หลายในแอปพลิเคชันมัลติมีเดียคือการแก้ไขภาพตามคำแนะนำที่ใช้คำสั่งภาษาหรือคำแนะนำแทนการอธิบายหรือหน้ากากภูมิภาคที่ซับซ้อน

MGIE: สถาปัตยกรรมและวิธีการ

โดยทั่วไป โมเดลภาษาขนาดใหญ่จะถูกใช้สำหรับงานประมวลผลภาษาแบบสร้างสรรค์ แต่หลังจากที่โมเดลภาษาขนาดใหญ่หลายรูปแบบกลายเป็นที่นิยม โมเดลภาษาขนาดใหญ่จะถูกเพิ่มความสามารถในการให้คำตอบที่มองเห็นได้โดยการรับภาพเข้ามาเป็นข้อมูลเข้า

คำแนะนำที่ชัดเจนและแสดงออกอย่างชัดเจน

โดยทั่วไป โมเดลภาษาขนาดใหญ่หลายรูปแบบสามารถให้คำตอบที่เกี่ยวข้องกับภาพได้โดยใช้การรับรู้ระหว่างรูปแบบต่างๆ และการปรับให้เหมาะสมของคำแนะนำ เพื่อแก้ไขภาพ โมเดล MGIE ใช้คำสั่งภาษาเป็นข้อมูลเข้าหลักพร้อมกับภาพ และสร้างคำอธิบายที่ชัดเจนสำหรับคำสั่งแก้ไข อย่างไรก็ตาม คำอธิบายเหล่านี้อาจยาวเกินไปหรือมีการอธิบายซ้ำกัน ทำให้โมเดล MGIE ต้องใช้เครื่องมือสรุปข้อมูลที่ฝึกไว้ล่วงหน้าเพื่อให้ได้คำอธิบายที่สั้นและชัดเจน

การแก้ไขภาพด้วยจินตนาการที่ซ่อนอยู่

ในขั้นตอนต่อไป โมเดล MGIE ใช้หัวแก้ไขเพื่อแปลงคำสั่งภาพเป็นคำแนะนำที่มองเห็นได้ หัวแก้ไขเป็นโมเดลแบบลำดับถึงลำดับที่ช่วยในการแมปกับโทเค็นภาพจากโมเดล MLLM ไปยังคำแนะนำที่มีความหมายซึ่งเป็นคำแนะนำแก้ไข

การเรียนรู้ของ MGIE

โมเดล MLLM เรียนรู้เพื่อสร้างคำแนะนำที่ชัดเจนและแสดงออกอย่างชัดเจนโดยใช้การสูญเสียคำแนะนำ โดยใช้จินตนาการที่ซ่อนอยู่จากคำสั่งภาพ โมเดล MGIE แปลงรูปแบบของหัวแก้ไขและชี้นำโมเดลการกระจายที่ซ่อนอยู่เพื่อสร้างภาพผลลัพธ์ และใช้การสูญเสียแก้ไขสำหรับการฝึกอบรมการกระจาย

MGIE: ผลลัพธ์และการประเมิน

โมเดล MGIE ใช้เซตข้อมูล IPr2Pr เป็นข้อมูลฝึกอบรมหลัก ซึ่งมีข้อมูลมากกว่า 1 ล้านรายการพร้อมคำแนะนำที่ถูกกรองโดยโมเดล CLIP และโมเดล Prompt-to-Prompt เพื่อสร้างภาพ

การวิเคราะห์เชิงปริมาณ

ผลลัพธ์ของการแก้ไขภาพในเซตข้อมูล GIER และ EVR โดยใช้โมเดล MGIE และโมเดลอื่นๆ แสดงให้เห็นว่าโมเดล MGIE สามารถให้ผลลัพธ์ที่ดีกว่าโดยใช้คำแนะนำที่ชัดเจนและแสดงออกอย่างชัดเจน

ผลลัพธ์คุณภาพ

ผลลัพธ์ของการแก้ไขภาพโดยใช้โมเดล MGIE และโมเดลอื่นๆ แสดงให้เห็นว่าโมเดล MGIE สามารถให้ผลลัพธ์ที่ดีกว่าโดยใช้คำแนะนำที่ชัดเจนและแสดงออกอย่างชัดเจน

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง MGIE หรือการแก้ไขภาพแบบมีคำแนะนำโดยใช้โมเดลภาษาขนาดใหญ่หลายรูปแบบ ซึ่งเป็นการศึกษาที่ได้รับแรงบันดาลใจจาก MLLMs เพื่อประเมินความสามารถและวิเคราะห์วิธีการที่ MLLMs สนับสนุนการแก้ไขภาพโดยใช้คำสั่งภาษาหรือคำแนะนำแบบมีคำแนะนำ โมเดลการแก้ไขภาพของ MGIE เข้าใจข้อมูลภาพและดำเนินการแก้ไขโดยใช้การฝึกอบรมแบบต่อเนื่อง แทนที่จะใช้คำแนะนำที่ไม่ชัดเจนและสั้น โมเดล MGIE สร้างคำแนะนำที่มองเห็นได้ซึ่งนำไปสู่การแก้ไขภาพที่สมเหตุสมผล

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล