โมเดลและแพลตฟอร์ม AI
HD-Painter: การทำภาพสีระดับสูงแบบชี้นำด้วยข้อความ โดยใช้โมเดลการกระจาย
โมเดลการกระจาย ได้ปฏิวัติวงการ AI และ ML อย่างไม่มีข้อกังขา โดยมีการใช้งานในเวลาจริงที่กลายเป็นส่วนหนึ่งของชีวิตประจำวันของเรา หลังจากที่โมเดลการสร้างภาพจากข้อความแสดงความสามารถที่น่าประทับใจ เทคนิคการปรับเปลี่ยนภาพโดยใช้การกระจาย เช่น การสร้างภาพที่ควบคุมได้ การสังเคราะห์ภาพที่มีลักษณะเฉพาะและเป็นส่วนตัว การแก้ไขภาพระดับวัตถุ การสร้างภาพที่มีเงื่อนไขจากข้อความ และการแก้ไขภาพ ได้กลายเป็นหัวข้อการวิจัยที่น่าสนใจเนื่องจากมีการใช้งานในอุตสาหกรรมการมองเห็นของคอมพิวเตอร์
อย่างไรก็ตาม แม้จะมีความสามารถที่น่าประทับใจและผลลัพธ์ที่ยอดเยี่ยม แต่โครงสร้างการสร้างภาพจากข้อความ โดยเฉพาะโครงสร้างการสร้างภาพจากข้อความที่มีการเติมสี ยังคงมีศักยภาพในการพัฒนาอีกมาก รวมถึงความสามารถในการเข้าใจฉากทั่วไป โดยเฉพาะอย่างยิ่งเมื่อทำการลดเสียงรบกวนในภาพที่มีการกระจายสูง เพื่อแก้ไขปัญหานี้ นักวิจัยได้แนะนำ HD-Painter ซึ่งเป็นโครงสร้างที่ไม่ต้องฝึกอบรมที่สามารถปฏิบัติตามคำแนะนำจากข้อความได้อย่างแม่นยำ และสามารถขยายไปสู่การเติมสีภาพที่มีความละเอียดสูงได้อย่างสอดคล้อง โครงสร้าง HD-Painter ใช้เลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อเพิ่มคะแนนการให้ความสนใจตนเอง ซึ่งนำไปสู่การสร้างภาพที่สอดคล้องกับข้อความได้ดีขึ้น
เพื่อปรับปรุงความสอดคล้องของข้อความให้ดีขึ้น โมเดล HD-Painter นำเสนอวิธีการ Reweighting Attention Score Guidance (RASG) วิธีการนี้รวมกลยุทธ์การตัวอย่างหลังการให้คำแนะนำเข้ากับแบบฟอร์มทั่วไปของส่วนประกอบ DDIM อย่างราบรื่น เพื่อป้องกันการเปลี่ยนแปลงของความแปรปรวนในระดับ 潛伏 นอกจากนี้ โครงสร้าง HD-Painter ยังมีเทคนิคการแก้ไขภาพที่มีการปรับขนาดสูงซึ่งถูกปรับให้เหมาะสมสำหรับการเติมสีภาพ ทำให้สามารถขยายไปสู่ขนาดที่ใหญ่ขึ้น และสามารถเติมสีภาพที่มีความละเอียดสูงได้ถึง 2K
HD-Painter: การเติมสีภาพที่มีการชี้นำด้วยข้อความ
โมเดลการสร้างภาพจากข้อความที่มีการกระจายได้กลายเป็นหัวข้อที่สำคัญในวงการ AI และ ML ในช่วงไม่กี่เดือนที่ผ่านมา โดยมีการแสดงความสามารถที่น่าประทับใจในหลาย ๆ การใช้งานที่เป็นไปได้ โมเดลการสร้างภาพจากข้อความที่มีการฝึกอบรมล่วงหน้า เช่น DALL-E, Imagen และ Stable Diffusion ได้แสดงให้เห็นถึงความเหมาะสมในการเติมสีภาพโดยการรวมภูมิภาคที่ไม่ทราบกับภูมิภาคที่ทราบระหว่างกระบวนการกระจายย้อนกลับ
นอกจากนี้ ในโมเดลการกระจาย การเติมสีภาพที่มีการชี้นำด้วยข้อความและการเติมสีภาพที่มีการชี้นำด้วยข้อความเป็นหัวข้อที่น่าสนใจสำหรับนักวิจัย เนื่องจากโมเดลการเติมสีภาพที่มีการชี้นำด้วยข้อความสามารถสร้างเนื้อหาที่เฉพาะเจาะจงภายในภูมิภาคของภาพเข้าโดยอาศัยข้อความที่ให้มา ซึ่งนำไปสู่การประยุกต์ใช้ เช่น การแก้ไขภาพที่เฉพาะเจาะจง การเปลี่ยนแปลงคุณลักษณะของวัตถุ เช่น สีหรือเสื้อผ้า และการเพิ่มหรือแทนที่วัตถุ
โดยสรุป โมเดลการสร้างภาพจากข้อความที่มีการกระจายได้ประสบความสำเร็จอย่างไม่เคยปรากฏมาก่อนในช่วงไม่กี่ปีที่ผ่านมา เนื่องจากความสามารถในการสร้างภาพที่มีความสมจริงและน่าดึงดูด

อย่างไรก็ตาม โครงสร้างที่มีอยู่ส่วนใหญ่แสดงให้เห็นถึงการละเลยข้อความในสองสถานการณ์ สถานการณ์แรกคือ การครอบงำของพื้นหลัง เมื่อโมเดลเติมสีภูมิภาคที่ไม่ทราบโดยการละเลยข้อความในพื้นหลัง ในขณะที่สถานการณ์ที่สองคือ การครอบงำของวัตถุใกล้เคียง เมื่อโมเดลขยายวัตถุในภูมิภาคที่ทราบไปยังภูมิภาคที่ไม่ทราบโดยใช้ความน่าจะเป็นของบริบททางภาพมากกว่าข้อความที่ให้มา
เพื่อแก้ไขปัญหานี้ โครงสร้าง HD-Painter นำเสนอตัวเลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อเพิ่มคะแนนการให้ความสนใจตนเอง ซึ่งนำไปสู่การสร้างภาพที่สอดคล้องกับข้อความได้ดีขึ้น PAIntA ใช้ข้อความที่ให้มาเพื่อปรับปรุงคะแนนการให้ความสนใจตนเอง โดยมีเป้าหมายเพื่อลดผลกระทบของข้อมูลที่ไม่เกี่ยวข้องกับข้อความจากภูมิภาคของภาพ และเพิ่มการมีส่วนร่วมของพิกเซลที่ทราบที่สอดคล้องกับข้อความ
HD-Painter: วิธีการและโครงสร้าง
ก่อนที่เราจะมาดูโครงสร้างของ HD-Painter ก่อน เราต้องเข้าใจสามแนวคิดพื้นฐานที่เป็นรากฐานของโครงสร้าง HD-Painter: การเติมสีภาพ โพสต์-ฮ็อกการชี้นำในโครงสร้างการกระจาย และบล็อกโครงสร้างที่เฉพาะเจาะจงสำหรับการเติมสีภาพ
การเติมสีภาพเป็นวิธีการที่มีเป้าหมายในการเติมสีภูมิภาคที่ไม่ทราบในภาพโดยการรักษาความน่าดึงดูดของภาพที่สร้างขึ้น โครงสร้างการเรียนรู้ลึกแบบดั้งเดิมได้ใช้วิธีการที่ใช้ภูมิภาคที่ทราบเพื่อขยายคุณลักษณะลึก แต่การแนะนำของโมเดลการกระจายได้ทำให้เกิดการเปลี่ยนแปลงของโมเดลการเติมสีภาพ โดยเฉพาะโมเดลการเติมสีภาพที่มีการชี้นำด้วยข้อความ
การกระจายที่เสถียรและการเติมสีภาพที่เสถียร
การกระจายที่เสถียรเป็นโมเดลการกระจายที่ทำงานในพื้นที่ 潛伏 ของอัตลักษณ์ สำหรับการสังเคราะห์ภาพจากข้อความ โครงสร้างการกระจายที่เสถียรมีการใช้ข้อความที่ให้มาเพื่อชี้นำกระบวนการ
Prompt Aware Introverted Attention หรือ PAIntA
โมเดลการเติมสีภาพที่มีอยู่ เช่น การเติมสีภาพที่เสถียร มักจะพึ่งพาความน่าจะเป็นของบริบททางภาพมากกว่าข้อความที่ให้มา ซึ่งอาจทำให้เกิดปัญหาของการครอบงำของพื้นหลังและวัตถุใกล้เคียง เพื่อแก้ไขปัญหานี้ โครงสร้าง HD-Painter นำเสนอตัวเลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อปรับปรุงคะแนนการให้ความสนใจตนเอง
Reweighting Attention Score Guidance หรือ RASG
โครงสร้าง HD-Painter ใช้วิธีการชี้นำการสร้างภาพโดยใช้ข้อความเพื่อปรับปรุงการสร้างภาพให้สอดคล้องกับข้อความที่ให้มา
HD-Painter: การทดลองและผลลัพธ์
เพื่อวิเคราะห์ผลการทำงานของ HD-Painter โครงสร้างนี้ได้ถูกเปรียบเทียบกับโมเดลที่มีอยู่ รวมถึง Stable Inpainting, GLIDE และ BLD หรือ Blended Latent Diffusion
ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึง HD-Painter ซึ่งเป็นโครงสร้างที่ไม่ต้องฝึกอบรมสำหรับการเติมสีภาพที่มีการชี้นำด้วยข้อความ โดยมีเป้าหมายในการแก้ไขปัญหาของการครอบงำของพื้นหลังและวัตถุใกล้เคียง












