โมเดลและแพลตฟอร์ม AI

HD-Painter: การทำภาพสีระดับสูงแบบชี้นำด้วยข้อความ โดยใช้โมเดลการกระจาย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดลการกระจาย ได้ปฏิวัติวงการ AI และ ML อย่างไม่มีข้อกังขา โดยมีการใช้งานในเวลาจริงที่กลายเป็นส่วนหนึ่งของชีวิตประจำวันของเรา หลังจากที่โมเดลการสร้างภาพจากข้อความแสดงความสามารถที่น่าประทับใจ เทคนิคการปรับเปลี่ยนภาพโดยใช้การกระจาย เช่น การสร้างภาพที่ควบคุมได้ การสังเคราะห์ภาพที่มีลักษณะเฉพาะและเป็นส่วนตัว การแก้ไขภาพระดับวัตถุ การสร้างภาพที่มีเงื่อนไขจากข้อความ และการแก้ไขภาพ ได้กลายเป็นหัวข้อการวิจัยที่น่าสนใจเนื่องจากมีการใช้งานในอุตสาหกรรมการมองเห็นของคอมพิวเตอร์

อย่างไรก็ตาม แม้จะมีความสามารถที่น่าประทับใจและผลลัพธ์ที่ยอดเยี่ยม แต่โครงสร้างการสร้างภาพจากข้อความ โดยเฉพาะโครงสร้างการสร้างภาพจากข้อความที่มีการเติมสี ยังคงมีศักยภาพในการพัฒนาอีกมาก รวมถึงความสามารถในการเข้าใจฉากทั่วไป โดยเฉพาะอย่างยิ่งเมื่อทำการลดเสียงรบกวนในภาพที่มีการกระจายสูง เพื่อแก้ไขปัญหานี้ นักวิจัยได้แนะนำ HD-Painter ซึ่งเป็นโครงสร้างที่ไม่ต้องฝึกอบรมที่สามารถปฏิบัติตามคำแนะนำจากข้อความได้อย่างแม่นยำ และสามารถขยายไปสู่การเติมสีภาพที่มีความละเอียดสูงได้อย่างสอดคล้อง โครงสร้าง HD-Painter ใช้เลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อเพิ่มคะแนนการให้ความสนใจตนเอง ซึ่งนำไปสู่การสร้างภาพที่สอดคล้องกับข้อความได้ดีขึ้น

เพื่อปรับปรุงความสอดคล้องของข้อความให้ดีขึ้น โมเดล HD-Painter นำเสนอวิธีการ Reweighting Attention Score Guidance (RASG) วิธีการนี้รวมกลยุทธ์การตัวอย่างหลังการให้คำแนะนำเข้ากับแบบฟอร์มทั่วไปของส่วนประกอบ DDIM อย่างราบรื่น เพื่อป้องกันการเปลี่ยนแปลงของความแปรปรวนในระดับ 潛伏 นอกจากนี้ โครงสร้าง HD-Painter ยังมีเทคนิคการแก้ไขภาพที่มีการปรับขนาดสูงซึ่งถูกปรับให้เหมาะสมสำหรับการเติมสีภาพ ทำให้สามารถขยายไปสู่ขนาดที่ใหญ่ขึ้น และสามารถเติมสีภาพที่มีความละเอียดสูงได้ถึง 2K

HD-Painter: การเติมสีภาพที่มีการชี้นำด้วยข้อความ

โมเดลการสร้างภาพจากข้อความที่มีการกระจายได้กลายเป็นหัวข้อที่สำคัญในวงการ AI และ ML ในช่วงไม่กี่เดือนที่ผ่านมา โดยมีการแสดงความสามารถที่น่าประทับใจในหลาย ๆ การใช้งานที่เป็นไปได้ โมเดลการสร้างภาพจากข้อความที่มีการฝึกอบรมล่วงหน้า เช่น DALL-E, Imagen และ Stable Diffusion ได้แสดงให้เห็นถึงความเหมาะสมในการเติมสีภาพโดยการรวมภูมิภาคที่ไม่ทราบกับภูมิภาคที่ทราบระหว่างกระบวนการกระจายย้อนกลับ

นอกจากนี้ ในโมเดลการกระจาย การเติมสีภาพที่มีการชี้นำด้วยข้อความและการเติมสีภาพที่มีการชี้นำด้วยข้อความเป็นหัวข้อที่น่าสนใจสำหรับนักวิจัย เนื่องจากโมเดลการเติมสีภาพที่มีการชี้นำด้วยข้อความสามารถสร้างเนื้อหาที่เฉพาะเจาะจงภายในภูมิภาคของภาพเข้าโดยอาศัยข้อความที่ให้มา ซึ่งนำไปสู่การประยุกต์ใช้ เช่น การแก้ไขภาพที่เฉพาะเจาะจง การเปลี่ยนแปลงคุณลักษณะของวัตถุ เช่น สีหรือเสื้อผ้า และการเพิ่มหรือแทนที่วัตถุ

โดยสรุป โมเดลการสร้างภาพจากข้อความที่มีการกระจายได้ประสบความสำเร็จอย่างไม่เคยปรากฏมาก่อนในช่วงไม่กี่ปีที่ผ่านมา เนื่องจากความสามารถในการสร้างภาพที่มีความสมจริงและน่าดึงดูด

อย่างไรก็ตาม โครงสร้างที่มีอยู่ส่วนใหญ่แสดงให้เห็นถึงการละเลยข้อความในสองสถานการณ์ สถานการณ์แรกคือ การครอบงำของพื้นหลัง เมื่อโมเดลเติมสีภูมิภาคที่ไม่ทราบโดยการละเลยข้อความในพื้นหลัง ในขณะที่สถานการณ์ที่สองคือ การครอบงำของวัตถุใกล้เคียง เมื่อโมเดลขยายวัตถุในภูมิภาคที่ทราบไปยังภูมิภาคที่ไม่ทราบโดยใช้ความน่าจะเป็นของบริบททางภาพมากกว่าข้อความที่ให้มา

เพื่อแก้ไขปัญหานี้ โครงสร้าง HD-Painter นำเสนอตัวเลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อเพิ่มคะแนนการให้ความสนใจตนเอง ซึ่งนำไปสู่การสร้างภาพที่สอดคล้องกับข้อความได้ดีขึ้น PAIntA ใช้ข้อความที่ให้มาเพื่อปรับปรุงคะแนนการให้ความสนใจตนเอง โดยมีเป้าหมายเพื่อลดผลกระทบของข้อมูลที่ไม่เกี่ยวข้องกับข้อความจากภูมิภาคของภาพ และเพิ่มการมีส่วนร่วมของพิกเซลที่ทราบที่สอดคล้องกับข้อความ

HD-Painter: วิธีการและโครงสร้าง

ก่อนที่เราจะมาดูโครงสร้างของ HD-Painter ก่อน เราต้องเข้าใจสามแนวคิดพื้นฐานที่เป็นรากฐานของโครงสร้าง HD-Painter: การเติมสีภาพ โพสต์-ฮ็อกการชี้นำในโครงสร้างการกระจาย และบล็อกโครงสร้างที่เฉพาะเจาะจงสำหรับการเติมสีภาพ

การเติมสีภาพเป็นวิธีการที่มีเป้าหมายในการเติมสีภูมิภาคที่ไม่ทราบในภาพโดยการรักษาความน่าดึงดูดของภาพที่สร้างขึ้น โครงสร้างการเรียนรู้ลึกแบบดั้งเดิมได้ใช้วิธีการที่ใช้ภูมิภาคที่ทราบเพื่อขยายคุณลักษณะลึก แต่การแนะนำของโมเดลการกระจายได้ทำให้เกิดการเปลี่ยนแปลงของโมเดลการเติมสีภาพ โดยเฉพาะโมเดลการเติมสีภาพที่มีการชี้นำด้วยข้อความ

การกระจายที่เสถียรและการเติมสีภาพที่เสถียร

การกระจายที่เสถียรเป็นโมเดลการกระจายที่ทำงานในพื้นที่ 潛伏 ของอัตลักษณ์ สำหรับการสังเคราะห์ภาพจากข้อความ โครงสร้างการกระจายที่เสถียรมีการใช้ข้อความที่ให้มาเพื่อชี้นำกระบวนการ

Prompt Aware Introverted Attention หรือ PAIntA

โมเดลการเติมสีภาพที่มีอยู่ เช่น การเติมสีภาพที่เสถียร มักจะพึ่งพาความน่าจะเป็นของบริบททางภาพมากกว่าข้อความที่ให้มา ซึ่งอาจทำให้เกิดปัญหาของการครอบงำของพื้นหลังและวัตถุใกล้เคียง เพื่อแก้ไขปัญหานี้ โครงสร้าง HD-Painter นำเสนอตัวเลเยอร์ Prompt Aware Introverted Attention (PAIntA) ซึ่งใช้ข้อมูลจากข้อความเพื่อปรับปรุงคะแนนการให้ความสนใจตนเอง

Reweighting Attention Score Guidance หรือ RASG

โครงสร้าง HD-Painter ใช้วิธีการชี้นำการสร้างภาพโดยใช้ข้อความเพื่อปรับปรุงการสร้างภาพให้สอดคล้องกับข้อความที่ให้มา

HD-Painter: การทดลองและผลลัพธ์

เพื่อวิเคราะห์ผลการทำงานของ HD-Painter โครงสร้างนี้ได้ถูกเปรียบเทียบกับโมเดลที่มีอยู่ รวมถึง Stable Inpainting, GLIDE และ BLD หรือ Blended Latent Diffusion

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง HD-Painter ซึ่งเป็นโครงสร้างที่ไม่ต้องฝึกอบรมสำหรับการเติมสีภาพที่มีการชี้นำด้วยข้อความ โดยมีเป้าหมายในการแก้ไขปัญหาของการครอบงำของพื้นหลังและวัตถุใกล้เคียง

Kunal Kejriwal เป็นวิศวกรแบ็กเอนด์ที่เชี่ยวชาญด้าน Python, PostgreSQL, Redis และโครงสร้างพื้นฐานคลาวด์บน GCP และ AWS. ด้วยประสบการณ์สามปีในการสร้างและขยายระบบการผลิต เขาเขียนเกี่ยวกับโครงสร้างพื้นฐาน AI, ระบบกระจาย, และสถาปัตยกรรมที่อยู่เบื้องหลังการปรับใช้งานแมชชีนเลิร์นนิง