โมเดลและแพลตฟอร์ม AI

การแก้ไขภาพเซมานติกความแม่นยำสูงด้วย EditGAN

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เครือข่าย Generative Adversarial หรือ GANs ได้รับการประยุกต์ใช้ใหม่ๆ ในอุตสาหกรรมแก้ไขภาพ สำหรับหลายเดือนที่ผ่านมา EditGAN ได้รับความนิยมในอุตสาหกรรม AI/ML เนื่องจากเป็นวิธีการแก้ไขภาพเซมานติกความแม่นยำสูงและคุณภาพสูง

เราจะพูดถึงโมเดล EditGAN ในรายละเอียด และบอกว่าทำไมมันอาจเป็น 里程碑 ในอุตสาหกรรมแก้ไขภาพเซมานติก

ดังนั้น มาเริ่กัน แต่ก่อนที่เราจะรู้ว่า EditGAN คืออะไร มันสำคัญที่เราจะต้องเข้าใจถึงความสำคัญของ EditGAN และทำไมมันจึงเป็นขั้นตอนสำคัญ

ทำไม EditGAN?

แม้ว่าโครงสร้าง GAN แบบดั้งเดิมจะช่วยให้อุตสาหกรรมแก้ไขภาพ AI ขั้นสูง แต่ก็มีบางความท้าทายในการสร้างโครงสร้าง GAN จากศูนย์

  1. ในระหว่างขั้นตอนการฝึกอบรม โครงสร้าง GAN ต้องการข้อมูลที่มีฉลากจำนวนมากพร้อมกับคำอธิบายเซมานติก
  2. มันสามารถให้การควบคุมระดับสูงได้เท่านั้น
  3. และบ่อยครั้ง มันเพียงแค่แทรกและกลับไปมาระหว่างภาพ

สามารถสังเกตได้ว่าแม้ว่าโครงสร้าง GAN แบบดั้งเดิมจะทำงานได้ แต่มันไม่มีประสิทธิภาพสำหรับการใช้งานในวงกว้าง ความไม่ดีของโครงสร้าง GAN แบบดั้งเดิมคือเหตุผลที่ EditGAN ถูกนำเสนอโดย NVIDIA (NVDA ) ในปี 2022

EditGAN ถูกเสนอให้เป็นวิธีการแก้ไขภาพเซมานติกความแม่นยำสูงและคุณภาพสูง โดยมีความสามารถในการแก้ไขภาพโดยการเปลี่ยนแปลงหน้ากากการแบ่งส่วนของภาพที่มีรายละเอียดสูง

โมเดล EditGAN ถูกสร้างขึ้นบนโครงสร้าง GAN ที่สร้างแบบจำลองภาพและเซมานติกการแบ่งส่วนร่วมกัน และต้องการเฉพาะข้อมูลการฝึกอบรมที่มีฉลากหรือคำอธิบายเพียงเล็กน้อย

นักพัฒนาของ EditGAN ได้พยายามฝังภาพลงในพื้นที่ 潛伏 ของ GAN เพื่อแก้ไขภาพโดยการทำการปรับให้เหมาะสมของรหัส 潛伏 ตามคำอธิบายการแก้ไข

เพื่อสรุปว่าทำไมเราต้องการ EditGAN มันเป็นเฟรมเวิร์กแก้ไขภาพ GAN แรกที่ให้

  1. การแก้ไขความแม่นยำสูง
  2. สามารถทำงานกับข้อมูลที่มีฉลากเพียงเล็กน้อย
  3. สามารถใช้งานได้จริงในสถานการณ์จริง
  4. ช่วยให้สามารถแก้ไขได้หลายครั้งพร้อมกัน
  5. สามารถทำงานกับภาพที่สร้างโดย GAN ที่ฝังไว้จริง และแม้กระทั่งภาพที่ไม่อยู่ในโดเมน

การแก้ไขภาพเซมานติกความแม่นยำสูงด้วย EditGAN

StyleGAN2 ซึ่งเป็นเฟรมเวิร์ก GAN รุ่นล่าสุดสำหรับการสังเคราะห์ภาพ เป็นส่วนประกอบหลักของ EditGAN

StyleGAN2 เป็นโมเดลสร้างแบบจำลองที่ลึกซึ้งซึ่งได้รับการฝึกอบรมมาเพื่อสังเคราะห์ภาพที่มีคุณภาพสูงสุดเท่าที่จะเป็นไปได้พร้อมกับการทำความเข้าใจเซมานติกของภาพที่ถูกสร้างขึ้น

การฝึกอบรมและการอนุมานการแบ่งส่วน

โมเดล EditGAN ฝังภาพลงในพื้นที่ 潛伏 ของ GAN โดยใช้การปรับให้เหมาะสมและตัวเข้ารหัสเพื่อทำการแบ่งส่วนบนภาพใหม่ และการฝึกอบรมสาขาการแบ่งส่วน

ผลลัพธ์ที่ได้คือโมเดลฝังภาพที่มีคำอธิบายการแบ่งส่วนจากชุดข้อมูลลงในพื้นที่ 潛伏 และใช้ขาดทุนการข้ามเอนโทรปีเพื่อฝึกอบรมสาขาการแบ่งส่วนของตัวสร้าง

การใช้การแก้ไขการแบ่งส่วนในการค้นหาเซมานติกในพื้นที่ 潛伏

วัตถุประสงค์หลักของ EditGAN คือการใช้การกระจายร่วมของการแบ่งส่วนเซมานติกและภาพสำหรับการแก้ไขภาพเซมานติกความแม่นยำสูง

ลองพิจารณาว่าเรามีภาพ x ที่ต้องการแก้ไข ดังนั้นโมเดลจึงฝังภาพลงในพื้นที่ 潛伏 ของ EditGAN หรือใช้ภาพตัวอย่างจากโมเดลเอง

สาขาการแบ่งส่วนสร้าง y หรือการแบ่งส่วนเซมานติกที่เกี่ยวข้องเป็นหลัก เนื่องจากทั้งภาพ RGB และการแบ่งส่วนแชร์รหัส 潛伏 w นักพัฒนาสามารถใช้เครื่องมือการระบุหรือการวาดภาพดิจิทัลเพื่อแก้ไขการแบ่งส่วนและแก้ไขตามความต้องการด้วยตนเอง

วิธีการแก้ไขที่แตกต่างกันระหว่างการอนุมาน

เวกเตอร์การแก้ไขในพื้นที่ 潛伏 ที่ได้รับจากการปรับให้เหมาะสมสามารถอธิบายได้ว่าเป็นเซมานติกที่มีความหมายและบ่อยครั้งแยกออกจากคุณลักษณะที่แตกต่างกัน

ดังนั้น เพื่อแก้ไขภาพใหม่ โมเดลสามารถฝังภาพลงในพื้นที่ 潛伏 ได้โดยตรงและทำการแก้ไขแบบเดียวกับที่โมเดลเรียนรู้มาก่อน โดยไม่ต้องทำการปรับให้เหมาะสมทั้งหมดจากศูนย์

การนำไปใช้

เฟรมเวิร์ก EditGAN ถูกประเมินบนภาพที่กระจายอยู่ในหมวดหมู่ที่แตกต่างกัน 4 ประเภท ได้แก่ รถยนต์ นก แมว และใบหน้า

ผลลัพธ์

ผลลัพธ์คุณภาพ

ผลลัพธ์ในโดเมน

ภาพด้านบนแสดงถึงประสิทธิภาพของเฟรมเวิร์ก EditGAN เมื่อมันใช้เวกเตอร์การแก้ไขที่เรียนรู้มาก่อนบนภาพใหม่และปรับให้เหมาะสมภาพโดยใช้ขั้นตอนการปรับให้เหมาะสม 30 ขั้นตอน

ผลลัพธ์เชิงปริมาณ

เพื่อวัดความสามารถในการแก้ไขภาพของ EditGAN โมเดลใช้การแก้ไขยิ้มเป็นมาตรฐาน

ข้อจำกัด

เนื่องจาก EditGAN มีพื้นฐานมาจากโครงสร้าง GAN จึงมีข้อจำกัดเดียวกันกับโมเดล GAN อื่นๆ คือ สามารถทำงานกับภาพที่สามารถสร้างแบบจำลองโดย GAN ได้เท่านั้น

สรุป

หนึ่งในเหตุผลหลักที่ GAN ไม่ใช่มาตรฐานอุตสาหกรรมในด้านแก้ไขภาพคือความไม่สมจริงของมัน

EditGAN มุ่งหวังที่จะแก้ไขปัญหาที่นำเสนอโดยโครงสร้าง GAN แบบดั้งเดิม และพยายามที่จะเป็นวิธีการแก้ไขภาพเซมานติกที่มีคุณภาพสูงและความแม่นยำสูง

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล