โมเดลและแพลตฟอร์ม AI
การแก้ไขภาพเซมานติกความแม่นยำสูงด้วย EditGAN
เครือข่าย Generative Adversarial หรือ GANs ได้รับการประยุกต์ใช้ใหม่ๆ ในอุตสาหกรรมแก้ไขภาพ สำหรับหลายเดือนที่ผ่านมา EditGAN ได้รับความนิยมในอุตสาหกรรม AI/ML เนื่องจากเป็นวิธีการแก้ไขภาพเซมานติกความแม่นยำสูงและคุณภาพสูง
เราจะพูดถึงโมเดล EditGAN ในรายละเอียด และบอกว่าทำไมมันอาจเป็น 里程碑 ในอุตสาหกรรมแก้ไขภาพเซมานติก
ดังนั้น มาเริ่กัน แต่ก่อนที่เราจะรู้ว่า EditGAN คืออะไร มันสำคัญที่เราจะต้องเข้าใจถึงความสำคัญของ EditGAN และทำไมมันจึงเป็นขั้นตอนสำคัญ
ทำไม EditGAN?
แม้ว่าโครงสร้าง GAN แบบดั้งเดิมจะช่วยให้อุตสาหกรรมแก้ไขภาพ AI ขั้นสูง แต่ก็มีบางความท้าทายในการสร้างโครงสร้าง GAN จากศูนย์
- ในระหว่างขั้นตอนการฝึกอบรม โครงสร้าง GAN ต้องการข้อมูลที่มีฉลากจำนวนมากพร้อมกับคำอธิบายเซมานติก
- มันสามารถให้การควบคุมระดับสูงได้เท่านั้น
- และบ่อยครั้ง มันเพียงแค่แทรกและกลับไปมาระหว่างภาพ
สามารถสังเกตได้ว่าแม้ว่าโครงสร้าง GAN แบบดั้งเดิมจะทำงานได้ แต่มันไม่มีประสิทธิภาพสำหรับการใช้งานในวงกว้าง ความไม่ดีของโครงสร้าง GAN แบบดั้งเดิมคือเหตุผลที่ EditGAN ถูกนำเสนอโดย NVIDIA (NVDA ) ในปี 2022
EditGAN ถูกเสนอให้เป็นวิธีการแก้ไขภาพเซมานติกความแม่นยำสูงและคุณภาพสูง โดยมีความสามารถในการแก้ไขภาพโดยการเปลี่ยนแปลงหน้ากากการแบ่งส่วนของภาพที่มีรายละเอียดสูง
โมเดล EditGAN ถูกสร้างขึ้นบนโครงสร้าง GAN ที่สร้างแบบจำลองภาพและเซมานติกการแบ่งส่วนร่วมกัน และต้องการเฉพาะข้อมูลการฝึกอบรมที่มีฉลากหรือคำอธิบายเพียงเล็กน้อย
นักพัฒนาของ EditGAN ได้พยายามฝังภาพลงในพื้นที่ 潛伏 ของ GAN เพื่อแก้ไขภาพโดยการทำการปรับให้เหมาะสมของรหัส 潛伏 ตามคำอธิบายการแก้ไข
เพื่อสรุปว่าทำไมเราต้องการ EditGAN มันเป็นเฟรมเวิร์กแก้ไขภาพ GAN แรกที่ให้
- การแก้ไขความแม่นยำสูง
- สามารถทำงานกับข้อมูลที่มีฉลากเพียงเล็กน้อย
- สามารถใช้งานได้จริงในสถานการณ์จริง
- ช่วยให้สามารถแก้ไขได้หลายครั้งพร้อมกัน
- สามารถทำงานกับภาพที่สร้างโดย GAN ที่ฝังไว้จริง และแม้กระทั่งภาพที่ไม่อยู่ในโดเมน
การแก้ไขภาพเซมานติกความแม่นยำสูงด้วย EditGAN
StyleGAN2 ซึ่งเป็นเฟรมเวิร์ก GAN รุ่นล่าสุดสำหรับการสังเคราะห์ภาพ เป็นส่วนประกอบหลักของ EditGAN
StyleGAN2 เป็นโมเดลสร้างแบบจำลองที่ลึกซึ้งซึ่งได้รับการฝึกอบรมมาเพื่อสังเคราะห์ภาพที่มีคุณภาพสูงสุดเท่าที่จะเป็นไปได้พร้อมกับการทำความเข้าใจเซมานติกของภาพที่ถูกสร้างขึ้น
การฝึกอบรมและการอนุมานการแบ่งส่วน
โมเดล EditGAN ฝังภาพลงในพื้นที่ 潛伏 ของ GAN โดยใช้การปรับให้เหมาะสมและตัวเข้ารหัสเพื่อทำการแบ่งส่วนบนภาพใหม่ และการฝึกอบรมสาขาการแบ่งส่วน
ผลลัพธ์ที่ได้คือโมเดลฝังภาพที่มีคำอธิบายการแบ่งส่วนจากชุดข้อมูลลงในพื้นที่ 潛伏 และใช้ขาดทุนการข้ามเอนโทรปีเพื่อฝึกอบรมสาขาการแบ่งส่วนของตัวสร้าง
การใช้การแก้ไขการแบ่งส่วนในการค้นหาเซมานติกในพื้นที่ 潛伏
วัตถุประสงค์หลักของ EditGAN คือการใช้การกระจายร่วมของการแบ่งส่วนเซมานติกและภาพสำหรับการแก้ไขภาพเซมานติกความแม่นยำสูง
ลองพิจารณาว่าเรามีภาพ x ที่ต้องการแก้ไข ดังนั้นโมเดลจึงฝังภาพลงในพื้นที่ 潛伏 ของ EditGAN หรือใช้ภาพตัวอย่างจากโมเดลเอง
สาขาการแบ่งส่วนสร้าง y หรือการแบ่งส่วนเซมานติกที่เกี่ยวข้องเป็นหลัก เนื่องจากทั้งภาพ RGB และการแบ่งส่วนแชร์รหัส 潛伏 w นักพัฒนาสามารถใช้เครื่องมือการระบุหรือการวาดภาพดิจิทัลเพื่อแก้ไขการแบ่งส่วนและแก้ไขตามความต้องการด้วยตนเอง

วิธีการแก้ไขที่แตกต่างกันระหว่างการอนุมาน
เวกเตอร์การแก้ไขในพื้นที่ 潛伏 ที่ได้รับจากการปรับให้เหมาะสมสามารถอธิบายได้ว่าเป็นเซมานติกที่มีความหมายและบ่อยครั้งแยกออกจากคุณลักษณะที่แตกต่างกัน
ดังนั้น เพื่อแก้ไขภาพใหม่ โมเดลสามารถฝังภาพลงในพื้นที่ 潛伏 ได้โดยตรงและทำการแก้ไขแบบเดียวกับที่โมเดลเรียนรู้มาก่อน โดยไม่ต้องทำการปรับให้เหมาะสมทั้งหมดจากศูนย์
การนำไปใช้
เฟรมเวิร์ก EditGAN ถูกประเมินบนภาพที่กระจายอยู่ในหมวดหมู่ที่แตกต่างกัน 4 ประเภท ได้แก่ รถยนต์ นก แมว และใบหน้า
ผลลัพธ์
ผลลัพธ์คุณภาพ
ผลลัพธ์ในโดเมน

ภาพด้านบนแสดงถึงประสิทธิภาพของเฟรมเวิร์ก EditGAN เมื่อมันใช้เวกเตอร์การแก้ไขที่เรียนรู้มาก่อนบนภาพใหม่และปรับให้เหมาะสมภาพโดยใช้ขั้นตอนการปรับให้เหมาะสม 30 ขั้นตอน
ผลลัพธ์เชิงปริมาณ
เพื่อวัดความสามารถในการแก้ไขภาพของ EditGAN โมเดลใช้การแก้ไขยิ้มเป็นมาตรฐาน
ข้อจำกัด
เนื่องจาก EditGAN มีพื้นฐานมาจากโครงสร้าง GAN จึงมีข้อจำกัดเดียวกันกับโมเดล GAN อื่นๆ คือ สามารถทำงานกับภาพที่สามารถสร้างแบบจำลองโดย GAN ได้เท่านั้น
สรุป
หนึ่งในเหตุผลหลักที่ GAN ไม่ใช่มาตรฐานอุตสาหกรรมในด้านแก้ไขภาพคือความไม่สมจริงของมัน
EditGAN มุ่งหวังที่จะแก้ไขปัญหาที่นำเสนอโดยโครงสร้าง GAN แบบดั้งเดิม และพยายามที่จะเป็นวิธีการแก้ไขภาพเซมานติกที่มีคุณภาพสูงและความแม่นยำสูง












