มุมมองของ Anderson
การแก้ไขพื้นที่ Latent ของ GAN ด้วย ‘Blobs’

การวิจัยใหม่จาก UC Berkeley และ Adobe (ADBE ) เสนอวิธีการแก้ไขเนื้อหาที่สร้างขึ้นโดยเครือข่าย Generative Adversarial (GAN) ได้โดยตรง แต่ปกติแล้วไม่สามารถควบคุมได้ สร้างแอนิเมชัน หรือจัดการได้อย่างอิสระในลักษณะที่คุ้นเคยสำหรับผู้ใช้ Photoshop และผู้ปฏิบัติงาน CGI
ที่เรียกว่า BlobGAN วิธีการนี้เกี่ยวข้องกับการสร้างกริดของ ‘blobs’ – โครงสร้างทางคณิตศาสตร์ที่เชื่อมโยงโดยตรงกับเนื้อหาภายในพื้นที่ Latent ของ GAN
โดยการย้าย blobs คุณสามารถย้าย ‘วัตถุ’ ในการแสดงฉากได้อย่าง直观มากขึ้น ซึ่งใกล้เคียงกับวิธีการ CGI และ CAD มากกว่าการพยายามที่จะสร้างและควบคุมพื้นที่ Latent ของ GAN ในปัจจุบัน

การแก้ไขฉากด้วย BlobGAN: เมื่อบล็อกถูกย้ายโดยผู้ใช้ การจัดเรียงวัตถุและรูปแบบ Latent ใน GAN จะถูกเปลี่ยนแปลงตามลำดับ สำหรับตัวอย่างเพิ่มเติม ดูวิดีโอที่แนบมากับบทความนี้ หรือที่ https://www.youtube.com/watch?v=KpUv82VsU5k
เนื่องจากบล็อกสอดคล้องกับ ‘วัตถุ’ ในฉากที่แสดงในพื้นที่ Latent ของ GAN ทั้งหมดจึงถูกแยกออกจากกัน a priori ทำให้สามารถแก้ไขได้แต่ละรายการ

วัตถุสามารถปรับขนาด ลดขนาด คัดลอก และลบได้ รวมถึงการดำเนินการอื่นๆ
เช่นเดียวกับวัตถุในซอฟต์แวร์แก้ไขภาพ (หรือแม้แต่ซอฟต์แวร์แก้ไขข้อความ) บล็อกสามารถคัดลอกและจัดการได้

บล็อกสามารถคัดลอกในอินเทอร์เฟซ และการแสดงแทน Latent ที่สอดคล้องกันจะถูกคัดลอกและวางไว้ Source: https://dave.ml/blobgan/#results
BlobGAN ยังสามารถวิเคราะห์ภาพที่ผู้ใช้เลือกใหม่ๆ เข้าสู่พื้นที่ Latent ของมันได้

ด้วย BlobGAN คุณไม่จำเป็นต้องรวมภาพที่คุณต้องการแก้ไขเข้ากับข้อมูลการฝึกอบรมและค้นหาโค้ด Latent แต่สามารถนำเข้าภาพที่เลือกได้ตามใจชอบและแก้ไขมัน Source: https://dave.ml/blobgan/#results
ผลลัพธ์มากขึ้นสามารถดูได้ที่ ที่นี่ และในวิดีโอที่แนบมากับบทความนี้ หรือที่ https://www.youtube.com/watch?v=KpUv82VsU5k มี Colab ที่สามารถโต้ตอบได้ แบบทดลอง*, และ GitHub รีポ**
เครื่องมือนี้และขอบเขตอาจดูเรียบง่ายในยุคหลัง Photoshop และซอฟต์แวร์แบบพาราเมตริก เช่น Cinema4D และ Blender ได้ให้ผู้ใช้สร้างและปรับแต่งโลก 3 มิติเป็นเวลาหลายทศวรรษ แต่สิ่งนี้แสดงถึงแนวทางที่มีแนวโน้มในการควบคุมพื้นที่ Latent ของ GAN โดยใช้ตัวแทนโพรกซี่ที่เชื่อมโยงกับโค้ด Latent
ผู้เขียนยืนยันว่า:
‘BlobGAN มีประสิทธิภาพเหนือ Style-GAN2 ในคุณภาพของภาพที่วัดโดย FID ในชุดข้อมูลหลายประเภทที่ท้าทายของฉากภายใน’
บทความวิจัยเรื่อง BlobGAN: Spatially Disentangled Scene Representations เขียนโดยนักวิจัยสองคนจาก UC Berkeley และสามคนจาก Adobe Research
ตัวกลาง
BlobGAN นำเสนอแนวคิดใหม่ในการสังเคราะห์ภาพ GAN การเข้าใกล้ปัญหาการแก้ไขสิ่งเหล่านี้ในพื้นที่ Latent ของ GAN ในงานวิจัยใหม่นี้มี两แนวทาง ได้แก่ ‘top-down’ และ ‘bottom-up’
วิธีการ ‘top-down’ ใน GAN หรือเครื่องจำแนกภาพจะจัดการกับภาพของฉากเป็นคลาส เช่น ‘ห้องนอน’ ‘โบสถ์’ ‘ใบหน้า’ ฯลฯ การจับคู่ข้อความและภาพนี้เป็นพลังในการสร้างเฟรมเวิร์กสังเคราะห์ภาพหลายรูปแบบใหม่ เช่น DALL-E 2 ของ OpenAI
วิธีการ ‘bottom-up’ แทนที่จะจับคู่แต่ละพิกเซลในภาพกับคลาส ใบหน้า หรือหมวดหมู่ การใช้เทคนิคที่หลากหลาย แม้ว่าการแบ่งส่วนเชิงความหมายเป็นแนวทางวิจัยที่ได้รับความนิยมในปัจจุบัน
ผู้เขียนวิจัยกล่าวว่า:
‘ทั้งสองเส้นทางดูไม่น่าพอใจ เนื่องจากไม่สามารถให้วิธีการที่ง่ายในการให้เหตุผลเกี่ยวกับส่วนของฉากเป็นวัตถุได้ ส่วนของฉากถูกผสมเข้ากับเวกเตอร์ Latent ที่เชื่อมโยงไว้ (top-down) หรือต้องถูกจัดกลุ่มจากป้ายกำกับพิกเซลแต่ละจุด (bottom-up)’
แทน BlobGAN เสนอ การแสดงแทนระดับกลางที่ไม่ต้องมีการกำกับ หรือโครงสร้างโพรกซี่สำหรับโมเดลสังเคราะห์

เครือข่ายการวางผังจะจับคู่ ‘บล็อก’ ที่ควบคุมได้กับโค้ด Latent Source: https://arxiv.org/pdf/2205.02837.pdf
บล็อกที่เป็นแบบ Gaussian (หรืออิงจากเสียง) มีการจัดเรียงตามความลึก และแสดงถึงจุดขวดในโครงสร้างที่กำหนดการแมปไปยังแต่ละหน่วย ทำให้สามารถแก้ไขแต่ละรายการได้
ผลลัพธ์ที่ได้คือ ‘บล็อกแมป’ ที่ใช้ในการจัดการดีコดเดอร์ของ BlobGAN
สถาปัตยกรรมและข้อมูล
หน่วยในบล็อกแมปถูกแปลงเป็นภาพผ่านเครือข่ายที่ได้รับการแก้ไขจาก StyleGAN2 ที่ได้รับแรงบันดาลใจจากงานวิจัยก่อนหน้าของ NVIDIA (NVDA )

StyleGAN 2 ที่ได้รับการแก้ไขจาก NVIDIA Research บางหลักการในงานนี้ถูกนำมาใช้หรือปรับให้เหมาะสมสำหรับ BlobGAN Source: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2 ถูกปรับให้เหมาะสมใน BlobGAN เพื่อรับข้อมูลจากบล็อกแมปแทนเวกเตอร์ระดับโลกที่ใช้ปกติ

การแก้ไขหลายอย่างที่ทำได้ด้วย BlobGAN รวมถึงการ ‘เติมฉาก’ ห้องนอน และการปรับขนาดและย้ายตำแหน่งของสิ่งของในห้อง ในแถวถัดไป เราจะเห็นเครื่องมือที่ผู้ใช้สามารถเข้าถึงได้ซึ่งทำให้สามารถทำสิ่งนี้ได้ – บล็อกแมป
โดยการเปรียบเทียบ แทนที่จะสร้างอาคารขนาดใหญ่และซับซ้อน (พื้นที่ Latent) ขึ้นมาในครั้งเดียว และต้องสำรวจเส้นทางที่ไม่มีที่สิ้นสุด BlobGAN ส่งบล็อกประกอบเข้ามาในตอนต้นและรู้ว่าพวกมันอยู่ที่ไหนเสมอ การแยกเนื้อหาออกจากตำแหน่งนี้คือนวัตกรรมหลักของงานนี้
* ไม่ทำงาน ณ เวลาที่เขียน
** รหัสยังไม่ได้รับการเผยแพร่ ณ เวลาที่เขียน
เผยแพร่ครั้งแรกเมื่อวันที่ 8 พฤษภาคม 2022












