มุมมองของ Anderson
SofGAN: ระบบสร้างภาพพอร์ตเทรตที่มีการควบคุมสูง

นักวิจัยใน上海และ美国ได้พัฒนาระบบสร้างภาพพอร์ตเทรตที่ใช้ GAN ซึ่งช่วยให้ผู้ใช้สามารถสร้างภาพพอร์ตเทตที่มีลักษณะเฉพาะตัว เช่น เส้นผม ดวงตา แว่นตา เนื้อสัมผัส และสี
เพื่อแสดงความสามารถของระบบ ผู้สร้างได้ให้インターフェซที่คล้ายกับ Photoshop ซึ่งผู้ใช้สามารถวาดองค์ประกอบการแบ่งส่วนเชิงพื้นที่ที่จะถูกตีความเป็นภาพที่มีลักษณะจริง และสามารถวาดได้โดยตรงบนภาพถ่ายที่มีอยู่
ในตัวอย่างด้านล่าง ภาพของดานิเอล แรดคลิฟฟ์ถูกใช้เป็นเทมเพลตการวาด (และวัตถุประสงค์ไม่ใช่การสร้างภาพที่เหมือนเขา แต่เป็นภาพที่มีลักษณะจริง) เมื่อผู้ใช้เติมองค์ประกอบต่างๆ เช่น แว่นตา องค์ประกอบเหล่านั้นจะถูกตีความและแสดงในภาพที่วาด

การใช้ภาพเป็นเทมเพลตการวาดภาพพอร์ตเทรตที่สร้างโดย SofGAN Source: https://www.youtube.com/watch?v=xig8ZA3DVZ8
บทความวิจัยเรื่องนี้มีชื่อว่า SofGAN: ระบบสร้างภาพพอร์ตเทตที่มีการปรับเปลี่ยนรูปแบบไดนามิก และนำโดย Anpei Chen และ Ruiyang Liu ร่วมกับนักวิจัยอีกสองคนจาก ShanghaiTech University และอีกคนหนึ่งจาก University of California at San Diego
การแยกองค์ประกอบ
การมีส่วนร่วมหลักของงานนี้ไม่ใช่การให้インターフェซที่ใช้งานง่าย แต่เป็นการ ‘แยกองค์ประกอบ’ ของลักษณะที่ได้เรียนรู้ เช่น โพสและเนื้อสัมผัส ซึ่งช่วยให้ SofGAN สามารถสร้างภาพพอร์ตเทตที่มีมุมมองที่แตกต่างกัน
เนื่องจากเนื้อสัมผัสถูกแยกออกจากเรขาคณิต รูปทรงและเนื้อสัมผัสของใบหน้าสามารถถูกปรับเปลี่ยนได้อย่างอิสระ ซึ่งทำให้สามารถเปลี่ยนเชื้อชาติของใบหน้าได้ ซึ่งเป็นแนวปฏิบัติที่มีการถกเถียงกัน แต่ขณะนี้มีการใช้งานที่มีประโยชน์ในการสร้างชุดข้อมูลการเรียนรู้ของเครื่องจักรที่มีความสมดุล

SofGAN ยังรองรับการเปลี่ยนแปลงอายุและรูปแบบที่สอดคล้องกับคุณลักษณะที่มีรายละเอียดสูง ซึ่งไม่เคยเห็นในระบบการแบ่งส่วนเชิงพื้นที่อื่นๆ เช่น GauGAN ของ NVIDIA และระบบการเรนเดอร์แบบเกมของ Intel

การเปลี่ยนแปลงอายุของภาพพอร์ตเทตที่สร้างโดย SofGAN
การผสมผสานอีกอย่างหนึ่งของ SofGAN คือการฝึกอบรมที่ไม่ต้องการภาพที่จับคู่กัน แต่สามารถฝึกอบรมได้โดยตรงจากภาพที่มีอยู่ในโลกแห่งความเป็นจริง
นักวิจัยระบุว่าสถาปัตยกรรม ‘แยกองค์ประกอบ’ ของ SofGAN ได้รับแรงบันดาลใจจากระบบการเรนเดอร์ภาพแบบดั้งเดิม ซึ่งแบ่งองค์ประกอบของภาพออกเป็นองค์ประกอบย่อยๆ ในการทำงานของเอฟเฟกต์ภาพ องค์ประกอบของภาพถูกแบ่งออกเป็นองค์ประกอบย่อยๆ ที่มีรายละเอียดสูง
ฟิลด์เชิงพื้นที่แบบเชิงความหมาย (SOF)
เพื่อให้บรรลุเป้าหมายนี้ในระบบสังเคราะห์ภาพแบบเครื่องจักร นักวิจัยได้พัฒนา ฟิลด์เชิงพื้นที่แบบเชิงความหมาย (SOF) ซึ่งเป็นขยายของฟิลด์เชิงพื้นที่แบบดั้งเดิมที่แยกองค์ประกอบของภาพพอร์ตเทตออกเป็นองค์ประกอบย่อยๆ

การวนซ้ำหลายครั้งจากแผนที่การแบ่งส่วนเชิงพื้นที่เดียว
นอกจากนี้ แผนที่การแบ่งส่วนเชิงพื้นที่ 2 มิติจะถูกได้รับจากการเรนเดอร์ผลลัพธ์ของ SOF ก่อนที่จะถูกใส่สีโดยเครื่องสังเคราะห์ GAN แผนที่การแบ่งส่วนเชิงพื้นที่ ‘สังเคราะห์’ เหล่านี้ยังถูกเข้ารหัสในพื้นที่มิติต่ำผ่านตัวเข้ารหัสสามชั้นเพื่อให้แน่ใจว่าผลลัพธ์จะคงเส้นคงวาเมื่อมุมมองเปลี่ยนแปลง
แผนการฝึกอบรมจะผสมผสานสองสไตล์แบบสุ่มสำหรับแต่ละภูมิภาคเชิงความหมาย:
นักวิจัยอ้างว่า SofGAN มีค่า Frechet Inception Distance (FID) ที่ต่ำกว่าและค่า Learned Perceptual Image Patch Similarity (LPIPS) ที่สูงกว่าเมื่อเทียบกับวิธีการที่มีอยู่ในปัจจุบัน
การเข้าใกล้ StyleGAN ในอดีตมักถูกขัดขวางโดยการผสมผสานคุณลักษณะ ซึ่งองค์ประกอบที่ประกอบเป็นภาพถูกผูกมัดกันอย่างไม่สามารถแยกออกได้ ทำให้เกิดองค์ประกอบที่ไม่ต้องการพร้อมกับองค์ประกอบที่ต้องการ

การเรนเดอร์แบบเรย์มาร์ชิง
ชุดข้อมูลและการฝึกอบรม
มีการใช้ชุดข้อมูลสามชุดในการพัฒนารูปแบบต่างๆ ของ SofGAN: CelebAMask-HQ, NVIDIA’s Flickr-Faces-HQ (FFHQ) และชุดข้อมูลที่สร้างขึ้นเองที่มี 122 ภาพพอร์ตเทตที่มีภูมิภาคเชิงความหมายที่ถูกป้ายกำกับด้วยมือ
SOF ประกอบด้วยสามโมดูลที่สามารถฝึกอบรมได้: ไฮเปอร์เน็ตต워크, เรย์มาร์ชเชอร์ และคลาสสิฟายเออร์
การฝึกอบรมใช้เวลา 22 วันในการฝึกอบรม 800,000 ครั้งบน GPU RTX 2080 Ti สี่ตัว
นักวิจัยสังเกตว่าผลลัพธ์ที่มีคุณภาพสูงและทั่วไปเริ่มปรากฏขึ้นในช่วงต้นของการฝึกอบรมที่ 1500 ครั้ง ซึ่งใช้เวลาเพียงสามวัน
SofGAN มักจะได้ผลลัพธ์ที่มีความจริงมากกว่าวิธีการอื่นๆ เช่น SPADE และ Pix2PixHD ของ NVIDIA และ SEAN
ด้านล่างนี้คือวิดีโอที่นักวิจัยได้เผยแพร่ไว้ มีวิดีโออื่นๆ ที่สามารถเข้าถึงได้บน หน้าโครงการ















