มุมมองของ Anderson
ส่วนของการสร้างภาพมีการใช้มาตรฐานที่มีข้อบกพร่อง การวิจัยอ้างว่า

ปี 2021 เป็นปีที่มีการก้าวหน้าอย่างไม่เคยปรากฏมาก่อน และมีการตีพิมพ์ผลงานอย่างรวดเร็วในด้านการสร้างภาพ โดยนำเสนอเทคโนโลยีใหม่ๆ ที่สามารถสร้างภาพที่เหมือนมนุษย์ได้โดยใช้ การแสดงภาพแบบประสาท, การสร้างภาพเทียม และวิธีการใหม่อื่นๆ
อย่างไรก็ตาม นักวิจัยจากเยอรมนีกล่าวว่ามาตรฐานที่ใช้ในการประเมินความสมจริงของภาพสังเคราะห์โดยอัตโนมัตินั้น มีข้อบกพร่องอย่างรุนแรง และนักวิจัยหลายร้อยคนหรือหลายพันคนทั่วโลกที่พึ่งพามันเพื่อลดต้นทุนของการประเมินผลลัพธ์โดยใช้มนุษย์อาจกำลังเดินไปในทางที่ผิด
เพื่อแสดงให้เห็นว่ามาตรฐาน Fréchet Inception Distance (FID) ไม่สอดคล้องกับมาตรฐานของมนุษย์ในการประเมินภาพ นักวิจัยได้ใช้ GANs ของตนเองที่ได้รับการปรับให้เหมาะสมสำหรับ FID (ซึ่งเป็นมาตรฐานที่ใช้กันอย่างแพร่หลายในปัจจุบัน) พวกเขาพบว่า FID มีข้อบกพร่องและไม่สามารถประเมินภาพได้อย่างถูกต้อง

คะแนน FID (ค่า thấpกว่าคือดีกว่า) สำหรับภาพที่สร้างโดยโมเดลต่างๆ โดยใช้เซตข้อมูลและสถาปัตยกรรมมาตรฐาน นักวิจัยของเอกสารใหม่นี้ถามว่า ‘คุณเห็นด้วยกับการจัดอันดับนี้หรือไม่?’ แหล่งที่มา: https://openreview.net/pdf?id=mLG96UpmbYz
นอกจากข้อกล่าวหาที่ว่า FID ไม่เหมาะสมสำหรับงานที่ตั้งใจไว้แล้ว เอกสารดังกล่าวยังชี้ให้เห็นว่า ‘วิธีการแก้ไขที่ชัดเจน’ เช่น การเปลี่ยนเครื่องยนต์ภายในของ FID ออกไปจะไม่ช่วยแก้ปัญหาได้ นักวิจัยชี้ให้เห็นว่าตอนนี้เป็นหน้าที่ของการวิจัยใหม่ที่จะพัฒนาเมตริกที่ดีกว่าในการประเมิน ‘ความสมจริง’ ของภาพสังเคราะห์
เอกสาร นี้ มีชื่อว่า Internalized Biases in Fréchet Inception Distance และมาจาก Steffen Jung ที่ Max Planck Institute for Informatics at Saarland และ Margret Keuper ศาสตราจารย์ด้าน Visual Computing ที่ University of Siegen
การค้นหาระบบการให้คะแนนสำหรับการสร้างภาพ
ตามที่การวิจัยใหม่ระบุว่า ความก้าวหน้าในการสร้างภาพโดยใช้ GANs และสถาปัตยกรรม encoder/decoder ได้ล้ำหน้ากว่า phương phápที่ใช้ในการประเมินผลลัพธ์ของระบบเหล่านี้ นอกจากจะใช้เวลานานและต้องใช้คนมากแล้ว การประเมินผลลัพธ์โดยใช้มนุษย์ยังไม่สามารถให้ผลลัพธ์ที่มีมาตรฐานและสามารถทำซ้ำได้
ดังนั้น จึงมีการพัฒนาเฟรมเวิร์กมาตรฐานหลายแบบ รวมถึง Inception Score (IS) ซึ่งถูกนำเสนอในเอกสาร Improved Techniques for Training GANs ในปี 2016 ซึ่งเป็นเอกสารที่เขียนโดย Ian Goodfellow ผู้คิดค้น GAN
การยกเลิกคะแนน Inception Score ในฐานะมาตรฐานที่ใช้กันอย่างแพร่หลายสำหรับเครือข่าย GAN หลายๆ แบบ ในปี 2018 ทำให้เกิดการนำมาตรฐาน FID มาใช้กันอย่างแพร่หลายใน社区การสร้างภาพสังเคราะห์ อย่างไรก็ตาม เช่นเดียวกับ Inception Score FID ก็ใช้เครือข่าย Inception v3 ของ Google ในการประเมินภาพ
นักวิจัยจากเยอรมนีได้พบว่า FID ส่งเสริมความลำเอียงที่เป็นอันตรายใน Inception v3 ซึ่งนำไปสู่การประเมินคุณภาพภาพที่ไม่น่าเชื่อถือ
เนื่องจาก FID สามารถรวมเข้ากับเฟรมเวิร์กการเรียนรู้ของเครื่องได้โดยใช้เป็นตัวตัดสิน (ตัวตัดสินที่ฝังตัวที่ตัดสินว่า GAN ทำได้ดีหรือไม่) จึงต้องสามารถแสดงมาตรฐานที่มนุษย์ใช้ในการประเมินภาพได้อย่างถูกต้อง
Fréchet Inception Distance
FID เปรียบเทียบการกระจายคุณลักษณะทั่วเซตข้อมูลที่ใช้ในการสร้างโมเดล GAN (หรือฟังก์ชันการทำงานที่คล้ายกัน) และผลลัพธ์ของระบบ
ดังนั้น หากโมเดล GAN ถูกฝึกโดยใช้ภาพ 10,000 ภาพของ (ตัวอย่างเช่น) ผู้คนในวงการบันเทิง FID จะเปรียบเทียบภาพที่แท้จริงกับภาพเทียมที่สร้างโดย GAN คะแนน FID ที่ต่ำกว่าหมายความว่า GAN ได้สร้างภาพที่สมจริงมากขึ้นตามเกณฑ์ของ FID

จากเอกสาร ผลลัพธ์ของ GAN ที่ฝึกโดยใช้ FFHQ64 ซับเซตของเซตข้อมูล FFHQ ของ NVIDIA ที่มีการลดความละเอียดภาพลงเหลือ 64×64
ปัญหาอยู่ที่ Inception v3 ซึ่งเป็นพื้นฐานของ FID ไม่ได้มองหาสิ่งที่ถูกต้อง – อย่างน้อยก็ไม่ใช่เมื่อพิจารณาถึงงานที่ทำ
Inception V3 ถูกฝึกโดยใช้ ImageNet object recognition challenge ซึ่งเป็นงานที่แตกต่างจากงานสร้างภาพสังเคราะห์ที่พัฒนาไปในหลายปีที่ผ่านมา IV3 ทดสอบความแข็งแกร่งของโมเดลโดยการทำการเพิ่มข้อมูล: มันพลิกภาพแบบสุ่ม ตัดภาพให้มีขนาดสุ่มระหว่าง 8-100% เปลี่ยนอัตราส่วนภาพ (ในช่วง 3/4 ถึง 4/3) และฉีดสีแบบสุ่มที่เกี่ยวข้องกับความสว่าง ความอิ่มตัว และความแตกต่าง
นักวิจัยจากเยอรมนีพบว่า IV3 มีแนวโน้มที่จะเลือกคุณลักษณะที่ขึ้นอยู่กับขอบและข้อความมากกว่าข้อมูลสีและความเข้ม ซึ่งจะเป็นตัวบ่งชี้ที่มีความหมายมากกว่าสำหรับภาพสังเคราะห์ และวัตถุประสงค์เดิมในการตรวจจับวัตถุจึงถูกนำมาใช้ในงานที่ไม่เหมาะสม นักวิจัยระบุ*:
‘[Inception v3] มีความลำเอียงในการเลือกคุณลักษณะที่ขึ้นอยู่กับขอบและข้อความมากกว่าข้อมูลสีและความเข้ม ซึ่งสอดคล้องกับพายพีนการเพิ่มข้อมูลที่แนะนำสีแบบสุ่ม แต่เก็บข้อมูลความถี่สูงไว้ (ไม่เหมือนกับการเพิ่มข้อมูลด้วยการเบลอแบบกอัสเซียน) ‘
‘ดังนั้น FID จึงส่งเสริมความลำเอียงนี้ เมื่อใช้เป็นมาตรฐานการให้คะแนน โมเดลที่สร้างข้อความได้ดีอาจถูกเลือกมากกว่าโมเดลที่สร้างการกระจายสีได้ดี
ข้อมูลและวิธีการ
เพื่อทดสอบสมมติฐานของพวกเขา นักวิจัยได้ฝึกโมเดล GAN สองแบบ ได้แก่ DCGAN และ SNGAN โดยใช้เซตข้อมูล FFHQ ของ NVIDIA ที่มีการลดความละเอียดภาพลงเหลือ 64×64
มีการทดลองฝึก GAN สามแบบ: GAN G+D ซึ่งเป็นเครือข่ายแบบมาตรฐานที่ใช้ตัวตัดสิน; GAN FID|G+D ซึ่ง FID ทำหน้าที่เป็นตัวตัดสินเพิ่มเติม; และ GAN FID|G ซึ่ง GAN ถูกขับเคลื่อนโดยคะแนน FID ที่หมุนเวียน
ทางเทคนิค FID ควรจะทำให้การฝึกมีเสถียรภาพ และอาจถึงขั้น แทนที่ ตัวตัดสิน (เช่นเดียวกับใน #3 GAN FID|G) ในขณะเดียวกันก็ให้ผลลัพธ์ที่น่าพอใจสำหรับมนุษย์
ในทางปฏิบัติ ผลลัพธ์กลับแตกต่างออกไป โดยที่ – ตามสมมติฐานของนักวิจัย – โมเดลที่ได้รับการช่วยเหลือจาก FID ‘过拟ห’ ในมาตรการที่ไม่ถูกต้อง นักวิจัยสังเกตเห็นว่า:
‘เราสมมติว่าเครื่องกำเนิดเรียนรู้ที่จะสร้างคุณลักษณะที่ไม่เหมาะสมเพื่อจับคู่การกระจายข้อมูลการฝึก ซึ่งการสังเกตการณ์นี้จะรุนแรงขึ้นในกรณีของ [GAN FID|G] ที่นี่ เราสังเกตเห็นว่าการขาดตัวตัดสินทำให้เกิดการกระจายคุณลักษณะที่ไม่สอดคล้องกันในเชิงพื้นที่ ตัวอย่างเช่น [SNGAN FID|G] เพิ่มเพียงตาเดียวและจัดแนวคุณลักษณะของใบหน้าในลักษณะที่น่ากลัว’
นักวิจัยสรุป*:
‘ในขณะที่ผู้ให้ข้อมูลมนุษย์อาจชอบภาพที่สร้างโดย SNGAN D+G มากกว่า SNGAN FID|G (ในกรณีที่ความซื่อสัตย์ของข้อมูลถูกต้องการมากกว่าศิลปะ) เราจะเห็นว่านี่ไม่ได้สะท้อนให้เห็นใน FID FID ไม่สอดคล้องกับการรับรู้ของมนุษย์ ‘
‘เรายืนยันว่าคุณลักษณะที่แยกแยะซึ่งให้มาโดยเครือข่ายการจำแนกประเภทภาพไม่เพียงพอสำหรับการสร้างมาตรฐานที่มีความหมาย’
ไม่มีทางเลือกที่ง่าย
นักวิจัยยังพบว่าการเปลี่ยน Inception V3 ด้วยเครื่องยนต์ที่คล้ายกันไม่ได้ช่วยแก้ปัญหาได้ เมื่อแทนที่ IV3 ด้วย ‘เครื่องยนต์จำแนกประเภทที่หลากหลาย’ ซึ่งถูกทดสอบกับ ImageNet-C (ซับเซตของ ImageNet ที่ออกแบบมาเพื่อทดสอบการสร้างภาพสังเคราะห์) นักวิจัยไม่สามารถปรับปรุงผลลัพธ์ได้อย่างมีนัยสำคัญ:
‘ความลำเอียงที่พบใน Inception v3 ก็พบได้ในเครือข่ายจำแนกประเภทอื่นๆ อีกด้วย นอกจากนี้เรายังเห็นว่าเครือข่ายที่แตกต่างกันจะให้การจัดอันดับที่แตกต่างกันในระหว่างการทำความเสียหายประเภทต่างๆ’
นักวิจัยสรุปเอกสารด้วยความหวังว่าการวิจัยที่กำลังดำเนินอยู่จะพัฒนา ‘มาตรฐานที่สอดคล้องกับมนุษย์และไม่มีอคติ’ ที่สามารถช่วยให้การให้คะแนนโครงสร้างการสร้างภาพเป็นไปอย่างยุติธรรมมากขึ้น
* นักวิจัยเน้นย้ำ
ตีพิมพ์ครั้งแรกเมื่อวันที่ 2oth ธันวาคม 2021 เวลา 1pm GMT+2













