โมเดลและแพลตฟอร์ม AI
เครื่องมือใหม่สามารถแสดงให้นักวิจัยเห็นว่า GANs ออกจากรูปภาพได้อย่างไร
ทีมนักวิจัยจาก MIT-IBM Watson AI Lab ได้สร้างวิธีการแสดงสิ่งที่ Generative Adversarial Network (GANs) ออกจากรูปภาพเมื่อถูกขอให้สร้างรูปภาพ การศึกษานี้ได้รับการตั้งชื่อว่า Seeing What a GAN Cannot Generate และได้รับการนำเสนอที่การประชุมสัมมนาระดับนานาชาติเกี่ยวกับวิสัยทัศน์ทางคอมพิวเตอร์
เครือข่าย Generative Adversarial ได้กลายเป็นเครือข่ายที่มีความสามารถและซับซ้อนมากขึ้นในช่วงไม่กี่ปีที่ผ่านมา และมีการใช้งานอย่างกว้างขวาง พวกมันสามารถสร้างรูปภาพที่มีรายละเอียดได้ดี หากภาพนั้นถูกจำกัดไว้ในพื้นที่เล็กๆ แต่เมื่อ GANs ถูกใช้ในการสร้างรูปภาพของฉากและสภาพแวดล้อมที่ใหญ่กว่า พวกมันไม่ได้ทำงานได้ดีเท่ากัน ในสถานการณ์ที่ GANs ถูกใช้ในการสร้างรูปภาพที่มีหลายวัตถุและรายละเอียด เช่น ถนนหนทางที่มีคนและรถยนต์ GANs มักจะละเว้นรายละเอียดที่สำคัญหลายอย่างจากรูปภาพ
ตามรายงานของ MIT News การวิจัยนี้ได้รับการพัฒนาโดย David Bau นักศึกษาระดับบัณฑิตศึกษาจากภาควิชาวิศวกรรมไฟฟ้าและวิทยาศาสตร์คอมพิวเตอร์ tại MIT Bau อธิบายว่านักวิจัยมักจะเน้นไปที่การปรับปรุงสิ่งที่ระบบการเรียนรู้ของเครื่องจับได้และเข้าใจว่าข้อมูลใดๆ สามารถถูกแมปไปยังผลลัพธ์ใดๆ ได้อย่างไร แต่ Bau ยังอธิบายด้วยว่าการเข้าใจข้อมูลที่ถูกละเว้นโดยโมเดลการเรียนรู้ของเครื่องจักรนั้นสำคัญไม่แพ้กัน และทีมวิจัยหวังว่าเครื่องมือของพวกเขาจะกระตุ้นนักวิจัยให้สนใจข้อมูลที่ถูกละเว้น
ความสนใจของ Bau ใน GANs ถูกกระตุ้นโดยความจริงที่ว่าพวกมันสามารถถูกใช้ในการสืบค้นธรรมชาติของกล่องดำของเครือข่ายประสาทเทียมและเพื่อให้ได้ความเข้าใจว่าเครือข่ายเหล่านั้นกำลังคิดอย่างไร Bau曾ทำงานเกี่ยวกับเครื่องมือที่สามารถระบุกลุ่มของニューロนเทียมได้ โดยการระบุว่าพวกมันรับผิดชอบต่อการแสดงวัตถุในโลกแห่งความเป็นจริง เช่น หนังสือ เมฆ และต้นไม้ Bau ยังมีประสบการณ์กับเครื่องมือที่เรียกว่า GANPaint ซึ่งช่วยให้ศิลปินสามารถลบและเพิ่มคุณสมบัติเฉพาะจากภาพถ่ายโดยใช้ GANs ตามที่ Bau กล่าว การใช้งาน GANPaint ได้เปิดเผยปัญหาหนึ่งเกี่ยวกับ GANs ซึ่งปัญหาได้ปรากฏขึ้นเมื่อ Bau วิเคราะห์รูปภาพ ตามที่ Bau กล่าวกับ MIT News:
“ที่ปรึกษาของฉันเคยกระตุ้นให้เรามองไปไกลกว่าตัวเลขและตรวจสอบภาพจริงๆ เมื่อเรามองไป เราก็พบว่าปรากฏการณ์นั้นเกิดขึ้น: คนที่ถูกตัดออกไปอย่างเลือกสรร”
ในขณะที่ระบบการเรียนรู้ของเครื่องจักรถูกออกแบบมาเพื่อแยกย่อยรูปแบบจากภาพ แต่พวกมันก็สามารถละเว้นรูปแบบที่เกี่ยวข้องได้ Bau และนักวิจัยคนอื่นๆ ได้ทดลองฝึกอบรม GANs ในฉากต่างๆ ทั้งในร่มและกลางแจ้ง แต่ในฉากทั้งหลาย GANs ก็ละเว้นรายละเอียดสำคัญ เช่น รถยนต์ ป้ายจราจร คน จักรยาน และอื่นๆ ซึ่งจริงๆ แล้วเป็นสิ่งสำคัญสำหรับฉากนั้น
ทีมวิจัยสันนิษฐานว่าเมื่อ GANs ถูกฝึกอบรมด้วยรูปภาพ พวกมันอาจพบว่ามันง่ายกว่าที่จะจับภาพรูปแบบของรูปภาพที่สามารถแสดงได้ง่าย เช่น วัตถุใหญ่และไม่เคลื่อนไหว เช่น ภูมิประเทศและอาคาร พวกมันจึงเรียนรู้รูปแบบเหล่านี้มากกว่ารูปแบบที่ยากต่อการแปล เช่น รถยนต์และคน มันเป็นที่รู้กันว่า GANs มักจะละเว้นรายละเอียดที่สำคัญและมีความหมายเมื่อสร้างรูปภาพ แต่การศึกษาจากทีม MIT อาจเป็นครั้งแรกที่ GANs ถูกแสดงให้เห็นว่าละเว้นคลาสวัตถุในภาพทั้งหมด
ทีมวิจัยชี้ให้เห็นว่า GANs สามารถบรรลุเป้าหมายเชิงตัวเลขได้แม้ว่าจะละเว้นวัตถุที่มนุษย์สนใจเมื่อดูรูปภาพ หากรูปภาพที่สร้างโดย GANs จะถูกใช้ในการฝึกอบรมระบบที่ซับซ้อน เช่น รถยนต์ไร้คนขับ ตามที่ The Verge รายงาน ข้อมูลรูปภาพควรได้รับการตรวจสอบอย่างใกล้ชิด เนื่องจากมีความกังวลว่าวัตถุสำคัญ เช่น ป้ายจราจร คน และรถยนต์ อาจถูกละเว้นจากรูปภาพ Bau อธิบายว่าการวิจัยของพวกเขาชี้ให้เห็นว่าทำไมการทำงานของโมเดลไม่ควรพิจารณาแค่ความแม่นยำ:
“เราต้องเข้าใจว่าเครือข่ายเหล่านั้นกำลังทำอะไรและไม่ทำอะไร เพื่อให้แน่ใจว่าพวกมันกำลังตัดสินใจที่เราต้องการให้พวกมันตัดสิน”












