มุมมองของ Anderson
โครงการแสดงผลกระทบของการเปลี่ยนแปลงสภาพภูมิอากาศในภาพถ่ายด้วยเครือข่าย Generative Adversarial

ทีมนักวิจัยจากแคนาดาและสหรัฐฯ ได้พัฒนาเครื่องมือการเรียนรู้ของเครื่องเพื่อแสดงผลกระทบของการเปลี่ยนแปลงสภาพภูมิอากาศในภาพถ่ายจริงโดยใช้เครือข่าย Generative Adversarial (GANs) โดยมีเป้าหมายในการลด ‘การทำให้ห่างเหิน’ – ความไม่สามารถที่จะเกี่ยวข้องกับสถานการณ์สมมุติหรือที่ไม่มีตัวตนเกี่ยวกับการเปลี่ยนแปลงสภาพภูมิอากาศ

ClimateGAN ประมาณการเรขาคณิตจากแผนที่ความลึกที่คำนวณก่อนเพิ่มการสะท้อนในพื้นผิวน้ำที่ซ้อนทับ. Source: https://arxiv.org/pdf/2110.02871.pdf
โครงการ ClimateGAN เป็นส่วนหนึ่งของความพยายามในการวิจัยที่กว้างขึ้นในการพัฒนาบรรยากาศที่มีปฏิสัมพันธ์ ซึ่งผู้ใช้สามารถสำรวจโลกที่ได้รับผลกระทบจากน้ำท่วม ความร้อนจัด และผลกระทบอื่นๆ ของการเปลี่ยนแปลงสภาพภูมิอากาศ
การอภิปรายเกี่ยวกับแรงจูงใจเบื้องหลังโครงการนี้ นักวิจัยระบุว่า:
‘การเปลี่ยนแปลงสภาพภูมิอากาศเป็นภัยคุกคามที่สำคัญต่อมนุษยชาติ และการดำเนินการเพื่อป้องกันผลกระทบร้ายแรงของการเปลี่ยนแปลงสภาพภูมิอากาศจำเป็นต้องมีการเปลี่ยนแปลงทั้งในนโยบายและพฤติกรรมของแต่ละบุคคล อย่างไรก็ตาม การดำเนินการเหล่านี้ต้องอาศัยความเข้าใจถึงผลกระทบของการเปลี่ยนแปลงสภาพภูมิอากาศ แม้ว่าจะดูเหมือนเป็นเรื่องที่ไม่มีตัวตนและห่างไกลก็ตาม ‘
‘การแสดงผลกระทบที่อาจเกิดขึ้นจากเหตุการณ์สภาพภูมิอากาศที่รุนแรง เช่น น้ำท่วมในสถานที่ที่คุ้นเคย สามารถช่วยให้ผลกระทบของการเปลี่ยนแปลงสภาพภูมิอากาศที่ไม่มีตัวตนเป็นเรื่องที่มีเนื้อหามากขึ้นและกระตุ้นให้เกิดการดำเนินการ’
วัตถุประสงค์หลักของโครงการคือการสร้างระบบที่ผู้ใช้สามารถป้อนที่อยู่ (หรือที่อยู่ใดๆ) และดูภาพที่ได้รับผลกระทบจากสภาพภูมิอากาศจาก Google Street View อย่างไรก็ตาม อัลกอริทึมการแปลงที่อยู่เบื้องหลัง ClimateGAN ต้องการความรู้บางอย่างเกี่ยวกับความสูงของวัตถุในภาพ ซึ่งไม่ได้รวมอยู่ในข้อมูลที่ Google ให้สำหรับ Street View และดังนั้นการหาอัลกอริทึมการประมาณค่าเหล่านี้จึงยังคงเป็นความท้าทายที่กำลังดำเนินอยู่
ข้อมูลและสถาปัตยกรรม
ClimateGAN ใช้การแปลภาพถ่ายที่ไม่มีการดูแลโดยใช้กระบวนการสองขั้นตอน: ชั้น Masker ซึ่งประมาณการว่าพื้นผิวน้ำจะอยู่ที่ไหนในภาพเป้าหมาย และโมดูล Painter เพื่อแสดงภาพน้ำในขอบเขตที่กำหนดโดยชั้น Masker และคำนึงถึงการสะท้อนของเรขาคณิตที่ไม่ถูกบดบังเหนือระดับน้ำ

สถาปัตยกรรมของ ClimateGAN. ข้อมูลเข้าไปผ่านเครื่องมือร่วมเข้าไปในกระบวนการปิดบังสามขั้นตอนก่อนที่จะถูกส่งไปยังโมดูล Painter. เครือข่ายทั้งสองถูกฝึกฝนแยกจากกันและทำงานร่วมกันเฉพาะในช่วงการสร้างภาพใหม่
ข้อมูลการฝึกสอนส่วนใหญ่ถูกเลือกจากชุดข้อมูล CityScapes และ Mapillary. อย่างไรก็ตาม เนื่องจากข้อมูลที่มีอยู่สำหรับภาพน้ำท่วมค่อนข้างหายาก นักวิจัยจึงรวมข้อมูลที่มีอยู่เข้ากับ ‘โลกเสมือน’ ที่พัฒนาโดยใช้เครื่องมือ Unity3D

ฉากจากโลกเสมือน Unity3D
โลกเสมือน Unity3D มีขนาดประมาณ 1.5 กิโลเมตร และประกอบด้วยพื้นที่เมือง พื้นที่ชานเมือง และพื้นที่ชนบท ซึ่งนักวิจัย ‘น้ำท่วม’. สิ่งนี้ช่วยให้สามารถสร้างภาพ ‘ก่อน’ และ ‘หลัง’ สำหรับกรอบความจริงเพิ่มเติมสำหรับโครงสร้าง ClimateGAN
หน่วย Masker ปรับเปลี่ยนรหัส ADVENT ปี 2018 สำหรับการฝึกอบรมโดยการเพิ่มข้อมูลตามผลการวิจัยของฝรั่งเศสในปี 2019 DADA. นักวิจัยยังเพิ่มตัวถอดรหัสการแบ่งส่วนเพื่อให้ข้อมูลเพิ่มเติมแก่หน่วย Masker เกี่ยวกับวิชาเรียนของภาพเข้า (เช่น ข้อมูลที่มีฉลากที่บ่งบอกถึงโดเมน เช่น ‘อาคาร’)
ตัวถอดรหัส Flood Mask คำนวณเส้นน้ำที่เป็นไปได้ และได้รับการขับเคลื่อนโดยเฟรมเวิร์กการวาดภาพของ NVIDIA SPADE

คลิกเพื่อขยาย. ร่วมกับการแบ่งส่วนเชิงวิชา (คอลัมน์ที่สาม) ข้อมูลแผนที่ความลึกช่วยให้สามารถกำหนดรูปร่างของเรขาคณิตในภาพได้ โดยให้แนวทางสำหรับขอบเขตของ ‘น้ำท่วม’. สิ่งนี้สามารถอนุมานได้ผ่านกระบวนการเรียนรู้ของเครื่อง แม้ว่าข้อมูลนี้จะถูกเพิ่มเข้าไปในเซ็นเซอร์ระดับผู้บริโภคบนอุปกรณ์มือถือมากขึ้น ในแถวล่างสุด เราจะเห็นว่าสถาปัตยกรรม ClimateGAN ได้แสดงภาพ ‘น้ำท่วม’ ของภาพดั้งเดิมที่ไม่ถูกบดบังแม้ว่าขั้นตอนกลางจะล้มเหลวในการจับเรขาคณิตของฉากที่ซับซ้อน
แม้ว่านักวิจัยจะใช้ GauGAN ของ NVIDIA ที่ขับเคลื่อนโดย SPADE สำหรับโมดูล Painter แต่ก็จำเป็นต้องให้ GauGAN ขึ้นอยู่กับผลลัพธ์ของหน่วย Masker และไม่ใช่แผนที่การแบ่งส่วนเชิงวิชาทั่วไป เนื่องจากภาพต้องถูกแปลงให้สอดคล้องกับเส้นน้ำ ไม่ใช่การเปลี่ยนแปลงทั่วไป
การประเมินคุณภาพ
ตัววัดสำหรับการประเมินคุณภาพของภาพที่ได้รับถูกอำนวยความสะดวกโดยการให้ฉลากชุดการทดสอบที่มี 180 ภาพจาก Google Street View ของประเภทต่างๆ รวมถึงภาพเมืองและภาพชนบทจากพื้นที่ทางภูมิศาสตร์ที่หลากหลาย ภาพถูกให้ฉลากว่า ไม่สามารถท่วม, ต้องท่วม และ อาจท่วม

สิ่งนี้ทำให้เกิดตัววัดสามตัว: อัตราความผิดพลาด (พื้นที่การคาดการณ์ที่รับรู้ตามขนาดในภาพที่แปลงแล้ว), คะแนน F05 และ ความสอดคล้องของขอบ. สำหรับการเปรียบเทียบ นักวิจัยทดสอบข้อมูลกับโมเดลการแปลภาพถ่ายก่อนหน้า รวมถึง InstaGAN, CycleGAN และ MUNIT

ในการทดสอบผู้ใช้ ClimateGAN ถูกพบว่ามีความสมจริงมากกว่าโครงสร้าง IIT ที่แข่งขันกันห้าแบบ Blue แสดงถึงระดับที่ผู้ใช้ชอบ ClimateGAN มากกว่าวิธีทางเลือกที่ศึกษา
นักวิจัยยอมรับว่าการขาดข้อมูลความสูงในภาพต้นฉบับทำให้ยากที่จะกำหนดความสูงของน้ำในภาพได้ตามใจชอบ หากผู้ใช้ต้องการเพิ่ม ‘ปัจจัย Roland Emmerich’ เล็กน้อย พวกเขายังยอมรับว่าผลกระทบของน้ำท่วมถูกจำกัดมากเกินไปในพื้นที่ที่ท่วมน้ำ และตั้งใจที่จะสำรวจวิธีการเพิ่มระดับน้ำท่วมหลายระดับ (เช่น หลังจากการถอยกลับของน้ำท่วมครั้งแรก) เข้าไปในระเบียบวิธี
รหัสของ ClimateGAN ได้รับการเผยแพร่ที่ GitHub พร้อมตัวอย่างภาพที่แสดงผลเพิ่มเติม

ในตัวอย่างอื่นจาก GitHub สำหรับโครงการนี้ มลพิษทางอากาศถูกเพิ่มเข้าไปในภาพเมืองในลักษณะที่คุ้นเคยสำหรับผู้ปฏิบัติงาน VFX ส่วนใหญ่ – แผนที่ความลึกถูกใช้เป็น ‘มาสก์ขาวที่ถอยกลับ’ เพื่อให้ความหนาแน่นของมลพิษ/หมอกเพิ่มขึ้นตามระยะทางที่ครอบคลุมในภาพ. Source: https://github.com/cc-ai/climategan












