Góc nhìn Anderson

Dự án Dự đoán Biến đổi Khí hậu vào Ảnh với Mạng Đối nghịch Generative

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nhóm các nhà nghiên cứu từ Canada và Mỹ đã phát triển một phương pháp học máy để chồng lên ảnh thực tế các tác động thảm khốc của biến đổi khí hậu bằng cách sử dụng Mạng Đối nghịch Generative (GAN), với mục tiêu giảm ‘khoảng cách’ – khả năng không liên quan của chúng ta đến các kịch bản giả định hoặc trừu tượng về biến đổi khí hậu.

ClimateGAN ước tính hình học từ một bản đồ độ sâu tính toán trước khi thêm phản xạ vào bề mặt nước chồng lên. Source: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN ước tính hình học từ một bản đồ độ sâu tính toán trước khi thêm phản xạ vào bề mặt nước chồng lên. Source: https://arxiv.org/pdf/2110.02871.pdf

Dự án, có tên ClimateGAN, là một phần của nỗ lực nghiên cứu rộng lớn hơn để phát triển các môi trường tương tác nơi người dùng có thể khám phá các thế giới được dự đoán đã bị ảnh hưởng bởi lũ lụt, nhiệt độ cực đoan và các hậu quả nghiêm trọng khác của biến đổi khí hậu.

Thảo luận về động lực đằng sau sáng kiến, các nhà nghiên cứu tuyên bố:

‘Biến đổi khí hậu là một mối đe dọa lớn đối với nhân loại, và các hành động cần thiết để ngăn chặn các hậu quả thảm khốc của nó bao gồm cả thay đổi trong chính sách và hành vi cá nhân. Tuy nhiên, để thực hiện các hành động này, cần phải hiểu được tác động của biến đổi khí hậu, ngay cả khi chúng có vẻ trừu tượng và xa vời. ‘

‘Dự đoán các hậu quả có thể của các sự kiện khí hậu cực đoan như lũ lụt ở những nơi quen thuộc có thể giúp làm cho các tác động trừu tượng của biến đổi khí hậu trở nên cụ thể hơn và khuyến khích hành động.’

Mục tiêu cốt lõi của sáng kiến là cho phép một hệ thống nơi người dùng có thể nhập địa chỉ của mình (hoặc bất kỳ địa chỉ nào) và xem một phiên bản ảnh bị ảnh hưởng bởi biến đổi khí hậu từ Google Street View. Tuy nhiên, các thuật toán biến đổi đằng sau ClimateGAN yêu cầu một số kiến thức ước tính về độ cao của các vật thể trong ảnh, điều này không được bao gồm trong siêu dữ liệu mà Google cung cấp cho Street View, và do đó, việc thu được một thuật toán ước tính như vậy vẫn còn là một thách thức đang diễn ra.

Dữ liệu và Kiến trúc

ClimateGAN sử dụng một đường ống dịch ảnh không giám sát với hai giai đoạn: một lớp Masker, ước tính nơi một bề mặt nước sẽ tồn tại trong ảnh mục tiêu; và một mô-đun Painter để渲染 nước một cách thực tế trong phạm vi của mặt nạ đã thiết lập, và tính đến phản xạ của hình học không bị che khuất trên mực nước.

Kiến trúc cho ClimateGAN. Đầu vào đi qua một bộ mã hóa chung vào một quá trình tạo mặt nạ ba giai đoạn trước khi được chuyển đến mô-đun Painter. Hai mạng được đào tạo độc lập, và chỉ hoạt động cùng nhau trong quá trình tạo ra các ảnh mới.

Kiến trúc cho ClimateGAN. Đầu vào đi qua một bộ mã hóa chung vào một quá trình tạo mặt nạ ba giai đoạn trước khi được chuyển đến mô-đun Painter. Hai mạng được đào tạo độc lập, và chỉ hoạt động cùng nhau trong quá trình tạo ra các ảnh mới.

Phần lớn dữ liệu đào tạo được chọn từ các tập dữ liệu CityScapesMapillary. Tuy nhiên, vì dữ liệu hiện có về ảnh lũ lụt tương đối khan hiếm, các nhà nghiên cứu đã kết hợp các tập dữ liệu hiện có với một ‘thế giới ảo’ mới được phát triển bằng công cụ Unity3D.

Cảnh từ môi trường ảo Unity3D.

Cảnh từ môi trường ảo Unity3D.

Môi trường Unity3D chứa khoảng 1,5 km địa hình, bao gồm các khu vực đô thị, ngoại ô và nông thôn, mà các nhà nghiên cứu đã ‘lũ lụt’. Điều này cho phép tạo ra các ảnh ‘trước’ và ‘sau’ cho thêm dữ liệu thực sự cho khuôn khổ ClimateGAN.

Đơn vị Masker thích nghi với mã ADVENT năm 2018 cho đào tạo, thêm dữ liệu bổ sung theo các phát hiện năm 2019 từ sáng kiến nghiên cứu Pháp DADA. Các nhà nghiên cứu cũng thêm một bộ giải mã phân đoạn để cung cấp cho đơn vị Masker thông tin bổ sung về ngữ nghĩa của ảnh đầu vào (tức là thông tin được dán nhãn chỉ định một miền, chẳng hạn như ‘tòa nhà’).

Bộ giải mã Mặt nạ Lũ lụt tính toán một đường nước hợp lý, và được cung cấp bởi khuôn khổ vẽ lại SPADE phổ biến của NVIDIA.

Cùng với phân đoạn ngữ nghĩa (cột thứ ba), thông tin bản đồ độ sâu cho phép xác định hình học trong ảnh, cung cấp hướng dẫn cho các biên giới của 'nước lũ'. Điều này có thể được suy luận thông qua các quá trình học máy, mặc dù thông tin như vậy ngày càng được bao gồm trong các cảm biến thiết bị di động cấp tiêu dùng. Trong hàng thấp nhất, chúng ta thấy rằng kiến trúc ClimateGAN đã渲染 thành công một phiên bản 'lũ lụt' của ảnh gốc mặc dù các giai đoạn trung gian đã không chính xác nắm bắt được hình học của một cảnh phức tạp.

Nhấp để phóng to. Cùng với phân đoạn ngữ nghĩa (cột thứ ba), thông tin bản đồ độ sâu cho phép xác định hình học trong ảnh, cung cấp hướng dẫn cho các biên giới của ‘nước lũ’. Điều này có thể được suy luận thông qua các quá trình học máy, mặc dù thông tin như vậy ngày càng được bao gồm trong các cảm biến thiết bị di động cấp tiêu dùng. Trong hàng thấp nhất, chúng ta thấy rằng kiến trúc ClimateGAN đã渲染 thành công một phiên bản ‘lũ lụt’ của ảnh gốc mặc dù các giai đoạn trung gian đã không chính xác nắm bắt được hình học của một cảnh phức tạp.

Mặc dù các nhà nghiên cứu đã sử dụng GauGAN của NVIDIA, được cung cấp bởi SPADE, cho mô-đun Painter, nhưng cần phải điều kiện GauGAN trên đầu ra của Masker, và không trên một bản đồ phân đoạn ngữ nghĩa tổng quát, như xảy ra trong sử dụng bình thường, vì ảnh phải được biến đổi theo các đường nước, chứ không phải theo các biến đổi rộng, chung chung.

Đánh giá Chất lượng

Các chỉ số để đánh giá chất lượng của ảnh kết quả được tạo điều kiện bởi việc dán nhãn một tập dữ liệu thử nghiệm gồm 180 ảnh Google Street View với các loại khác nhau, bao gồm cả cảnh đô thị và cảnh nông thôn từ nhiều vị trí địa lý khác nhau. Các ảnh đã được dán nhãn thủ công là không thể lũ lụt, phải lũ lụt, và có thể lũ lụt.

Điều này cho phép tạo ra ba chỉ số: tỷ lệ lỗi (các khu vực dự đoán được nhận thức theo kích thước trong ảnh biến đổi), F05 Điểm, và độ nhất quán của cạnh. Để so sánh, các nhà nghiên cứu đã thử nghiệm dữ liệu trên các mô hình dịch ảnh sang ảnh trước đó, bao gồm InstaGAN, CycleGAN, và MUNIT.

Trong các thử nghiệm người dùng, ClimateGAN được tìm thấy đạt được mức độ thực tế cao hơn so với năm kiến trúc IIT cạnh tranh. Màu xanh lam đại diện cho mức độ mà người dùng thích ClimateGAN so với phương pháp thay thế được nghiên cứu.

Trong các thử nghiệm người dùng, ClimateGAN được tìm thấy đạt được mức độ thực tế cao hơn so với năm kiến trúc IIT cạnh tranh. Màu xanh lam đại diện cho mức độ mà người dùng thích ClimateGAN so với phương pháp thay thế được nghiên cứu.

Các nhà nghiên cứu thừa nhận rằng sự thiếu hụt dữ liệu về độ cao trong ảnh nguồn làm cho việc áp đặt tùy ý độ cao mực nước trong ảnh trở nên khó khăn, nếu người dùng muốn tăng ‘yếu tố Roland Emmerich’ một chút. Họ cũng thừa nhận rằng các hiệu ứng lũ lụt bị hạn chế quá mức đối với khu vực lũ lụt, và có ý định điều tra các phương pháp để thêm nhiều mức độ lũ lụt (tức là sau khi rút lui của một cơn lũ ban đầu) vào phương pháp.

Mã của ClimateGAN đã được đặt tại GitHub, cùng với các ví dụ bổ sung về ảnh được渲染.

Trong một ví dụ khác, từ sự hiện diện của GitHub cho dự án, khói được thêm vào một bức ảnh thành phố theo cách sẽ quen thuộc với hầu hết các nhà thực hành VFX - bản đồ độ sâu được sử dụng như một loại mặt nạ 'trắng' lùi lại, vì vậy mật độ của khói / sương mù tăng lên trên khoảng cách được bao phủ trong ảnh. Source: https://github.com/cc-ai/climategan

Trong một ví dụ khác, từ sự hiện diện của GitHub cho dự án, khói được thêm vào một bức ảnh thành phố theo cách sẽ quen thuộc với hầu hết các nhà thực hành VFX – bản đồ độ sâu được sử dụng như một loại mặt nạ ‘trắng’ lùi lại, vì vậy mật độ của khói / sương mù tăng lên trên khoảng cách được bao phủ trong ảnh. Source: https://github.com/cc-ai/climategan

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai