Góc nhìn Anderson

Neural Rendering: Làm Thế Nào Để Giảm Đầu Vào?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Hôm qua, một số công việc nghiên cứu mới về tổng hợp hình ảnh neural đã thu hút sự chú ý và tưởng tượng của internet, khi các nhà nghiên cứu của Intel tiết lộ một phương pháp mới để tăng cường độ thực của hình ảnh tổng hợp.

Hệ thống, như được trình diễn trong một video từ Intel, can thiệp trực tiếp vào đường ống hình ảnh cho trò chơi điện tử Grand Theft Auto V, và tự động tăng cường hình ảnh thông qua một thuật toán tổng hợp hình ảnh được đào tạo trên mạng nơ-ron tích chập (CNN), sử dụng hình ảnh thế giới thực từ Bộ dữ liệu Mapillary, và thay thế ánh sáng và kết cấu kém thực tế của trò chơi.

Các bình luận, trong một loạt phản ứng trong các cộng đồng như Reddit và Hacker News, đang đặt ra không chỉ khả năng mà việc kết xuất neural của loại này có thể thay thế hiệu quả đầu ra kém thực tế của các động cơ trò chơi truyền thống và CGI cấp VFX, mà còn có thể đạt được với đầu vào cơ bản hơn nhiều so với bản demo GTA5 của Intel – hiệu quả tạo ra ‘bùn’ đầu vào代理 với đầu ra thực tế rất cao.

Các Bộ Dữ Liệu Đôi

Nguyên tắc này đã được minh họa bởi một thế hệ mới của hệ thống GAN và mã hóa/giải mã trong ba năm qua, chẳng hạn như GauGAN của NVIDIA, tạo ra hình ảnh phong cảnh thực tế từ các nét vẽ thô.

Hiệu quả này đảo ngược việc sử dụng phân đoạn ngữ nghĩa trong thị giác máy tính từ một phương pháp thụ động cho phép hệ thống máy xác định và cô lập các đối tượng quan sát thành một đầu vào sáng tạo, nơi người dùng ‘vẽ’ một bản đồ phân đoạn ngữ nghĩa giả và hệ thống tạo ra hình ảnh phù hợp với các mối quan hệ nó hiểu từ việc phân loại và phân đoạn một miền cụ thể, chẳng hạn như phong cảnh.

Một khuôn khổ học máy áp dụng phân đoạn ngữ nghĩa cho các cảnh ngoài trời khác nhau, cung cấp mô hình kiến trúc cho phép phát triển các hệ thống tương tác, nơi người dùng vẽ một khối phân đoạn ngữ nghĩa và hệ thống điền vào khối với hình ảnh phù hợp từ một tập dữ liệu cụ thể, chẳng hạn như tập dữ liệu xem phố Mapillary của Đức, được sử dụng trong bản demo kết xuất neural GTA5 của Intel. Nguồn: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Một khuôn khổ học máy áp dụng phân đoạn ngữ nghĩa cho các cảnh ngoài trời khác nhau, cung cấp mô hình kiến trúc cho phép phát triển các hệ thống tương tác, nơi người dùng vẽ một khối phân đoạn ngữ nghĩa và hệ thống điền vào khối với hình ảnh phù hợp từ một tập dữ liệu cụ thể, chẳng hạn như tập dữ liệu xem phố Mapillary của Đức, được sử dụng trong bản demo kết xuất neural GTA5 của Intel. Nguồn: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Các hệ thống tổng hợp hình ảnh từ các bộ dữ liệu đôi hoạt động bằng cách liên kết các nhãn ngữ nghĩa trên hai tập dữ liệu: một tập dữ liệu hình ảnh phong phú và đầy đủ, được tạo ra từ hình ảnh thế giới thực (như tập dữ liệu Mapillary được sử dụng để tăng cường GTA5 trong bản demo của Intel) hoặc từ hình ảnh tổng hợp, chẳng hạn như hình ảnh CGI.

Ví dụ về các bộ dữ liệu đôi cho một hệ thống tổng hợp hình ảnh được thiết kế để tạo ra các nhân vật kết xuất neural từ các bản phác thảo vụng về. Bên trái, mẫu từ tập dữ liệu CGI. Giữa, mẫu tương ứng từ tập dữ liệu 'phác thảo'. Bên phải, kết xuất neural đã dịch các bản phác thảo trở lại thành hình ảnh chất lượng cao.

Ví dụ về các bộ dữ liệu đôi cho một hệ thống tổng hợp hình ảnh được thiết kế để tạo ra các nhân vật kết xuất neural từ các bản phác thảo vụng về. Bên trái, mẫu từ tập dữ liệu CGI. Giữa, mẫu tương ứng từ tập dữ liệu ‘phác thảo’. Bên phải, kết xuất neural đã dịch các bản phác thảo trở lại thành hình ảnh chất lượng cao. Nguồn: https://www.youtube.com/watch?v=miLIwQ7yPkA

Môi trường ngoài trời tương đối không thách thức khi tạo ra các biến đổi tập dữ liệu đôi như vậy, vì các突出 thường khá hạn chế, địa hình có một phạm vi biến thể hạn chế có thể được ghi lại toàn diện trong một tập dữ liệu, và chúng ta không phải tạo ra các nhân vật giả hoặc đàm phán Thung lũng kỳ lạ (chưa).

Đảo Chiều Phân Đoạn

Google đã phát triển một phiên bản hoạt hình của lược đồ GauGAN, gọi là Infinite Nature, có khả năng ‘ảo giác’ liên tục và không ngừng các phong cảnh giả tưởng bằng cách dịch các bản đồ phân đoạn ngữ nghĩa giả thành hình ảnh thực tế thông qua hệ thống điền SPADE của NVIDIA:

Nguồn: https://www.youtube.com/watch?v=oXUf6anNAtc

Nguồn: https://www.youtube.com/watch?v=oXUf6anNAtc

Tuy nhiên, Infinite Nature sử dụng một hình ảnh đơn giản làm điểm khởi đầu và sử dụng SPADE chỉ để sơn vào các phần còn thiếu trong các khung hình liên tiếp, trong khi SPADE tự tạo ra các biến đổi hình ảnh trực tiếp từ các bản đồ phân đoạn.

Nguồn: https://nvlabs.github.io/SPADE/

Nguồn: https://nvlabs.github.io/SPADE/

Đây là khả năng dường như đã khuấy động những người hâm mộ hệ thống tăng cường hình ảnh của Intel – khả năng có được hình ảnh thực tế chất lượng cao, thậm chí trong thời gian thực (someday), từ đầu vào rất thô.

Thay Thế Kết Texture Và Ánh Sáng Bằng Kết Xuất Neural

Trong trường hợp đầu vào GTA5, một số người đã thắc mắc liệu bất kỳ phần nào của việc kết texture và ánh sáng thủ tục và bitmap từ đầu ra của động cơ trò chơi có thực sự cần thiết trong các hệ thống kết xuất neural trong tương lai, hay liệu có thể biến đổi đầu vào cấp dây khung thành video thực tế vượt trội so với khả năng tạo bóng, kết texture và ánh sáng của các động cơ trò chơi, tạo ra các cảnh siêu thực từ ‘đại diện’ đầu vào代理.

Nó có vẻ rõ ràng rằng các khía cạnh của trò chơi như phản xạ, kết texture và các loại chi tiết môi trường khác là nguồn thông tin thiết yếu cho một hệ thống kết xuất neural như được trình diễn bởi Intel. Tuy nhiên, đã qua một số năm kể từ khi mạng lưới UNIT (Mạng lưới dịch hình ảnh không giám sát) của NVIDIA chứng minh rằng chỉ miền là quan trọng, và thậm chí các khía cạnh như ‘ban đêm hoặc ban ngày’基本 là vấn đề được xử lý bởi chuyển đổi phong cách:

Về đầu vào cần thiết, điều này có thể để lại động cơ trò chơi chỉ cần tạo ra hình học cơ bản và mô phỏng vật lý, vì động cơ kết xuất neural có thể sơn lại tất cả các khía cạnh khác bằng cách tổng hợp hình ảnh mong muốn từ tập dữ liệu đã thu thập, sử dụng các bản đồ phân đoạn ngữ nghĩa như một lớp giải thích.

Hệ thống của Intel tăng cường một khung hình hoàn chỉnh và được kết xuất từ GTA5, thêm phân đoạn và bản đồ độ sâu — hai khía cạnh có thể được cung cấp trực tiếp bởi một động cơ trò chơi đơn giản hóa.

Hệ thống của Intel tăng cường một khung hình hoàn chỉnh và được kết xuất từ GTA5, thêm phân đoạn và bản đồ độ sâu — hai khía cạnh có thể được cung cấp trực tiếp bởi một động cơ trò chơi đơn giản hóa. Nguồn: https://www.youtube.com/watch?v=P1IcaBn3ej0

Phương pháp kết xuất neural của Intel liên quan đến việc phân tích các khung hình hoàn chỉnh được kết xuất từ các bộ đệm GTA5, và hệ thống neural có gánh nặng bổ sung của việc tạo ra cả bản đồ độ sâu và bản đồ phân đoạn. Vì bản đồ độ sâu ngầm có sẵn trong các đường ống 3D truyền thống (và ít đòi hỏi hơn để tạo ra so với kết texture, tia nắng hoặc chiếu sáng toàn cầu), có thể là một cách sử dụng tài nguyên tốt hơn để để động cơ trò chơi xử lý chúng.

Đầu Vào Đơn Giản Hóa Cho Một Động Cơ Kết Xuất Neural

Việc thực hiện hiện tại của mạng lưới tăng cường hình ảnh của Intel do đó có thể liên quan đến rất nhiều chu kỳ tính toán dư thừa, vì động cơ trò chơi tạo ra kết texture và ánh sáng tốn kém về mặt tính toán mà động cơ kết xuất neural không thực sự cần. Hệ thống dường như được thiết kế theo cách này không phải vì đây là một cách tiếp cận tối ưu, mà vì nó dễ dàng hơn để thích nghi một động cơ kết xuất neural với một đường ống hiện có hơn là tạo ra một động cơ trò chơi mới được tối ưu hóa cho một cách tiếp cận kết xuất neural.

Sử dụng tài nguyên tiết kiệm nhất trong một hệ thống trò chơi như vậy có thể là việc động cơ kết xuất neural chiếm toàn bộ GPU, với đầu vào代理 đơn giản hóa được xử lý bởi CPU.

Hơn nữa, động cơ trò chơi có thể dễ dàng tạo ra các bản đồ phân đoạn đại diện cho chính nó, bằng cách tắt tất cả bóng và ánh sáng trong đầu ra của nó. Ngoài ra, nó có thể cung cấp video ở độ phân giải thấp hơn nhiều so với bình thường, vì video chỉ cần đại diện rộng rãi cho nội dung, với chi tiết độ phân giải cao được xử lý bởi động cơ neural, giúp giải phóng thêm tài nguyên tính toán cục bộ.

Công Việc Trước Đó Của Intel ISL Với Phân Đoạn>Sang Hình Ảnh

Việc dịch trực tiếp phân đoạn sang video thực tế không còn là giả thuyết. Năm 2017, Intel ISL, những người tạo ra cơn sốt ngày hôm qua, đã phát hành nghiên cứu ban đầu nghiên cứu có khả năng thực hiện tổng hợp video đô thị trực tiếp từ phân đoạn ngữ nghĩa.

Intel ISL - phân đoạn sang hình ảnh

Intel ISL – phân đoạn sang hình ảnh từ năm 2017. Nguồn: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

Hiệu quả là đường ống ban đầu năm 2017 đã được mở rộng để phù hợp với đầu ra hoàn chỉnh được kết xuất của GTA5.

Kết Xuất Neural Trong VFX

Kết xuất neural từ các bản đồ phân đoạn giả cũng dường như là một công nghệ đầy hứa hẹn cho VFX, với khả năng dịch trực tiếp các videogram cơ bản thành footage hiệu ứng hình ảnh hoàn thành, bằng cách tạo ra các tập dữ liệu cụ thể cho miền từ các mô hình hoặc hình ảnh tổng hợp (CGI).

Một hệ thống kết xuất neural giả định, nơi mỗi đối tượng mục tiêu được trừu tượng hóa thành một tập dữ liệu đóng góp, và nơi các bản đồ phân đoạn giả được tạo ra được sử dụng làm cơ sở cho đầu ra thực tế độ phân giải đầy đủ. Nguồn: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Một hệ thống kết xuất neural giả định, nơi mỗi đối tượng mục tiêu được trừu tượng hóa thành một tập dữ liệu đóng góp, và nơi các bản đồ phân đoạn giả được tạo ra được sử dụng làm cơ sở cho đầu ra thực tế độ phân giải đầy đủ. Nguồn: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Sự phát triển và áp dụng các hệ thống như vậy sẽ thay đổi trọng tâm của nỗ lực nghệ thuật từ một quy trình giải thích sang một quy trình đại diện, và nâng cao việc thu thập dữ liệu theo miền từ một vai trò hỗ trợ sang một vai trò trung tâm trong nghệ thuật hình ảnh.

Bài viết được cập nhật 4:55pm để thêm thông tin về nghiên cứu của Intel ISL năm 2017.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]