Góc nhìn Anderson

Tạo Mạng Lưới Đối Thủ Generative Tùy Chỉnh Với Phác Họa

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu từ Đại học Carnegie Mellon và MIT đã phát triển một phương pháp mới cho phép người dùng tạo ra hệ thống tạo ảnh tùy chỉnh bằng cách phác họa những nét vẽ gợi ý.

Một hệ thống như vậy có thể cho phép người dùng cuối tạo ra các hệ thống tạo ảnh có khả năng tạo ra những hình ảnh rất cụ thể, chẳng hạn như các loài động vật, loại tòa nhà – và thậm chí cả những người cụ thể. Hiện tại, hầu hết các hệ thống tạo ảnh dựa trên GAN đều tạo ra đầu ra rộng và khá ngẫu nhiên, với khả năng hạn chế để chỉ định các đặc điểm cụ thể, chẳng hạn như giống loài động vật, loại tóc của con người, phong cách kiến trúc hoặc danh tính khuôn mặt thực sự.

Phương pháp này, được mô tả trong bài báo Phác Họa GAN Của Bạn, sử dụng một giao diện phác họa mới như một chức năng ‘tìm kiếm’ hiệu quả để tìm các tính năng và lớp trong các cơ sở dữ liệu hình ảnh quá đầy, có thể chứa hàng nghìn loại đối tượng, bao gồm nhiều lớp con không liên quan đến ý định của người dùng. GAN sau đó được đào tạo trên tập hợp con của hình ảnh này.

Bằng cách phác họa loại đối tượng cụ thể mà người dùng muốn hiệu chỉnh GAN, khả năng tạo ra của khuôn khổ trở nên chuyên môn hóa cho lớp đó. Ví dụ, nếu người dùng muốn tạo ra một khuôn khổ tạo ra một loại mèo cụ thể (thay vì chỉ bất kỳ mèo nào, như có thể được lấy từ This Cat Does Not Exist), các bản phác họa đầu vào của họ sẽ đóng vai trò như một bộ lọc để loại bỏ các lớp không liên quan.

 

Nguồn: https://peterwang512.github.io/GANSketching/

Nguồn: https://peterwang512.github.io/GANSketching/

Nghiên cứu này được dẫn dắt bởi Sheng Yu-Wang của Đại học Carnegie Mellon, cùng với đồng nghiệp Jun-Yan Zhu, và David Bau của Phòng thí nghiệm Khoa học Máy tính và Trí tuệ Nhân tạo của MIT.

Phương pháp này được gọi là ‘phác họa GAN’, và sử dụng các bản phác họa đầu vào để thay đổi trực tiếp trọng số của mô hình GAN ‘mẫu’ để nhắm vào miền hoặc lớp con được xác định thông qua mất mát đối thủ giữa các miền.

Các phương pháp điều chỉnh khác nhau đã được khám phá để đảm bảo rằng đầu ra của mô hình là đa dạng, đồng thời duy trì chất lượng hình ảnh cao. Các nhà nghiên cứu đã tạo ra các ứng dụng mẫu có thể nội suy không gian tiềm ẩn và thực hiện các thủ tục chỉnh sửa hình ảnh.

Này [$class] Không Tồn Tại

Các hệ thống tạo ảnh dựa trên GAN đã trở thành một hiện tượng, nếu không phải là một meme, trong những năm gần đây, với sự phổ biến của các dự án có khả năng tạo ra hình ảnh của những thứ không tồn tại, bao gồm cả người, căn hộ cho thuê, món ăn, chân, ngựa, chính trị gia và côn trùng, trong số nhiều thứ khác.

Các hệ thống tổng hợp ảnh dựa trên GAN được tạo ra bằng cách biên dịch hoặc thu thập các tập dữ liệu rộng lớn chứa hình ảnh từ miền mục tiêu, chẳng hạn như khuôn mặt hoặc ngựa; đào tạo các mô hình tổng quát hóa một loạt các tính năng trên hình ảnh trong cơ sở dữ liệu; và thực hiện các mô-đun tạo ra có thể xuất ra các ví dụ ngẫu nhiên dựa trên các tính năng đã học.

Đầu ra từ các bản phác họa trong DeepFacePencil, cho phép người dùng tạo ra khuôn mặt photorealistic từ các bản phác họa. Nhiều dự án tương tự tồn tại. Nguồn: https://arxiv.org/pdf/2008.13343.pdf

Đầu ra từ các bản phác họa trong DeepFacePencil, cho phép người dùng tạo ra khuôn mặt photorealistic từ các bản phác họa. Nhiều dự án tương tự tồn tại. Nguồn: https://arxiv.org/pdf/2008.13343.pdf

Các tính năng đa chiều là những tính năng đầu tiên được cụ thể hóa trong quá trình đào tạo, và tương đương với những nét vẽ đầu tiên của một họa sĩ trên canvas. Những tính năng đa chiều này sẽ cuối cùng tương quan với các tính năng chi tiết hơn (ví dụ, ánh mắt và râu sắc của một con mèo, thay vì chỉ một khối màu be đơn giản đại diện cho đầu).

Tôi Biết Bạn Có Nghĩa Là…

Bằng cách ánh xạ mối quan hệ giữa những hình dạng ban đầu này và các diễn giải chi tiết cuối cùng được thu được nhiều sau đó trong quá trình đào tạo, có thể suy ra mối quan hệ giữa ‘mờ’ và ‘cụ thể’ hình ảnh, cho phép người dùng tạo ra hình ảnh phức tạp và photorealistic từ những nét vẽ thô.

Gần đây, NVIDIA đã phát hành một phiên bản máy tính để bàn của nghiên cứu GauGAN dài hạn về tạo cảnh quan dựa trên GAN, dễ dàng chứng minh nguyên tắc này:

Các nét vẽ gần đúng được chuyển thành hình ảnh phong cảnh phong phú thông qua GauGAN của NVIDIA, và bây giờ ứng dụng Canvas của NVIDIA. Nguồn: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Các nét vẽ gần đúng được chuyển thành hình ảnh phong cảnh phong phú thông qua GauGAN của NVIDIA, và bây giờ ứng dụng Canvas của NVIDIA. Nguồn: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Tương tự, nhiều hệ thống như DeepFacePencil đã sử dụng cùng một nguyên tắc để tạo ra các bộ tạo ảnh photorealistic từ các bản phác họa cho các miền khác nhau.

Cấu trúc của DeepFacePencil.

Cấu trúc của DeepFacePencil.

Làm Phổ Biến Phác Họa-Sang-Hình Ảnh

Phương pháp GAN Sketching mới này nhằm mục đích loại bỏ gánh nặng đáng kể của việc thu thập và chỉnh sửa dữ liệu thường liên quan đến việc phát triển các khuôn khổ tạo ảnh dựa trên GAN, bằng cách sử dụng đầu vào của người dùng để xác định tập hợp con của hình ảnh nên cấu thành dữ liệu đào tạo.

Hệ thống này được thiết kế để yêu cầu chỉ một số nhỏ các bản phác họa đầu vào để hiệu chỉnh khuôn khổ. Hệ thống này thực sự đảo ngược chức năng của PhotoSketch, một sáng kiến nghiên cứu chung từ năm 2019 bởi các nhà nghiên cứu từ Carnegie Mellon, Adobe, Uber ATG và Argo AI, được tích hợp vào công việc mới. PhotoSketch được thiết kế để tạo ra các bản phác họa nghệ thuật từ hình ảnh, và đã chứa ánh xạ hiệu quả của mối quan hệ tạo hình ảnh ‘mờ’ > ‘cụ thể’.

Đối với phần tạo ra của quá trình, phương pháp mới chỉ sửa đổi trọng số của StyleGAN2. Vì dữ liệu hình ảnh được sử dụng chỉ là một tập hợp con của dữ liệu có sẵn, việc chỉ sửa đổi mạng ánh xạ sẽ thu được kết quả mong muốn.

Phương pháp này đã được đánh giá trên một số miền con phổ biến, bao gồm ngựa, nhà thờ và mèo.

Tập dữ liệu LSUN của Đại học Princeton năm 2016 đã được sử dụng làm tài liệu cốt lõi để suy dẫn các miền con mục tiêu. Để thiết lập một hệ thống ánh xạ phác họa mạnh mẽ đối với các đặc điểm của đầu vào phác họa của người dùng, hệ thống được đào tạo trên hình ảnh từ tập dữ liệu QuickDraw được phát triển bởi Microsoft giữa năm 2021-2016.

Mặc dù ánh xạ phác họa giữa PhotoSketch và QuickDraw khá khác nhau, các nhà nghiên cứu đã tìm thấy rằng khuôn khổ của họ thành công tốt trong việc bắc cầu giữa chúng một cách dễ dàng trên các tư thế đơn giản, mặc dù các tư thế phức tạp hơn (chẳng hạn như mèo nằm xuống) chứng minh là một thách thức hơn, trong khi đầu vào phác họa trừu tượng (ví dụ, các bản vẽ quá thô) cũng cản trở chất lượng của kết quả.

Không Gian Tiềm Ẩn và Chỉnh Sửa Hình Ảnh Tự Nhiên

Các nhà nghiên cứu đã phát triển hai ứng dụng dựa trên công việc cốt lõi: chỉnh sửa không gian tiềm ẩn và chỉnh sửa hình ảnh. Chỉnh sửa không gian tiềm ẩn cung cấp các điều khiển người dùng có thể giải thích được tại thời điểm đào tạo, và cho phép một mức độ biến thể rộng trong khi vẫn trung thành với miền mục tiêu và nhất quán trên các biến thể.

Sự nội suy không gian tiềm ẩn mịn với các mô hình tùy chỉnh của GAN Sketching.

Sự nội suy không gian tiềm ẩn mịn với các mô hình tùy chỉnh của GAN Sketching.

Thành phần chỉnh sửa không gian tiềm ẩn được cung cấp bởi dự án GANSpace năm 2020, một sáng kiến chung từ Đại học Aalto, Adobe và NVIDIA.

Một hình ảnh duy nhất cũng có thể được đưa vào mô hình tùy chỉnh, giúp việc chỉnh sửa hình ảnh tự nhiên. Trong ứng dụng này, một hình ảnh duy nhất được đưa vào mô hình GAN tùy chỉnh, không chỉ cho phép chỉnh sửa trực tiếp mà còn bảo tồn việc chỉnh sửa không gian tiềm ẩn ở mức cao hơn, nếu điều này cũng được sử dụng.

Ở đây, một hình ảnh thực đã được sử dụng làm đầu vào cho GAN (mô hình mèo), chỉnh sửa đầu vào để phù hợp với các bản phác họa được gửi. Điều này cho phép chỉnh sửa hình ảnh thông qua phác họa.

Ở đây, một hình ảnh thực đã được sử dụng làm đầu vào cho GAN (mô hình mèo), chỉnh sửa đầu vào để phù hợp với các bản phác họa được gửi. Điều này cho phép chỉnh sửa hình ảnh thông qua phác họa.

Mặc dù có thể cấu hình, hệ thống này không được thiết kế để hoạt động trong thời gian thực, ít nhất là về đào tạo và hiệu chỉnh. Hiện tại, GAN Sketching yêu cầu 30.000 lần lặp đào tạo. Hệ thống cũng yêu cầu quyền truy cập vào dữ liệu đào tạo ban đầu cho mô hình ban đầu.

Trong các trường hợp dữ liệu tập hợp là nguồn mở và có giấy phép cho phép sao chép cục bộ, điều này có thể được thực hiện bằng cách bao gồm dữ liệu nguồn trong một gói cục bộ được cài đặt, mặc dù điều này sẽ chiếm một lượng không gian đĩa đáng kể; hoặc bằng cách truy cập hoặc xử lý dữ liệu từ xa, thông qua một phương pháp dựa trên đám mây, điều này sẽ giới thiệu các chi phí mạng và (trong trường hợp xử lý thực sự xảy ra trên đám mây) có thể có các yếu tố chi phí tính toán.

Các biến đổi từ các mô hình FFHQ tùy chỉnh được đào tạo trên chỉ 4 bản phác họa được tạo bởi con người.

Các biến đổi từ các mô hình FFHQ tùy chỉnh được đào tạo trên chỉ 4 bản phác họa được tạo bởi con người.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai