Góc nhìn Anderson

Phẫu thuật thẩm mỹ cho khuôn mặt được tạo bởi GAN

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Improvements in synthetically generated (GAN) images

Nghiên cứu mới nghiên cứu từ Hàn Quốc hứa hẹn sẽ cải thiện chất lượng dữ liệu khuôn mặt tổng hợp được tạo bởi Mạng Đối kháng Generative (GAN).

Hệ thống này có khả năng xác định các artifact hình ảnh được tạo ra bởi quá trình GAN và sửa chữa chúng, thậm chí đến mức thay thế tóc bị che bởi mũ, thay thế các phần khuôn mặt bị thiếu trong bản gốc và loại bỏ các vật cản như tay và kính râm, và cũng hoạt động tốt trên đầu ra cảnh quan và kiến trúc.

GAN correction

Bên trái của mỗi cột, đầu ra GAN ban đầu với các khuyết tật, tiếp theo là hai phương pháp khác để sửa chữa các artifact, và cuối cùng là phương pháp được sử dụng bởi các nhà nghiên cứu Hàn Quốc. Nguồn: https://arxiv.org/pdf/2104.06118.pdf

Phần lớn các phương pháp gần đây để cải thiện chất lượng hình ảnh được tạo bởi GAN đã cho rằng các artifact là một rủi ro nghề nghiệp của quá trình, coi phương pháp này như một ‘lực lượng tự nhiên’, và các kết quả kỳ lạ hoặc bất thường mà nó có thể tạo ra là một sản phẩm phụ không thể tránh khỏi.

Thay vào đó, nghiên cứu của Hàn Quốc đề xuất việc ‘sửa chữa’ các hình ảnh bị ảnh hưởng theo cách không can thiệp vào chuỗi tạo sinh tiếp theo, bằng cách xác định các khía cạnh gây ra các artifact và giảm hoặc loại bỏ ảnh hưởng của chúng trong mạng GAN ở mức bán giám sát vượt quá và mở rộng các cơ chế tự sửa chữa bản địa trong kiến trúc GAN.

Để thực hiện dự án, cần phải tạo một tập dữ liệu rộng lớn được gắn nhãn tay của các hình ảnh bị ảnh hưởng nặng nề bởi các artifact GAN. Ban đầu, các nhà nghiên cứu sử dụng Frechet Inception Distance (FID), một metric đánh giá chất lượng đầu ra GAN bằng cách so sánh các tính năng trong hình ảnh, như một đơn vị đủ điều kiện. 10.000 hình ảnh có điểm FID cao nhất trong số 200.000 hình ảnh được sử dụng như các ‘đơn vị artifact’ riêng biệt. Sau đó, các nhà nghiên cứu gắn nhãn tay 2.000 hình ảnh được tạo, phân loại mỗi hình ảnh là ‘bình thường’ hoặc bị ảnh hưởng bởi artifact FID. Sau đó, một mô hình được tạo để phân loại tập dữ liệu thành artifact, bình thường và mẫu thực tế ngẫu nhiên.

Sau đó, Gradient-weighted Class Activation Mapping (Grad-CAM) được sử dụng để tạo các mặt nạ cho các vùng bị ảnh hưởng bởi artifact, hiệu quả tự động hóa việc gắn nhãn các khuyết tật.

Grad-CAM masks

Trong hình ảnh trên, các mặt nạ Grad-CAM đã được áp dụng cho đầu ra từ LSUN-Church outdoor dataset và CelebA-HQ dataset.

Bằng cách phân tích 20 kết quả bị ảnh hưởng nhiều nhất từ 20.000 hình ảnh, các mặt nạ phân đoạn được tạo ra, vào đó các kết quả đại diện cho các khu vực (những kết quả này có thể chính xác hoặc thuyết phục hơn các artifact) có thể được thay thế bằng cách giảm hoạt động của các đơn vị tạo ra artifact trong các thế hệ tiếp theo.

Đánh giá của con người về các sửa chữa đã dẫn đến 53% hình ảnh ‘sửa chữa’ được gắn nhãn là ‘bình thường’, trong khi 97% hình ảnh ban đầu vẫn cho thấy sự cải thiện đáng kể so với bản gốc.

Các nhà nghiên cứu cho rằng phương pháp này, với một số điều chỉnh nhỏ, cũng có thể được áp dụng cho StyleGAN2 của NVIDIA.

GAN glasses removal

Lợi ích của Dữ liệu Tổng hợp

Chủ yếu liên quan đến dữ liệu khuôn mặt, sự khan hiếm của các tập dữ liệu thế giới thực cho thị giác máy tính là một chướng ngại vật đối với nghiên cứu đa dạng trong các lĩnh vực nghiên cứu quan trọng như nhận dạng khuôn mặt, nhận dạng cảm xúc, nghiên cứu y tế và nghiên cứu về phân khúc topo của khuôn mặt, trong số các lĩnh vực khác.

Sự phản ứng lại việc sử dụng miễn phí dữ liệu trên web và việc thu thập tự phát hình ảnh khuôn mặt thế giới thực để đưa vào cơ sở dữ liệu khuôn mặt là một chướng ngại vật bổ sung đối với nghiên cứu, với số lượng ngày càng tăng các quốc gia và quốc gia đánh dấu trên web-scraping và việc sử dụng hình ảnh trên mạng xã hội cho các mục đích này.

Trong 10 năm qua, một số lượng hạn chế các tập dữ liệu khuôn mặt được quản lý cẩn thận đã cung cấp nơi trú ẩn khỏi sự không chắc chắn này, với các thách thức nghiên cứu công khai hàng năm tập trung vào chúng. Tuy nhiên, điều này đã dẫn đến các dự án nghiên cứu thiên về các phương pháp cụ thể cho các tập dữ liệu này, với kết quả hàng năm nhất quán và có thể so sánh được với chi phí của sự thiếu đa dạng trong tài liệu nguồn – một tình huống trở nên tồi tệ hơn mỗi năm khi nghiên cứu mới giới hạn bản thân trong các giới hạn này.

Ngoài ra, một số tập dữ liệu ‘truyền thống’ này đã đối mặt với sự chỉ trích vì thiếu đa dạng chủng tộc, điều này cho thấy rằng những điểm chuẩn này có thể không được coi là tài nguyên phù hợp trong tương lai gần.

Điều này cho thấy sự cần thiết của dữ liệu khuôn mặt chất lượng cao, thực tế nhưng các hình ảnh ‘thế giới thực’ đóng góp đã được biến đổi vượt quá nhận dạng. Ngay cả khi việc sử dụng dữ liệu khuôn mặt ‘thế giới thực’ ‘một lần’ này có thể tự nó gây ra vấn đề về nguồn gốc của khuôn mặt được tạo bởi GAN, nó là một chướng ngại vật không có khả năng xảy ra cho đến khi các cơ chế pháp lý và kỹ thuật cho việc thu thập dữ liệu này được thiết lập; và, liên quan đến các thay đổi có thể xảy ra trong các khuôn khổ pháp lý xung quanh vấn đề này, nó vẫn là một nguy cơ nhỏ hơn so với việc sử dụng hình ảnh của người thực.

Đọc thêm:

Cải thiện tính thực tế của hình ảnh tổng hợp
Sửa chữa tự động các đơn vị nội bộ trong Mạng nơ-ron sinh

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]