Góc nhìn Anderson

Điều khiển Tổng hợp Khuôn mặt với Phân đoạn Nghĩa

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vấn đề với việc tạo ra khuôn mặt con người bằng mạng đối lập sinh (GAN) là dữ liệu thế giới thực cung cấp hình ảnh giả đến với các phụ kiện không mong muốn và không thể tách rời, chẳng hạn như tóc trên đầu (và / hoặc khuôn mặt), nền và các loại đồ trang trí khuôn mặt khác nhau, chẳng hạn như kính, mũ và vòng tai; và những khía cạnh ngoại vi của tính cách này cuối cùng sẽ gắn liền với một ‘hồ sơ’ nhất định.

Dưới các kiến trúc GAN phổ biến nhất, những yếu tố này không được giải quyết trong không gian riêng của chúng, mà thường gắn rất chặt với khuôn mặt trong (hoặc xung quanh) mà chúng được nhúng.

Không phải lúc nào cũng có thể chỉ định hoặc ảnh hưởng đến ngoại hình của các ‘phần’ của khuôn mặt được tạo bởi GAN, chẳng hạn như thu hẹp mắt, kéo dài mũi hoặc thay đổi màu tóc theo cách mà một nghệ sĩ phác thảo cảnh sát có thể.

Tuy nhiên, lĩnh vực nghiên cứu tổng hợp hình ảnh đang làm việc trên nó:

Nghiên cứu mới về tạo khuôn mặt dựa trên GAN đã tách các phần khác nhau của khuôn mặt thành các khu vực riêng biệt, mỗi khu vực có 'trình tạo' riêng, hoạt động cùng với các trình tạo khác cho hình ảnh. Ở hàng giữa, chúng ta thấy 'bản đồ tính năng' điều khiển xây dựng các khu vực bổ sung của khuôn mặt. Nguồn: https://arxiv.org/pdf/2112.02236.pdf

Nghiên cứu mới về tạo khuôn mặt dựa trên GAN đã tách các phần khác nhau của khuôn mặt thành các khu vực riêng biệt, mỗi khu vực có ‘trình tạo’ riêng, hoạt động cùng với các trình tạo khác cho hình ảnh. Ở hàng giữa, chúng ta thấy ‘bản đồ tính năng’ điều khiển xây dựng các khu vực bổ sung của khuôn mặt. Nguồn: https://arxiv.org/pdf/2112.02236.pdf

Trong một bài báo, các nhà nghiên cứu từ chi nhánh Mỹ của công ty công nghệ đa quốc gia ByteDance đã sử dụng phân đoạn ngữ nghĩa để tách các phần cấu thành của khuôn mặt thành các phần riêng biệt, mỗi phần được phân配 một trình tạo riêng, để có thể đạt được mức độ ‘phân tách’ cao hơn. Hoặc, ít nhất, phân tách nhận thức.

Bài báo này có tiêu đề SemanticStyleGAN: Học các Priors Sinh tổng hợp Kết hợp cho Tổng hợp và Chỉnh sửa Hình ảnh Có thể Kiểm soát, và đi kèm với một trang dự án đa phương tiện trang dự án có nhiều ví dụ về các biến đổi tinh tế có thể đạt được khi các yếu tố khuôn mặt và đầu được cách ly theo cách này.

Văn bản khuôn mặt, kiểu tóc và màu tóc, hình dạng và màu mắt, và nhiều khía cạnh khác của các tính năng được tạo bởi GAN trước đây không thể tách rời, giờ có thể được tách rời, mặc dù chất lượng tách và mức độ điều khiển có thể khác nhau giữa các trường hợp. Nguồn: https://semanticstylegan.github.io/

Văn bản khuôn mặt, kiểu tóc và màu tóc, hình dạng và màu mắt, và nhiều khía cạnh khác của các tính năng được tạo bởi GAN trước đây không thể tách rời, giờ có thể được tách rời, mặc dù chất lượng tách và mức độ điều khiển có thể khác nhau giữa các trường hợp. Nguồn: https://semanticstylegan.github.io/

Không gian Latent Không thể Kiểm soát

Một Mạng đối lập sinh được đào tạo để tạo khuôn mặt – chẳng hạn như StyleGan2 trình tạo powers trang web phổ biến này không tồn tại – tạo ra các mối quan hệ phức tạp giữa các ‘tính năng’ (không phải trong ý nghĩa khuôn mặt) mà nó suy ra từ việc phân tích hàng nghìn khuôn mặt thế giới thực, để học cách tạo ra khuôn mặt người thực tế.

Các quá trình bí mật này là ‘mã latent’, tập thể là không gian latent. Chúng khó phân tích và do đó khó kiểm soát.

Tuần trước, một dự án tổng hợp hình ảnh mới khác đã xuất hiện, nhằm ‘lập bản đồ’ không gian này trong quá trình đào tạo và sau đó sử dụng các bản đồ để điều hướng nó một cách tương tác, và các giải pháp khác đã được đề xuất để đạt được sự kiểm soát sâu hơn đối với nội dung được tổng hợp bởi GAN.

Một số tiến bộ đã được thực hiện, với một loạt các kiến trúc GAN cố gắng ‘tiếp cận’ không gian latent theo một cách nào đó và kiểm soát sự tạo khuôn mặt từ đó. Những nỗ lực này bao gồm InterFaceGAN, StyleFlow, GANSpace, và StyleRig, trong số các bài báo mới khác.

Tất cả chúng đều có điểm chung là mức độ phân tách hạn chế; các thanh trượt GUI thông minh cho các khía cạnh khác nhau (chẳng hạn như ‘tóc’ hoặc ‘biểu cảm’) có xu hướng kéo nền và / hoặc các yếu tố khác vào quá trình biến đổi, và không có giải pháp nào (bao gồm cả bài báo được thảo luận ở đây) đã giải quyết được vấn đề về tóc thần kinh thời gian.

Chia và Chinh phục Không gian Latent

Trong mọi trường hợp, nghiên cứu của ByteDance tiếp cận theo cách khác: thay vì cố gắng khám phá những bí ẩn của một GAN hoạt động trên toàn bộ hình ảnh khuôn mặt được tạo, SemanticStyleGAN đề xuất một cách tiếp cận dựa trên bố cục, nơi khuôn mặt được ‘tổng hợp’ bởi các quá trình tạo riêng biệt.

Để đạt được sự khác biệt của các tính năng (khuôn mặt), SemanticStyleGAN sử dụng Fourier Features để tạo một bản đồ phân đoạn ngữ nghĩa (phân biệt thô về địa hình khuôn mặt, hiển thị ở phía dưới bên phải của hình ảnh dưới đây) để cách ly các khu vực khuôn mặt sẽ nhận được sự chú ý chuyên dụng.

Kiến trúc của cách tiếp cận mới, đặt một lớp trung gian của phân đoạn ngữ nghĩa lên khuôn mặt, hiệu quả biến khuôn khổ thành một trình điều khiển của nhiều trình tạo cho các khía cạnh khác nhau của hình ảnh.

Kiến trúc của cách tiếp cận mới, đặt một lớp trung gian của phân đoạn ngữ nghĩa lên khuôn mặt, hiệu quả biến khuôn khổ thành một trình điều khiển của nhiều trình tạo cho các khía cạnh khác nhau của hình ảnh.

Các bản đồ phân đoạn được tạo cho các hình ảnh giả được trình bày một cách hệ thống cho bộ phân loại GAN để đánh giá khi mô hình được cải thiện, và cho các hình ảnh nguồn (không phải giả) được sử dụng để đào tạo.

Vào đầu quá trình, một Multi-Layer Perceptron (MLP) ban đầu ánh xạ các mã latent ngẫu nhiên, sau đó sẽ được sử dụng để kiểm soát trọng số của nhiều trình tạo sẽ mỗi trình tạo sẽ kiểm soát một phần của hình ảnh khuôn mặt sẽ được tạo.

Mỗi trình tạo tạo một bản đồ tính năng và một bản đồ độ sâu mô phỏng từ các tính năng Fourier được cung cấp cho nó ở phía上. Đầu ra này là cơ sở cho các mặt nạ phân đoạn.

Mạng lưới kết xuất phía dưới chỉ được điều kiện bởi các bản đồ tính năng trước đó, và bây giờ biết cách tạo một mặt nạ phân đoạn độ phân giải cao hơn, tạo điều kiện cho việc sản xuất cuối cùng của hình ảnh.

Cuối cùng, một bộ phân loại phân nhánh giám sát sự phân phối kết hợp của cả hình ảnh RGB (đối với chúng tôi, kết quả cuối cùng) và các mặt nạ phân đoạn đã cho phép chúng được tách rời.

Với SemanticStyleGAN, không có sự xáo trộn thị giác không mong muốn khi ‘điều chỉnh’ các tính năng khuôn mặt, vì mỗi tính năng khuôn mặt đã được đào tạo riêng trong khuôn khổ điều khiển.

Thay thế Nền

Vì ý định của dự án là đạt được sự kiểm soát lớn hơn đối với môi trường được tạo, quá trình kết xuất / tổng hợp bao gồm một trình tạo nền được đào tạo trên hình ảnh thực.

Một lý do thuyết phục tại sao các nền không bị kéo vào các thao túng khuôn mặt trong SemanticStyleGAN là chúng nằm trên một lớp xa hơn, và hoàn chỉnh, mặc dù có thể bị che khuất một phần bởi các khuôn mặt được chồng lên.

Một lý do thuyết phục tại sao các nền không bị kéo vào các thao túng khuôn mặt trong SemanticStyleGAN là chúng nằm trên một lớp xa hơn, và hoàn chỉnh, mặc dù có thể bị che khuất một phần bởi các khuôn mặt được chồng lên.

Vì các bản đồ phân đoạn sẽ dẫn đến các khuôn mặt không có nền, những ‘nền thả’ này không chỉ cung cấp ngữ cảnh, mà còn được cấu hình để phù hợp, về mặt ánh sáng, cho các khuôn mặt chồng lên.

Đào tạo và Dữ liệu

Các mô hình ‘thực tế’ được đào tạo trên 28.000 hình ảnh đầu tiên trong CelebAMask-HQ, được thay đổi kích thước thành 256×256 pixel để phù hợp với không gian đào tạo (tức là VRAM có sẵn, điều này quyết định kích thước lô tối đa mỗi lần lặp lại).

Một số mô hình đã được đào tạo, và các công cụ, tập dữ liệu và kiến trúc khác nhau đã được thử nghiệm trong quá trình phát triển và các thử nghiệm ablation khác nhau. Mô hình sản xuất lớn nhất của dự án có độ phân giải 512×512, được đào tạo trong 2,5 ngày trên tám GPU NVIDIA Tesla V100. Sau khi đào tạo, việc tạo một hình ảnh đơn lẻ mất 0,137 giây trên một GPU lobe mà không cần song song hóa.

Các thí nghiệm theo phong cách hoạt hình / anime được trình diễn trong nhiều video trên trang dự án (xem liên kết trên) được dẫn xuất từ các tập dữ liệu khuôn mặt phổ biến khác nhau, bao gồm Toonify, MetFaces, và Bitmoji.

Giải pháp Tạm thời?

Các tác giả cho rằng không có lý do gì tại sao SemanticStyleGAN không thể được áp dụng cho các lĩnh vực khác, chẳng hạn như phong cảnh, xe hơi, nhà thờ và tất cả các lĩnh vực kiểm tra mặc định khác mà các kiến trúc mới thường được đưa vào sớm trong sự nghiệp của chúng.

Tuy nhiên, bài báo thừa nhận rằng khi số lượng lớp tăng cho một lĩnh vực (chẳng hạn như ‘xe’, ‘‘đèn đường’, ‘người đi bộ’, ‘tòa nhà’, ‘xe’ v.v.), cách tiếp cận này có thể trở nên không thể thực hiện được theo nhiều cách, mà không cần tối ưu hóa thêm. Tập dữ liệu CityScapes đô thị, ví dụ, có 30 lớp trên 8 loại.

Khó nói liệu sự quan tâm hiện tại trong việc chinh phục không gian latent một cách trực tiếp có phải là một nhiệm vụ không thể thực hiện được như thuật giả kim; hoặc liệu các mã latent cuối cùng sẽ có thể được giải mã và kiểm soát – một sự phát triển có thể làm cho cách tiếp cận ‘phức tạp hơn’ này trở nên thừa.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai