Góc nhìn Anderson

Giả Lập Cơ Thể ‘Tốt Hơn’ Bằng AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới từ Học viện DAMO của Alibaba cung cấp một quy trình làm việc dựa trên AI để tự động hoá việc thay đổi hình dạng các hình ảnh cơ thể – một nỗ lực hiếm hoi trong lĩnh vực thị giác máy tính hiện đang tập trung vào các thao tác dựa trên khuôn mặt như deepfakes và chỉnh sửa khuôn mặt dựa trên GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Chèn trong các cột ‘result’, các bản đồ chú ý được tạo ra xác định các khu vực cần chỉnh sửa. Nguồn: https://arxiv.org/pdf/2203.04670.pdf Nguồn: https://arxiv.org/pdf/2203.04670.pdf

Kiến trúc của các nhà nghiên cứu sử dụng ước lượng tư thế bộ xương để giải quyết độ phức tạp cao hơn mà các hệ thống tổng hợp và chỉnh sửa hình ảnh phải đối mặt khi khái niệm hoá và tham số hoá các hình ảnh cơ thể hiện có, ít nhất ở mức độ chi tiết cho phép chỉnh sửa có ý nghĩa và chọn lọc.

Bản đồ bộ xương ước tính giúp xác định và tập trung chú ý vào các khu vực của cơ thể có khả năng được chỉnh sửa, chẳng hạn như vùng cánh tay trên.

Hệ thống cuối cùng cho phép người dùng đặt các tham số có thể thay đổi ngoại hình về cân nặng, khối lượng cơ bắp hoặc phân bố cân nặng trong các ảnh toàn thân hoặc ảnh trung bình của người, và có khả năng tạo ra các biến đổi tùy ý trên các phần cơ thể có hoặc không có quần áo.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Trái, ảnh đầu vào; giữa, bản đồ nhiệt của các khu vực chú ý được suy ra; phải, ảnh đã biến đổi.

Động lực cho công việc này là phát triển các quy trình tự động có thể thay thế các thao tác kỹ thuật số tốn công sức mà các nhiếp ảnh gia và nghệ sĩ đồ họa sản xuất thực hiện trong các lĩnh vực truyền thông khác nhau, từ thời trang đến sản phẩm kiểu tạp chí và tài liệu quảng cáo.

Nói chung, các tác giả thừa nhận, những biến đổi này thường được áp dụng bằng các kỹ thuật ‘warp’ trong Photoshop và các trình chỉnh sửa bitmap truyền thống khác, và hầu như chỉ được dùng trên hình ảnh của phụ nữ. Do đó, bộ dữ liệu tùy chỉnh được phát triển để hỗ trợ quy trình mới chủ yếu gồm các ảnh của đối tượng nữ:

‘Vì việc chỉnh sửa cơ thể chủ yếu được phụ nữ mong muốn, phần lớn bộ sưu tập của chúng tôi là ảnh nữ, với đa dạng về độ tuổi, chủng tộc (African:Asian:Caucasian = 0.33:0.35:0.32), tư thế và trang phục.’

Bài báo paper có tiêu đề Structure-Aware Flow Generation for Human Body Reshaping, và được viết bởi năm tác giả liên quan đến Học viện DAMO toàn cầu của Alibaba.

Phát Triển Bộ Dữ Liệu

Như thường lệ với các hệ thống tổng hợp và chỉnh sửa hình ảnh, kiến trúc của dự án đòi hỏi một bộ dữ liệu huấn luyện tùy chỉnh. Các tác giả đã thuê ba nhiếp ảnh gia để thực hiện các thao tác Photoshop tiêu chuẩn trên các hình ảnh thích hợp từ trang web ảnh stock Unsplash, tạo ra một bộ dữ liệu – có tiêu đề BR-5K* – gồm 5.000 hình ảnh chất lượng cao ở độ phân giải 2K.

Các nhà nghiên cứu nhấn mạnh rằng mục tiêu của việc huấn luyện trên bộ dữ liệu này không phải để tạo ra các đặc điểm ‘lý tưởng’ và tổng quát liên quan đến chỉ số hấp dẫn hay ngoại hình mong muốn, mà là để trích xuất các ánh xạ đặc trưng trung tâm liên quan đến các thao tác chuyên nghiệp trên hình ảnh cơ thể.

Tuy nhiên, họ thừa nhận rằng các thao tác cuối cùng phản ánh các quá trình biến đổi mô tả một sự chuyển đổi từ ‘thực’ sang khái niệm ‘lý tưởng’ đã được đặt sẵn:

‘Chúng tôi mời ba nghệ sĩ chuyên nghiệp chỉnh sửa cơ thể bằng Photoshop một cách độc lập, với mục tiêu đạt được dáng người thon gọn phù hợp với thẩm mỹ phổ biến, và chọn kết quả tốt nhất làm chuẩn thực tế.’

Vì khung làm việc không xử lý khuôn mặt, các khuôn mặt đã được làm mờ trước khi đưa vào bộ dữ liệu.

Kiến Trúc và Các Khái Niệm Cốt Lõi

Quy trình làm việc của hệ thống bao gồm đưa vào một bức chân dung độ phân giải cao, giảm mẫu xuống độ phân giải thấp hơn để phù hợp với tài nguyên tính toán có sẵn, và trích xuất một tư thế bộ xương ước tính (hình thứ hai từ trái trong hình dưới), cùng với Trường Liên Kết Phần (PAFs), được đổi mới vào năm 2016 bởi Viện Robot học tại Đại học Carnegie Mellon (xem video được nhúng ngay bên dưới).

Trường Liên Kết Phần giúp xác định hướng của các chi và mối liên hệ chung với khung xương rộng hơn, cung cấp cho dự án mới một công cụ chú ý/định vị bổ sung.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Từ bài báo Part Affinity Fields năm 2016, các PAF dự đoán mã hoá hướng của chi như một phần của vector 2D cũng bao gồm vị trí chung của chi. Nguồn: https://arxiv.org/pdf/1611.08050.pdf Nguồn: https://arxiv.org/pdf/1611.08050.pdf

Mặc dù chúng dường như không liên quan tới ngoại hình cân nặng, bản đồ bộ xương vẫn hữu ích trong việc chỉ dẫn các quá trình biến đổi cuối cùng tới các phần của cơ thể cần chỉnh sửa, như cánh tay trên, phần sau và đùi.

Sau đó, kết quả được đưa vào một mô-đun Structure Affinity Self-Attention (SASA) ở phần nút thắt trung tâm của quy trình (xem hình dưới).

SASA điều chỉnh tính nhất quán của bộ tạo luồng (flow generator) cung cấp năng lượng cho quá trình, và kết quả sau đó được chuyển tới mô-đun biến dạng (thứ hai từ phải trong hình trên), mô-đun này áp dụng các biến đổi đã học từ việc huấn luyện trên các chỉnh sửa thủ công có trong bộ dữ liệu.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Mô-đun Structure Affinity Self-Attention (SASA) phân bổ sự chú ý tới các bộ phận cơ thể liên quan, giúp tránh các biến đổi thừa thãi hoặc không liên quan.

Hình ảnh đầu ra sau đó được tăng mẫu lên lại độ phân giải 2K gốc, sử dụng các quy trình tương tự kiến trúc deepfake tiêu chuẩn năm 2017 mà các gói phần mềm phổ biến như DeepFaceLab đã dựa trên; quá trình tăng mẫu cũng phổ biến trong các khung chỉnh sửa GAN.

Mạng chú ý cho sơ đồ được mô hình hoá dựa trên Compositional De-Attention Networks (CODA), một dự án hợp tác học thuật Mỹ/Singapore năm 2019 với Amazon (AMZN ) AI và Microsoft.

Kiểm Tra

Khung làm việc dựa trên luồng đã được thử nghiệm so với các phương pháp dựa trên luồng trước đây như FAL và Animating Through Warping (ATW), cũng như các kiến trúc dịch chuyển hình ảnh Pix2PixHD và GFLA, với SSIM, PSNR và LPIPS làm các chỉ số đánh giá.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Kết quả của các thử nghiệm ban đầu (hướng mũi tên trong tiêu đề cho biết liệu con số thấp hơn hay cao hơn là tốt hơn).

Dựa trên các chỉ số đã áp dụng, hệ thống của các tác giả vượt trội hơn các kiến trúc trước đó.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Kết quả được chọn. Vui lòng tham khảo PDF gốc được liên kết trong bài viết này để xem so sánh độ phân giải cao hơn.

Ngoài các chỉ số tự động, các nhà nghiên cứu đã thực hiện một nghiên cứu người dùng (cột cuối cùng của bảng kết quả được hiển thị ở trên), trong đó 40 người tham gia mỗi người được trình bày 30 câu hỏi được chọn ngẫu nhiên từ một ngân hàng 100 câu hỏi liên quan đến các hình ảnh được tạo ra bởi các phương pháp khác nhau. 70% người trả lời ủng hộ kỹ thuật mới vì nó ‘hấp dẫn hơn về mặt hình ảnh’.

Thách Thức

Bài báo mới đại diện cho một chuyến thám hiểm hiếm hoi vào việc thao tác cơ thể dựa trên AI. Ngành tổng hợp hình ảnh hiện đang quan tâm nhiều hơn tới việc tạo ra các cơ thể có thể chỉnh sửa bằng các phương pháp như Neural Radiance Fields (NeRF), hoặc tập trung vào việc khám phá không gian tiềm ẩn của GAN và tiềm năng của autoencoder cho việc thao tác khuôn mặt.

Sáng kiến của các tác giả hiện chỉ giới hạn ở việc tạo ra các thay đổi về cân nặng cảm nhận, và họ chưa triển khai bất kỳ kỹ thuật inpainting nào có thể khôi phục nền mà không thể tránh khỏi khi bạn làm giảm cân một bức ảnh của ai đó.

Tuy nhiên, họ đề xuất rằng việc tách nền chân dung và pha trộn nền thông qua suy luận kết cấu có thể giải quyết một cách đơn giản vấn đề khôi phục các phần của thế giới đã bị ẩn trong hình ảnh do ‘khuyết điểm’ của con người’.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Giải pháp đề xuất để khôi phục nền được lộ ra khi giảm cân bằng AI.

 

* Mặc dù bản preprint đề cập đến tài liệu bổ sung cung cấp chi tiết hơn về bộ dữ liệu, cũng như các ví dụ bổ sung từ dự án, vị trí của tài liệu này không được cung cấp trong bài báo, và tác giả liên hệ vẫn chưa trả lời yêu cầu truy cập của chúng tôi.

Được xuất bản lần đầu vào ngày 10 tháng 3 năm 2022.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai