Góc nhìn Anderson
Tái định hình Kiểu hình Cơ thể Người với Trí tuệ Nhân tạo

Một nghiên cứu hợp tác mới từ Trung Quốc cung cấp một phương pháp mới để tái định hình cơ thể người trong hình ảnh, bằng cách sử dụng một mạng lưới mã hóa thần kinh đôi được điều phối, được hướng dẫn bởi một mô hình tham số, cho phép người dùng cuối điều chỉnh trọng lượng, chiều cao và tỷ lệ cơ thể trong một giao diện người dùng tương tác.

Sự điều chỉnh tham số của hình dạng cơ thể, với các thanh trượt thay đổi ba tính năng có sẵn. Nguồn: https://arxiv.org/pdf/2203.10496.pdf
Công việc này cung cấp một số cải tiến so với một dự án tương tự gần đây từ Alibaba, trong đó nó có thể thay đổi chiều cao và tỷ lệ cơ thể cũng như trọng lượng, và có một mạng lưới thần kinh chuyên dụng cho việc ‘điền vào’ nền (không tồn tại) có thể được tiết lộ bởi hình ảnh cơ thể ‘mỏng hơn’. Nó cũng cải tiến một phương pháp tham số trước đó cho việc tái định hình cơ thể bằng cách loại bỏ nhu cầu can thiệp của con người trong quá trình tạo ra sự biến đổi.
Được đặt tên là NeuralReshaper, kiến trúc mới này phù hợp với một mẫu 3D người tham số với một hình ảnh nguồn, và sau đó sử dụng sự biến dạng trong mẫu để điều chỉnh hình ảnh ban đầu theo các tham số mới.
Hệ thống này có thể xử lý các biến đổi cơ thể trên cả hình ảnh người mặc quần áo và bán khỏa thân (tức là đồ bơi).
Các biến đổi loại này hiện đang được quan tâm mạnh mẽ trong lĩnh vực nghiên cứu trí tuệ nhân tạo thời trang, đã sản xuất một số nền tảng dựa trên StyleGAN/CycleGAN và mạng lưới thần kinh tổng quát cho thử nghiệm ảo có thể điều chỉnh các mặt hàng quần áo có sẵn để phù hợp với hình dạng và loại cơ thể của một hình ảnh được gửi bởi người dùng, hoặc giúp với sự phù hợp về hình ảnh.
Bài báo này có tiêu đề Single-image Human-body Reshaping with Deep Neural Networks, và đến từ các nhà nghiên cứu tại Đại học Zhejiang ở Hàng Châu, và Trường Truyền thông Sáng tạo tại Đại học Thành phố Hồng Kông.
SMPL Fitting
NeuralReshaper sử dụng mô hình Skinned Multi-Person Linear (SMPL) được phát triển bởi Viện Hệ thống Thông minh Max Planck và nhà sản xuất hiệu ứng hình ảnh nổi tiếng Industrial Light and Magic vào năm 2015.

Mô hình người tham số SMPL từ sự hợp tác Planck/ILM năm 2015. Nguồn: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Trong giai đoạn đầu của quá trình, một mô hình SMPL được tạo ra từ một hình ảnh nguồn mà các biến đổi cơ thể được mong muốn. Việc điều chỉnh mô hình SMPL với hình ảnh theo phương pháp của phương pháp Phục hồi Lưới người (HMR) được đề xuất bởi các trường đại học ở Đức và Mỹ vào năm 2018.
Các tham số cho biến dạng (trọng lượng, chiều cao, tỷ lệ cơ thể) được tính toán tại giai đoạn này, cùng với việc xem xét các tham số máy ảnh, chẳng hạn như độ dài tiêu cự. Các điểm then chốt 2D và sự căn chỉnh hình dạng tạo ra khuôn khổ cho biến dạng dưới dạng hình dạng 2D, một biện pháp tối ưu hóa bổ sung giúp tăng độ chính xác của ranh giới và cho phép việc điền vào nền một cách chân thực hơn trong quá trình xử lý sau.

Các giai đoạn điều chỉnh SMPL: trái, hình ảnh nguồn; thứ hai, kết quả tối ưu hóa thu được từ phương pháp được đề xuất vào năm 2016 bởi Viện Hệ thống Thông minh Max Planck; thứ ba, kết quả suy luận trực tiếp từ mô hình được đào tạo trước cho Phục hồi Hình dạng và Tư thế Người; thứ tư, kết quả thu được sau khi tối ưu hóa các điểm then chốt 2D; và cuối cùng, thứ năm, sự phù hợp hoàn thành sau khi tối ưu hóa hình dạng (xem trên).
Sau đó, biến dạng 3D được chiếu vào không gian hình ảnh của kiến trúc để tạo ra một trường biến dạng dày đặc sẽ xác định biến dạng. Quá trình này mất khoảng 30 giây cho mỗi hình ảnh.
NeuralReshaper Architecture
NeuralReshaper chạy hai mạng lưới thần kinh song song: một bộ mã hóa tiền cảnh tạo ra hình dạng cơ thể biến đổi, và một bộ mã hóa nền tập trung vào việc điền vào các vùng nền ‘bị che khuất’ (trong trường hợp, chẳng hạn, làm mỏng cơ thể – xem hình dưới).
Khung U-net tích hợp đầu ra từ các tính năng của hai bộ mã hóa trước khi truyền kết quả đến một bộ mã hóa thống nhất cuối cùng tạo ra một hình ảnh mới từ hai đầu vào. Kiến trúc này có một cơ chế dẫn đường biến dạng mới để cho phép tích hợp.
Training and Experiments
NeuralReshaper được thực hiện trong PyTorch trên một card đồ họa NVIDIA 1080ti duy nhất với 11gb VRAM. Mạng lưới được đào tạo trong 100 kỷ với bộ tối ưu hóa Adam, với bộ tạo đặt mức mất 0,0001 và bộ phân biệt đặt mức mất 0,0004. Việc đào tạo diễn ra trên một kích thước batch 8 cho một tập dữ liệu ngoài trời độc quyền (được rút ra từ COCO, MPII, và LSP), và 2 cho việc đào tạo trên tập dữ liệu DeepFashion.
Dưới đây là một số ví dụ độc quyền từ tập dữ liệu DeepFashion khi được đào tạo cho NeuralReshaper, với hình ảnh gốc luôn ở bên trái.
Các thuộc tính có thể điều khiển được tách biệt, và có thể được áp dụng riêng biệt.
Các biến đổi trên tập dữ liệu ngoài trời có thể khó khăn hơn, vì chúng thường đòi hỏi phải điền vào các nền phức tạp và phân biệt rõ ràng và thuyết phục về các loại cơ thể biến đổi:
Parametric Necessity
Như bài báo nhận xét, các biến đổi hình ảnh cùng loại này đại diện cho một vấn đề không được đặt ra trong tổng hợp hình ảnh. Nhiều khung GAN và bộ mã hóa biến đổi có thể sử dụng các hình ảnh được ghép đôi (chẳng hạn như các dự án đa dạng được thiết kế để thực hiện biến đổi phác thảo>ảnh và biến đổi ảnh>phác thảo).
Tuy nhiên, trong trường hợp này, điều này sẽ đòi hỏi các hình ảnh ghép đôi có cùng người trong các cấu hình vật lý khác nhau, chẳng hạn như các hình ảnh ‘trước và sau’ trong quảng cáo giảm cân hoặc phẫu thuật thẩm mỹ – dữ liệu khó có được hoặc tạo ra.
Ngược lại, các mạng lưới GAN biến đổi có thể được đào tạo trên dữ liệu đa dạng hơn và thực hiện biến đổi bằng cách tìm kiếm hướng latent giữa mã latent nguồn (hình ảnh gốc) và lớp mong muốn (trong trường hợp này là ‘béo’, ‘gầy’, ‘cao’, v.v.). Tuy nhiên, cách tiếp cận này hiện vẫn còn hạn chế cho mục đích tái định hình cơ thể tinh chỉnh.
Các phương pháp Trường bức xạ thần kinh (NeRF) tiến bộ hơn nhiều trong mô phỏng toàn thân so với hầu hết các hệ thống dựa trên GAN, nhưng vẫn còn đặc trưng cho từng cảnh và tốn tài nguyên, với khả năng chỉnh sửa loại cơ thể hiện còn rất hạn chế (ngoài việc thu nhỏ toàn bộ cơ thể so với môi trường của nó).
Không gian latent của GAN khó kiểm soát; VAE chưa giải quyết được sự phức tạp của việc tái tạo toàn thân; và khả năng của NeRF trong việc tái tạo và chỉnh sửa cơ thể người một cách nhất quán và thực tế vẫn còn trong giai đoạn sơ khai. Do đó, việc kết hợp các phương pháp CGI ‘truyền thống’ như SMPL dường như sẽ tiếp tục trong lĩnh vực nghiên cứu tổng hợp hình ảnh người, như một phương pháp để thu thập và hợp nhất các tính năng, lớp và mã latent mà các tham số và khả năng khai thác của chúng chưa được hiểu đầy đủ trong những công nghệ mới nổi này.
Đầu tiên được xuất bản ngày 31 tháng 3 năm 2022.




















