Góc nhìn Anderson

Các Nhà Phát Triển TikTok Xóa Mặt Để Ứng Dụng Thực Tế Tăng Cường

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

ByteDance, công ty internet đa quốc gia của Trung Quốc đứng sau TikTok, đã phát triển một phương pháp mới để xóa mặt trong video để có thể áp dụng các hiệu ứng biến dạng và các hiệu ứng khác lên người trong các ứng dụng thực tế tăng cường. Công ty cho biết kỹ thuật này đã được tích hợp vào các sản phẩm thương mại di động, mặc dù nó không nêu rõ sản phẩm nào.

Sau khi các mặt trong video đã được ‘xóa’, có đủ ‘bề mặt mặt’ để tạo ra các biến dạng mắt, cũng như có thể áp dụng các bản sắc khác. Các ví dụ được cung cấp trong một bài báo mới từ các nhà nghiên cứu của ByteDance minh họa các khả năng, bao gồm phục hồi các tính năng ‘xóa’ trong các cấu hình hài hước (và chắc chắn một số cấu hình ghê tởm) khác nhau:

Một số khả năng tái cấu hình mặt được bao gồm trong bài báo của ByteDance.

Một số khả năng tái cấu hình mặt được bao gồm trong bài báo của ByteDance. Nguồn: https://arxiv.org/pdf/2109.10760.pdf

Vào cuối tháng 8, nó đã được biết rằng TikTok, ứng dụng đầu tiên không thuộc sở hữu của Facebook đạt 3 tỷ lượt cài đặt, đã ra mắt TikTok Effect Studio (hiện tại đang trong giai đoạn beta đóng), một nền tảng cho các nhà phát triển thực tế tăng cường (AR) tạo ra các hiệu ứng AR cho các luồng nội dung của TikTok.

Hiệu quả, công ty đang bắt kịp với các cộng đồng nhà phát triển tương tự tại Facebook’s AR StudioSnap AR, với cộng đồng nghiên cứu và phát triển AR lâu đời của Apple cũng sẽ được kích hoạt bởi thiết bị mới trong năm tới.

Biểu Hiện Trống

Bài báo này, có tiêu đề FaceEraser: Xóa Bộ Phận Mặt Cho Thực Tế Tăng Cường, lưu ý rằng các thuật toán hoàn thiện / điền hiện có, như NVIDIA’s SPADE, được định hướng nhiều hơn để hoàn thiện các hình ảnh bị cắt xén hoặc bị che khuất một phần so với việc thực hiện thủ tục ‘xóa’ không bình thường này, và rằng tài liệu dữ liệu hiện có do đó rất khan hiếm.

Vì không có dữ liệu thực sự có sẵn cho những người có một bề mặt thịt rắn nơi khuôn mặt của họ nên được, các nhà nghiên cứu đã tạo ra một kiến trúc mạng mới gọi là pixel-clone, có thể được chồng lên các mô hình hoàn thiện / điền neuron hiện có, và giải quyết các vấn đề liên quan đến sự không nhất quán về kết cấu và màu sắc được hiển thị (bài báo chứng nhận) bởi các phương pháp cũ hơn như StructureFlowEdgeConnect.

Luồng công việc chung của pixel-clone trong đường ống mới.

Luồng công việc chung của pixel-clone trong đường ống mới.

Để đào tạo một mô hình trên ‘mặt trống’, các nhà nghiên cứu đã loại bỏ các hình ảnh có kính, hoặc nơi tóc che khuất trán, vì khu vực giữa đường chân tóc và lông mày thường là nhóm pixel lớn nhất có thể cung cấp ‘vật liệu dán’ cho các tính năng trung tâm của khuôn mặt.

Chuẩn bị hình ảnh đào tạo. Khu vực trán được cắt ra, dựa trên các điểm chính trong nhận dạng căn chỉnh khuôn mặt, lật theo chiều dọc và khâu lại.

Chuẩn bị hình ảnh đào tạo. Khu vực trán được cắt ra, dựa trên các điểm chính trong nhận dạng căn chỉnh khuôn mặt, lật theo chiều dọc và khâu lại.

Một hình ảnh 256×256 pixel được thu được, kích thước đủ nhỏ để đưa vào không gian tiềm ẩn của một mạng nơ-ron trong các lô đủ lớn để đạt được sự khái quát hóa. Sự tăng tỷ lệ thuật toán sau này sẽ khôi phục lại độ phân giải cần thiết để làm việc trong không gian AR.

Kiến Trúc

Mạng được tạo thành từ ba mạng bên trong, bao gồm Hoàn Thành Cạnh, Pixel-Clone và mạng tinh chỉnh. Mạng hoàn thành cạnh sử dụng cùng một kiến trúc mã hóa / giải mã được sử dụng trong EdgeConnect (xem trên), cũng như trong hai ứng dụng deepfake phổ biến nhất. Các bộ mã hóa giảm mẫu nội dung hình ảnh hai lần, và các bộ giải mã khôi phục lại kích thước hình ảnh ban đầu.

Pixel-Clone sử dụng một phương pháp mã hóa / giải mã sửa đổi, trong khi lớp tinh chỉnh sử dụng kiến trúc U-Net, một kỹ thuật ban đầu được phát triển cho hình ảnh y sinh, thường được sử dụng trong các dự án nghiên cứu tổng hợp hình ảnh.

Trong quá trình đào tạo, cần phải đánh giá độ chính xác của các biến đổi, và, nếu cần, lặp lại các nỗ lực một cách lặp đi lặp lại cho đến khi đạt đến hội tụ. Để thực hiện việc này, hai bộ phân loại dựa trên PatchGAN được sử dụng, mỗi bộ phân loại đánh giá tính hiện thực của các bản vá 70×70 pixel, giảm giá trị tính hiện thực của toàn bộ hình ảnh.

Đào Tạo và Dữ Liệu

Mạng hoàn thành cạnh được đào tạo độc lập ban đầu, trong khi hai mạng còn lại được đào tạo cùng nhau, dựa trên các trọng số đã thu được từ quá trình đào tạo hoàn thành cạnh, được cố định và đông lạnh trong quá trình này.

Mặc dù bài báo không nêu rõ rằng các ví dụ về biến dạng tính năng cuối cùng là mục tiêu chính của mô hình, nhưng nó thực hiện các hiệu ứng hài hước khác nhau để kiểm tra khả năng chống chịu của hệ thống, bao gồm loại bỏ lông mày, miệng lớn, khuôn mặt con thu nhỏ và các hiệu ứng ‘toonized’ (như được hiển thị trong hình ảnh trước đó, ở trên).

Bài báo khẳng định rằng ‘các khuôn mặt bị xóa cho phép các ứng dụng thực tế tăng cường khác nhau yêu cầu đặt các yếu tố tùy chỉnh của người dùng’, cho thấy khả năng tùy chỉnh khuôn mặt với các yếu tố được người dùng đóng góp.

Mô hình được đào tạo trên các mặt nạ từ tập dữ liệu FFHQ do NVIDIA tạo, chứa đủ sự đa dạng về độ tuổi, chủng tộc, ánh sáng và tư thế và phong cách khuôn mặt để đạt được sự khái quát hóa hữu ích. Tập dữ liệu chứa 35.000 hình ảnh và 10.000 mặt nạ đào tạo để xác định các khu vực biến đổi, với 4000 hình ảnh và 1000 mặt nạ được đặt sang một bên cho mục đích xác thực.

Mẫu đào tạo.

Mẫu đào tạo.

Mô hình được đào tạo có thể thực hiện suy luận trên dữ liệu từ CelebA-HQ năm 2017 và VoxCeleb, khuôn mặt không nhìn thấy từ FFHQ và bất kỳ khuôn mặt không bị giới hạn nào khác được trình bày cho nó. Các hình ảnh 256×256 pixel được đào tạo trên mạng trong các lô 8 trên một bộ tối ưu hóa Adam, được thực hiện trong PyTorch và chạy trên một GPU Tesla (TSLA ) V100 trong ‘2.000.000 kỷ’.

Kết quả suy luận thu được trên khuôn mặt thực.

Kết quả suy luận thu được trên khuôn mặt thực.

Giống như trong nghiên cứu tổng hợp hình ảnh dựa trên khuôn mặt, hệ thống phải đối mặt với các thất bại偶发 do các chướng ngại vật hoặc che khuất như tóc, phụ kiện, kính và râu.

Báo cáo kết luận:

‘Phương pháp của chúng tôi đã được thương mại hóa và nó hoạt động tốt trong các sản phẩm cho đầu vào người dùng không bị giới hạn.’

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai