Góc nhìn Anderson

RigNeRF: Một Phương Pháp Deepfakes Mới Sử Dụng Truyền Tải Nơ-Ron

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới được phát triển tại Adobe đang cung cấp phương pháp deepfakes đầu tiên dựa trên Truyền Tải Nơ-Ron (NeRF) – có thể là sự đổi mới thực sự đầu tiên trong kiến trúc hoặc phương pháp trong năm năm kể từ khi xuất hiện của deepfakes vào năm 2017.

Phương pháp này, có tên RigNeRF, sử dụng mô hình khuôn mặt có thể biến dạng 3D (3DMMs) như một lớp trung gian giữa đầu vào mong muốn (tức là danh tính sẽ được áp dụng vào NeRF) và không gian nơ-ron, một phương pháp đã được được áp dụng rộng rãi trong những năm gần đây bởi các phương pháp tổng hợp đối抗 (GAN) để tổng hợp khuôn mặt, không có phương pháp nào trong số này đã tạo ra các khuôn khổ thay thế khuôn mặt hữu ích cho video.

Từ tài liệu bổ sung cho bài báo mới, chúng ta thấy mô hình khuôn mặt có thể biến dạng 3D (3DMM) hoạt động như một giao diện giữa 70 giây footage thực tế được lấy từ một điện thoại thông minh, mà cấu thành dữ liệu đào tạo, và các tham số thường trực của một hình ảnh NeRF. Để có một phiên bản độ phân giải cao của clip này, cùng với nhiều clip khác, hãy xem trang dự án, hoặc các video nhúng ở cuối bài viết này. Nguồn: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

Không giống như các video deepfakes truyền thống, không có nội dung di chuyển nào trong hình ảnh này là ‘thực’, mà là một không gian nơ-ron có thể khám phá được, được đào tạo trên footage ngắn. Ở bên phải, chúng ta thấy mô hình khuôn mặt có thể biến dạng 3D (3DMM) hoạt động như một giao diện giữa các thao tác mong muốn (‘cười’, ‘nhìn trái’, ‘nhìn lên’, v.v.) và các tham số thường trực của một hình ảnh NeRF. Để có một phiên bản độ phân giải cao của clip này, cùng với các ví dụ khác, hãy xem trang dự án, hoặc các video nhúng ở cuối bài viết này. Nguồn: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3DMMs thực sự là các mô hình CGI của khuôn mặt, các tham số của chúng có thể được điều chỉnh để phù hợp với các hệ thống tổng hợp hình ảnh trừu tượng, chẳng hạn như NeRF và GAN, vốn khó kiểm soát.

Điều bạn đang thấy trong hình ảnh trên (hình ảnh giữa, người đàn ông mặc áo xanh), cũng như hình ảnh trực tiếp dưới (hình ảnh trái, người đàn ông mặc áo xanh), không phải là một ‘thực’ video vào đó một mảng ‘giả’ khuôn mặt đã được áp dụng, mà là một cảnh được tổng hợp hoàn toàn – bao gồm cả cơ thể và nền:

Trong ví dụ trực tiếp trên, video thực tế ở bên phải (phụ nữ mặc váy đỏ) được sử dụng để ‘bùn’ danh tính được thu thập (người đàn ông mặc áo xanh) ở bên trái thông qua RigNeRF, mà (các tác giả tuyên bố) là hệ thống NeRF đầu tiên đạt được sự tách biệt giữa tư thế và biểu cảm trong khi có thể thực hiện các tổng hợp mới.

Hình ảnh người đàn ông ở bên trái trong hình ảnh trên đã được ‘thu thập’ từ một video 70 giây được quay bằng điện thoại thông minh, và dữ liệu đầu vào (bao gồm cả thông tin cảnh) sau đó được đào tạo trên 4 V100 GPUs để có được cảnh.

Kể từ khi các mô hình khuôn mặt có thể biến dạng 3D (3DMM) cũng có sẵn dưới dạng đại diện CGI toàn thân (thay vì chỉ là các mô hình khuôn mặt), RigNeRF có thể mở ra khả năng tạo ra các deepfakes toàn thân, nơi chuyển động, kết cấu và biểu cảm của con người thực được truyền đến lớp CGI, sau đó sẽ dịch chuyển hành động và biểu cảm thành môi trường và video NeRF.

Về RigNeRF – liệu nó có đủ điều kiện để trở thành một phương pháp deepfakes trong ý nghĩa hiện tại mà các tiêu đề hiểu về thuật ngữ này? Hay nó chỉ là một phương pháp nửa vời khác so với DeepFaceLab và các hệ thống deepfakes tự động khác?

Các nhà nghiên cứu của bài báo mới không rõ ràng về điểm này:

‘Là một phương pháp có khả năng tái tạo khuôn mặt, RigNeRF dễ bị lạm dụng bởi các tác nhân xấu để tạo ra deep-fakes.’

Bài báo mới bài báo có tiêu đề RigNeRF: Fully Controllable Neural 3D Portraits, và đến từ ShahRukh Atha của Đại học Stonybrook, một thực tập sinh tại Adobe trong quá trình phát triển RigNeRF, và bốn tác giả khác từ Adobe Research.

Beyond Autoencoder-Based Deepfakes

Hầu hết các deepfakes lan truyền trên các tiêu đề trong những năm gần đây được tạo ra bởi các hệ thống tự động mã hóa – được bắt nguồn từ mã được xuất bản tại subreddit r/deepfakes bị cấm vào năm 2017 – mặc dù không trước khi được sao chép sang GitHub, nơi nó đã được fork hơn một nghìn lần, không chỉ vào DeepFaceLab phổ biến, mà còn vào FaceSwap dự án.

Bên cạnh GAN và NeRF, các khung tự động mã hóa cũng đã thử nghiệm với 3DMM như ‘hướng dẫn’ cho các khuôn khổ tổng hợp khuôn mặt cải tiến. Một ví dụ về điều này là HifiFace project từ tháng 7 năm 2021. Tuy nhiên, không có sáng kiến ​​hữu ích hoặc phổ biến nào dường như đã phát triển từ cách tiếp cận này cho đến nay.

Dữ liệu cho các cảnh RigNeRF được thu thập bằng cách quay các video ngắn trên điện thoại thông minh. Đối với dự án, các nhà nghiên cứu của RigNeRF đã sử dụng iPhone XR hoặc iPhone 12 cho tất cả các thí nghiệm. Đối với nửa đầu của quá trình thu thập, đối tượng được yêu cầu thực hiện một loạt các biểu cảm khuôn mặt và nói trong khi giữ đầu vẫn, trong khi máy ảnh được di chuyển xung quanh họ.

Đối với nửa sau của quá trình thu thập, máy ảnh duy trì một vị trí cố định trong khi đối tượng phải di chuyển đầu xung quanh trong khi thể hiện một loạt các biểu cảm. Kết quả là 40-70 giây footage (khoảng 1200-2100 khung hình) đại diện cho toàn bộ tập dữ liệu sẽ được sử dụng để đào tạo mô hình.

Cutting Down on Data-Gathering

Ngược lại, các hệ thống tự động mã hóa như DeepFaceLab yêu cầu việc thu thập và chăm sóc các bức ảnh đa dạng, thường được lấy từ các video YouTube và các kênh truyền thông xã hội khác, cũng như từ các bộ phim (trong trường hợp của các deepfakes nổi tiếng).

Các mô hình tự động mã hóa được đào tạo sau đó thường được sử dụng trong nhiều tình huống. Tuy nhiên, những người tạo deepfakes ‘nổi tiếng’ có thể đào tạo các mô hình hoàn toàn từ đầu cho một video duy nhất, mặc dù việc đào tạo có thể mất một tuần hoặc hơn.

Mặc dù có lưu ý từ các nhà nghiên cứu của bài báo mới, các tập dữ liệu ‘lát cắt’ và ‘lắp ráp’ rộng rãi mà cung cấp năng lượng cho AI khiêu dâm cũng như các ‘tái diễn’ deepfakes phổ biến trên YouTube / TikTok dường như không thể tạo ra kết quả chấp nhận được và nhất quán trong một hệ thống deepfakes như RigNeRF, có một phương pháp cụ thể. Dữ liệu thu thập được hạn chế như được nêu trong công việc mới này có thể chứng minh, ở một mức độ nào đó, là một biện pháp bảo vệ bổ sung chống lại việc lạm dụng danh tính một cách tùy tiện bởi các deepfakers độc ác.

Adapting NeRF to Deepfake Video

NeRF là một phương pháp photogrammetry trong đó một số lượng nhỏ hình ảnh nguồn được chụp từ các góc nhìn khác nhau được lắp ráp thành một không gian nơ-ron 3D có thể khám phá. Cách tiếp cận này đã nổi lên vào đầu năm nay khi NVIDIA giới thiệu Instant NeRF của họ, có khả năng cắt giảm thời gian đào tạo NeRF xuống vài phút, hoặc thậm chí vài giây:

Instant NeRF. Nguồn: https://www.youtube.com/watch?v=DJ2hcC1orc4

Kết quả là một cảnh NeRF tĩnh, có thể được khám phá, nhưng rất khó chỉnh sửa. Các nhà nghiên cứu lưu ý rằng hai sáng kiến ​​trước đó dựa trên NeRF – HyperNeRF + E/PNerFACE – đã thử nghiệm tổng hợp khuôn mặt video, và (dường như vì sự đầy đủ và cẩn thận) đã thiết lập RigNeRF chống lại hai khuôn khổ này trong một vòng thử nghiệm:

Instant NeRF. Nguồn: https://www.youtube.com/watch?v=DJ2hcC1orc4

Một so sánh định tính giữa RigNeRF, HyperNeRF và NerFACE. Xem các video nguồn và PDF để có phiên bản chất lượng cao hơn. Nguồn hình ảnh tĩnh: https://arxiv.org/pdf/2012.03065.pdf

Một so sánh định tính giữa RigNeRF, HyperNeRF và NerFACE. Xem các video nguồn và PDF để có phiên bản chất lượng cao hơn. Nguồn hình ảnh tĩnh: https://arxiv.org/pdf/2012.03065.pdf

Tuy nhiên, trong trường hợp này, kết quả, vốn ủng hộ RigNeRF, khá bất thường, vì hai lý do: đầu tiên, các tác giả quan sát rằng ‘không có công việc nào để so sánh’; thứ hai, điều này đã yêu cầu giới hạn khả năng của RigNeRF để ít nhất một phần phù hợp với chức năng hạn chế hơn của các hệ thống trước đó.

Vì kết quả không phải là một cải tiến dần dần so với công việc trước đó, mà thay vào đó đại diện cho một ‘phá vỡ’ trong khả năng chỉnh sửa và tiện ích của NeRF, chúng tôi sẽ đặt vòng thử nghiệm sang một bên, và thay vào đó xem RigNeRF đang làm gì khác biệt so với các tiền nhiệm của nó.

Combined Strengths

Giới hạn chính của NerFACE, có thể tạo ra kiểm soát tư thế / biểu cảm trong một môi trường NeRF, là nó giả định rằng footage nguồn sẽ được chụp với một máy ảnh tĩnh. Điều này hiệu quả có nghĩa là nó không thể tạo ra các tầm nhìn mới mở rộng vượt quá các hạn chế thu thập của nó. Điều này tạo ra một hệ thống có thể tạo ra ‘chân dung di chuyển’, nhưng không phù hợp cho video deepfakes.

HyperNeRF, mặt khác, trong khi có thể tạo ra các tầm nhìn mới và siêu thực, không có công cụ nào cho phép nó thay đổi tư thế đầu hoặc biểu cảm khuôn mặt, điều này một lần nữa không tạo ra bất kỳ đối thủ nào cho các deepfakes dựa trên tự động mã hóa.

RigNeRF có thể kết hợp hai chức năng riêng biệt này bằng cách tạo ra một ‘không gian tiêu chuẩn’, một đường cơ sở mặc định từ đó các sai lệch và biến dạng có thể được thực hiện thông qua đầu vào từ mô-đun 3DMM.

Tạo một 'không gian tiêu chuẩn' (không có tư thế, không có biểu cảm), trên đó các biến dạng (tức là tư thế và biểu cảm) được tạo ra thông qua mô-đun 3DMM có thể hoạt động.

Tạo một ‘không gian tiêu chuẩn’ (không có tư thế, không có biểu cảm), trên đó các biến dạng (tức là tư thế và biểu cảm) được tạo ra thông qua mô-đun 3DMM có thể hoạt động.

Vì mô-đun 3DMM sẽ không được khớp chính xác với đối tượng được thu thập, điều quan trọng là phải bù đắp cho điều này trong quá trình. RigNeRF thực hiện việc này với một trường biến dạng trước được tính toán từ một Multilayer Perceptron (MLP) được dẫn xuất từ footage nguồn.

Các tham số máy ảnh cần thiết để tính toán biến dạng được thu được thông qua COLMAP, trong khi các tham số biểu cảm và hình dạng cho mỗi khung hình được thu được từ DECA.

Vị trí được tối ưu hóa thêm thông qua phù hợp điểm mốc và các tham số máy ảnh COLMAP, và, do hạn chế về tài nguyên tính toán, đầu ra video được giảm kích thước xuống độ phân giải 256×256 cho đào tạo (một quá trình thu nhỏ bị hạn chế bởi phần cứng cũng ảnh hưởng đến cảnh deepfakes tự động mã hóa).

Sau đó, mạng biến dạng được đào tạo trên bốn V100 – phần cứng mạnh mẽ không có khả năng nằm trong tầm tay của những người đam mê thông thường (tuy nhiên, trong đào tạo học máy, thường có thể trao đổi sức mạnh cho thời gian, và chỉ cần chấp nhận rằng đào tạo mô hình sẽ là vấn đề của vài ngày hoặc thậm chí vài tuần).

Cuối cùng, các nhà nghiên cứu tuyên bố:

‘Không giống như các phương pháp khác, RigNeRF, nhờ sử dụng mô-đun biến dạng được hướng dẫn bởi 3DMM, có thể mô hình hóa tư thế đầu, biểu cảm khuôn mặt và toàn bộ cảnh chân dung 3D với độ trung thực cao, do đó mang lại các bản tái tạo với chi tiết sắc nét.’

Xem các video nhúng dưới đây để biết thêm chi tiết và đoạn phim.

 

 

Được xuất bản lần đầu vào ngày 15 tháng 6 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai