Mô hình và nền tảng AI

AniPortrait: Tổng hợp ảnh chân thực dựa trên âm thanh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong nhiều năm, việc tạo ra các hình ảnh chân thực và biểu cảm từ ảnh tĩnh và âm thanh đã tìm thấy nhiều ứng dụng bao gồm trò chơi, phương tiện truyền thông kỹ thuật số, thực tế ảo và nhiều hơn nữa. Mặc dù có nhiều ứng dụng tiềm năng, nhưng việc tạo ra các khung hình có khả năng tạo ra các hình ảnh động chất lượng cao vẫn còn là một thách thức đối với các nhà phát triển. Một nguyên nhân chính dẫn đến sự phức tạp này là nhu cầu phối hợp phức tạp giữa chuyển động của môi, vị trí của đầu và biểu cảm trên khuôn mặt để tạo ra một hiệu ứng hình ảnh hấp dẫn.

Trong bài viết này, chúng tôi sẽ thảo luận về AniPortrait, một khung hình mới được thiết kế để tạo ra các hình ảnh động chất lượng cao dựa trên một hình ảnh chân dung tham chiếu và một mẫu âm thanh. Khung hình AniPortrait được chia thành hai giai đoạn. Đầu tiên, khung hình AniPortrait trích xuất các biểu diễn 3D trung gian từ các mẫu âm thanh và chiếu chúng vào một chuỗi các điểm mốc trên khuôn mặt 2D. Sau đó, khung hình sử dụng một mô hình khuếch tán mạnh mẽ kết hợp với một mô-đun chuyển động để chuyển đổi chuỗi điểm mốc thành các hình ảnh động chân thực và nhất quán về thời gian. Kết quả thực nghiệm cho thấy sự vượt trội và khả năng của khung hình AniPortrait trong việc tạo ra các hình ảnh động chất lượng cao với chất lượng hình ảnh tuyệt vời, sự đa dạng của tư thế và tự nhiên của khuôn mặt, do đó mang lại một trải nghiệm nhận thức được nâng cao và phong phú. Ngoài ra, khung hình AniPortrait còn có tiềm năng đáng kể về khả năng kiểm soát và linh hoạt, và có thể được áp dụng hiệu quả trong các lĩnh vực bao gồm tái tạo khuôn mặt, chỉnh sửa chuyển động khuôn mặt và nhiều hơn nữa. Bài viết này nhằm mục đích giới thiệu khung hình AniPortrait một cách sâu sắc, và chúng tôi sẽ khám phá cơ chế, phương pháp, kiến trúc của khung hình cùng với so sánh với các khung hình hiện đại.

AniPortrait: Hình ảnh động chân thực

Việc tạo ra các hình ảnh động chân thực và biểu cảm đã trở thành một mục tiêu của các nhà nghiên cứu trong một thời gian dài do tiềm năng và ứng dụng của nó. Mặc dù đã có nhiều năm nghiên cứu và phát triển, việc tạo ra các hình ảnh động chất lượng cao vẫn còn là một thách thức đáng kể. Một rào cản chính đối với các nhà phát triển là nhu cầu phối hợp phức tạp giữa vị trí của đầu, biểu cảm trên khuôn mặt và chuyển động của môi để tạo ra một hiệu ứng hình ảnh hấp dẫn. Các phương pháp hiện có đã không thể giải quyết được những thách thức này, chủ yếu vì hầu hết chúng dựa trên các máy phát điện có khả năng hạn chế như NeRF, bộ giải mã dựa trên chuyển động và GAN để tạo nội dung hình ảnh. Những mạng này thể hiện khả năng tổng quát hóa hạn chế và không ổn định trong việc tạo ra nội dung chất lượng cao. Tuy nhiên, sự xuất hiện gần đây của các mô hình khuếch tán đã tạo điều kiện cho việc tạo ra các hình ảnh chất lượng cao, và một số khung hình được xây dựng trên các mô hình khuếch tán cùng với các mô-đun thời gian đã tạo điều kiện cho việc tạo ra các video hấp dẫn, cho phép các mô hình khuếch tán trở nên xuất sắc.

Dựa trên sự tiến bộ của các mô hình khuếch tán, khung hình AniPortrait nhằm mục đích tạo ra các hình ảnh động chân thực sử dụng một hình ảnh tham chiếu và một mẫu âm thanh. Khung hình AniPortrait được chia thành hai giai đoạn. Trong giai đoạn đầu, khung hình sử dụng các mô hình dựa trên biến đổi để trích xuất một chuỗi các lưới mặt 3D và vị trí của đầu từ đầu vào âm thanh, và sau đó chiếu chúng vào một chuỗi các điểm mốc trên khuôn mặt 2D. Giai đoạn đầu tiên cho phép khung hình AniPortrait bắt được chuyển động của môi và biểu cảm tinh tế từ âm thanh, ngoài ra còn có chuyển động của đầu đồng bộ với nhịp điệu của mẫu âm thanh. Giai đoạn thứ hai, khung hình sử dụng một mô hình khuếch tán mạnh mẽ và tích hợp nó với một mô-đun chuyển động để chuyển đổi chuỗi điểm mốc thành một hình ảnh động chân thực và nhất quán về thời gian. Cụ thể, khung hình AniPortrait dựa trên kiến trúc mạng từ mô hình AnimateAnyone hiện có, sử dụng Stable Diffusion 1.5, một mô hình khuếch tán mạnh mẽ để tạo ra các hình ảnh động chân thực và mượt mà dựa trên một hình ảnh tham chiếu và một chuỗi chuyển động cơ thể. Điều đáng chú ý là khung hình AniPortrait không sử dụng mô-đun hướng dẫn tư thế trong mạng này, mà thay vào đó, nó được thiết kế lại, cho phép khung hình không chỉ duy trì thiết kế nhẹ mà còn thể hiện độ chính xác cao trong việc tạo ra chuyển động của môi.

Kết quả thực nghiệm cho thấy sự vượt trội của khung hình AniPortrait trong việc tạo ra các hình ảnh động với chất lượng hình ảnh tuyệt vời, sự đa dạng của tư thế và tự nhiên của khuôn mặt. Bằng cách sử dụng các biểu diễn 3D trung gian, khung hình AniPortrait có được sự linh hoạt để sửa đổi các biểu diễn này theo yêu cầu. Sự linh hoạt này làm tăng khả năng ứng dụng của khung hình AniPortrait trong các lĩnh vực bao gồm tái tạo khuôn mặt và chỉnh sửa chuyển động khuôn mặt.

AniPortrait: Cơ chế và Phương pháp

Khung hình AniPortrait đề xuất bao gồm hai mô-đun, cụ thể là Lmk2Video và Audio2Lmk. Mô-đun Audio2Lmk nhằm mục đích trích xuất một chuỗi các điểm mốc捕捉 chuyển động tinh tế của môi và biểu cảm trên khuôn mặt từ đầu vào âm thanh, trong khi mô-đun Lmk2Video sử dụng chuỗi điểm mốc này để tạo ra các hình ảnh động chân thực và nhất quán về thời gian. Hình ảnh dưới đây trình bày một cái nhìn tổng quan về cơ chế của khung hình AniPortrait. Như có thể thấy, khung hình đầu tiên trích xuất lưới mặt 3D và vị trí của đầu từ âm thanh, và sau đó chiếu chúng vào các điểm mốc 2D. Trong giai đoạn thứ hai, khung hình sử dụng một mô hình khuếch tán để chuyển đổi các điểm mốc 2D thành một hình ảnh động chân thực và nhất quán về thời gian, với hai giai đoạn được đào tạo đồng thời trong mạng.

Audio2Lmk

Đối với một chuỗi các mẫu âm thanh, mục tiêu chính của khung hình AniPortrait là dự đoán chuỗi lưới mặt 3D tương ứng với các biểu diễn vector của chuyển động và quay. Khung hình sử dụng phương pháp wav2vec đã được đào tạo trước để trích xuất các tính năng âm thanh, và mô hình này thể hiện khả năng tổng quát hóa cao và có thể nhận ra giọng điệu và phát âm từ âm thanh một cách chính xác, điều này đóng vai trò quan trọng trong việc tạo ra các hình ảnh động chân thực. Bằng cách tận dụng các tính năng âm thanh mạnh mẽ này, khung hình có thể sử dụng một kiến trúc đơn giản bao gồm hai lớp fc để chuyển đổi các tính năng này thành lưới mặt 3D. Khung hình nhận thấy rằng thiết kế đơn giản này không chỉ tăng cường hiệu quả của quá trình suy luận mà còn đảm bảo độ chính xác. Khi chuyển đổi âm thanh thành tư thế, khung hình sử dụng cùng một mạng wav2vec làm xương sống, mặc dù mô hình không chia sẻ trọng số với mô-đun âm thanh sang lưới. Điều này chủ yếu là do tư thế liên quan nhiều hơn đến giọng điệu và nhịp điệu trong âm thanh, điều này có một trọng tâm khác khi so sánh với nhiệm vụ âm thanh sang lưới. Để tính đến tác động của các trạng thái trước đó, khung hình sử dụng một bộ giải mã transformer để giải mã chuỗi tư thế. Trong quá trình này, khung hình tích hợp các tính năng âm thanh vào bộ giải mã bằng cách sử dụng các cơ chế chú ý chéo, và đối với cả hai mô-đun, khung hình đào tạo chúng bằng cách sử dụng mất mát L1. Khi mô hình nhận được chuỗi tư thế và lưới, nó sử dụng phép chiếu перспектив để chuyển đổi các chuỗi này thành một chuỗi các điểm mốc 2D trên khuôn mặt, sau đó được sử dụng làm tín hiệu đầu vào cho giai đoạn tiếp theo.

Lmk2Video

Đối với một hình ảnh chân dung tham chiếu và một chuỗi các điểm mốc trên khuôn mặt, mô-đun Lmk2Video tạo ra một hình ảnh động chân thực và nhất quán về thời gian, với hình ảnh động này được căn chỉnh với chuyển động của chuỗi điểm mốc, và duy trì một hình ảnh nhất quán với hình ảnh tham chiếu. Thiết kế của cấu trúc mạng Lmk2Video tìm kiếm cảm hứng từ khung hình AnimateAnyone hiện có. Khung hình sử dụng Stable Diffusion 1.5, một mô hình khuếch tán cực kỳ mạnh mẽ làm xương sống, và tích hợp một mô-đun chuyển động để chuyển đổi các đầu vào nhiễu đa khung thành một chuỗi các khung hình video. Đồng thời, một thành phần mạng ReferencenNet phản ánh cấu trúc của Stable Diffusion 1.5, và sử dụng nó để trích xuất thông tin hình ảnh từ hình ảnh tham chiếu, và tích hợp thông tin này vào xương sống. Thiết kế chiến lược đảm bảo rằng nhận dạng khuôn mặt vẫn nhất quán trên toàn bộ video đầu ra. Khác với khung hình AnimateAnyone, khung hình AniPortrait tăng cường độ phức tạp của thiết kế PoseGuider. Phiên bản gốc của khung hình AnimateAnyone chỉ bao gồm một vài lớp convolution sau khi các tính năng điểm mốc hợp nhất với các latents tại lớp đầu vào của xương sống. Khung hình AniPortrait phát hiện ra rằng thiết kế này không đủ để bắt được các chuyển động tinh tế của môi, và để giải quyết vấn đề này, khung hình áp dụng chiến lược đa quy mô của kiến trúc ConvNet, và tích hợp các tính năng điểm mốc tương ứng vào các khối khác nhau của xương sống. Hơn nữa, khung hình giới thiệu một cải tiến bổ sung bằng cách bao gồm các điểm mốc của hình ảnh tham chiếu làm đầu vào bổ sung. Mô-đun chú ý chéo của thành phần PoseGuider cho phép tương tác giữa các điểm mốc mục tiêu của mỗi khung và các điểm mốc tham chiếu. Quá trình này cung cấp cho mạng các tín hiệu bổ sung để hiểu mối quan hệ giữa hình ảnh và các điểm mốc trên khuôn mặt, do đó hỗ trợ việc tạo ra các hình ảnh động chân thực với chuyển động chính xác hơn.

AniPortrait: Triển khai và Kết quả

Đối với giai đoạn Audio2Lmk, khung hình AniPortrait sử dụng thành phần wav2vec2.0 làm xương sống, và tận dụng kiến trúc MediaPipe để trích xuất lưới 3D và tư thế 6D cho chú thích. Mô hình lấy dữ liệu đào tạo cho mô-đun Audio2Mesh từ tập dữ liệu nội bộ bao gồm gần 60 phút dữ liệu âm thanh chất lượng cao từ một người nói. Để đảm bảo lưới 3D được trích xuất bởi thành phần MediaPipe là ổn định, người nói được hướng dẫn để đối mặt với máy ảnh và duy trì vị trí đầu ổn định trong suốt quá trình ghi âm. Đối với mô-đun Lmk2Video, khung hình AniPortrait thực hiện một phương pháp đào tạo hai giai đoạn. Trong giai đoạn đầu, khung hình tập trung vào việc đào tạo ReferenceNet và PoseGuider, thành phần 2D của xương sống, và loại bỏ mô-đun chuyển động. Trong bước thứ hai, khung hình đóng băng tất cả các thành phần khác và tập trung vào đào tạo mô-đun chuyển động. Đối với giai đoạn này, khung hình sử dụng hai tập dữ liệu video khuôn mặt chất lượng cao lớn để đào tạo mô hình, và xử lý tất cả dữ liệu bằng cách sử dụng thành phần MediaPipe để trích xuất các điểm mốc 2D trên khuôn mặt. Hơn nữa, để tăng cường độ nhạy của mạng đối với chuyển động của môi, mô hình AniPortrait phân biệt môi trên và môi dưới bằng màu sắc khác nhau khi渲染 hình ảnh tư thế từ các điểm mốc 2D.

Như được trình bày trong hình ảnh dưới đây, khung hình AniPortrait tạo ra một loạt các hình ảnh động thể hiện chất lượng vượt trội cũng như tính chân thực.

Khung hình sau đó sử dụng một biểu diễn 3D trung gian có thể được chỉnh sửa để điều khiển đầu ra theo yêu cầu. Ví dụ, người dùng có thể trích xuất các điểm mốc từ một nguồn nhất định và thay đổi ID của nó, cho phép khung hình AniPortrait tạo ra một hiệu ứng tái tạo khuôn mặt.

Lời kết

Trong bài viết này, chúng tôi đã thảo luận về AniPortrait, một khung hình mới được thiết kế để tạo ra các hình ảnh động chất lượng cao dựa trên một hình ảnh chân dung tham chiếu và một mẫu âm thanh. Bằng cách nhập một hình ảnh tham chiếu và một mẫu âm thanh, khung hình AniPortrait có thể tạo ra một video chân dung với chuyển động tự nhiên của đầu và chuyển động mượt mà của môi. Bằng cách tận dụng khả năng tổng quát hóa mạnh mẽ của mô hình khuếch tán, khung hình AniPortrait tạo ra các hình ảnh động thể hiện chất lượng hình ảnh thực tế và chuyển động giống như cuộc sống. Cơ chế của khung hình AniPortrait được chia thành hai giai đoạn. Đầu tiên, khung hình trích xuất các biểu diễn 3D trung gian từ các mẫu âm thanh và chiếu chúng vào một chuỗi các điểm mốc trên khuôn mặt 2D. Sau đó, khung hình sử dụng một mô hình khuếch tán mạnh mẽ kết hợp với một mô-đun chuyển động để chuyển đổi chuỗi điểm mốc thành các hình ảnh động chân thực và nhất quán về thời gian. Kết quả thực nghiệm cho thấy sự vượt trội và khả năng của khung hình AniPortrait trong việc tạo ra các hình ảnh động chất lượng cao với chất lượng hình ảnh tuyệt vời, sự đa dạng của tư thế và tự nhiên của khuôn mặt, do đó mang lại một trải nghiệm nhận thức được nâng cao và phong phú. Hơn nữa, khung hình AniPortrait còn có tiềm năng đáng kể về khả năng kiểm soát và linh hoạt, và có thể được áp dụng hiệu quả trong các lĩnh vực bao gồm tái tạo khuôn mặt, chỉnh sửa chuyển động khuôn mặt và nhiều hơn nữa.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.