Góc nhìn Anderson
Công nghệ LipSync3D của Google mang lại sự đồng bộ hóa chuyển động môi được cải tiến ‘Deepfaked’

Một hợp tác giữa các nhà nghiên cứu trí tuệ nhân tạo của Google và Viện Công nghệ Ấn Độ Kharagpur cung cấp một khuôn khổ mới để tổng hợp các đầu nói từ nội dung âm thanh. Dự án nhằm mục đích sản xuất các phương pháp tối ưu hóa và hợp lý về tài nguyên để tạo ra nội dung video ‘đầu nói’ từ âm thanh, với mục đích đồng bộ hóa chuyển động môi với âm thanh lồng tiếng hoặc dịch máy, và sử dụng trong các hình đại diện, ứng dụng tương tác và các môi trường thời gian thực khác.

Nguồn: https://www.youtube.com/watch?v=L1StbX9OznY
Các mô hình học máy được đào tạo trong quá trình này – được gọi là LipSync3D – chỉ yêu cầu một video duy nhất của danh tính khuôn mặt mục tiêu làm dữ liệu đầu vào. Đường ống chuẩn bị dữ liệu tách biệt việc trích xuất hình học khuôn mặt khỏi việc đánh giá ánh sáng và các khía cạnh khác của video đầu vào, cho phép đào tạo tiết kiệm và tập trung hơn.

Quy trình làm việc hai giai đoạn của LipSync3D. Trên cùng, việc tạo ra một khuôn mặt 3D có kết cấu động từ ‘âm thanh mục tiêu’; dưới cùng, việc chèn lưới tạo ra vào video mục tiêu.
Trên thực tế, đóng góp đáng chú ý nhất của LipSync3D đối với lĩnh vực nghiên cứu này có thể là thuật toán chuẩn hóa ánh sáng, giúp tách biệt quá trình đào tạo và suy luận về ánh sáng.

Tách biệt dữ liệu ánh sáng khỏi hình học chung giúp LipSync3D tạo ra đầu ra chuyển động môi thực tế hơn trong điều kiện khó khăn. Các phương pháp khác trong những năm gần đây đã giới hạn mình trong điều kiện ánh sáng ‘cố định’ không thể hiện khả năng hạn chế của chúng trong khía cạnh này.
Trong quá trình tiền xử lý các khung dữ liệu đầu vào, hệ thống phải xác định và loại bỏ các điểm sáng, vì những điểm này cụ thể cho điều kiện ánh sáng mà video được quay và sẽ can thiệp vào quá trình tái chiếu sáng nếu không.

LipSync3D, như tên gọi của nó, không chỉ thực hiện phân tích pixel trên các khuôn mặt mà nó đánh giá, mà còn sử dụng các điểm mốc khuôn mặt đã xác định để tạo ra các lưới CGI có thể di chuyển cùng với các kết cấu ‘mở’ được quấn quanh chúng trong một quy trình CGI truyền thống.

Chuẩn hóa tư thế trong LipSync3D. Trên bên trái là các khung đầu vào và các tính năng được phát hiện; ở giữa, các đỉnh được chuẩn hóa của lưới tạo ra; và bên phải, bản đồ kết cấu tương ứng, cung cấp sự thật cho dự đoán kết cấu. Source: https://arxiv.org/pdf/2106.04185.pdf
Bên cạnh phương pháp tái chiếu sáng mới, các nhà nghiên cứu tuyên bố rằng LipSync3D cung cấp ba đổi mới chính so với các công việc trước đây: việc tách biệt hình học, ánh sáng, tư thế và kết cấu thành các luồng dữ liệu riêng biệt trong không gian chuẩn hóa; một mô hình dự đoán kết cấu tự hồi quy dễ đào tạo tạo ra tổng hợp video nhất quán về thời gian; và sự tăng cường về tính thực tế, được đánh giá bởi xếp hạng của con người và các chỉ số khách quan.

Tách biệt các khía cạnh khác nhau của hình ảnh khuôn mặt video cho phép kiểm soát tốt hơn trong tổng hợp video.
LipSync3D có thể suy dẫn trực tiếp hình học chuyển động môi từ âm thanh bằng cách phân tích các âm vị và các khía cạnh khác của lời nói, và dịch chúng thành các tư thế cơ xung quanh miệng.

Quá trình này sử dụng một quy trình dự đoán chung, nơi hình học và kết cấu được suy dẫn có các bộ mã hóa chuyên dụng trong một thiết lập mã hóa tự động, nhưng chia sẻ một bộ mã hóa âm thanh với lời nói được áp dụng cho mô hình:
Synthesize chuyển động linh hoạt của LipSync3D cũng được thiết kế để cung cấp năng lượng cho các hình đại diện CGI được phong cách hóa, về cơ bản là thông tin lưới và kết cấu giống như hình ảnh thế giới thực:

Một hình đại diện 3D được phong cách hóa có chuyển động môi được cung cấp năng lượng theo thời gian thực bởi video của người nói nguồn. Trong kịch bản như vậy, kết quả tốt nhất sẽ được đạt được bằng cách đào tạo trước cá nhân hóa.
Các nhà nghiên cứu cũng dự đoán việc sử dụng các hình đại diện có cảm giác thực tế hơn một chút:
![]()
Thời gian đào tạo mẫu cho các video nằm trong khoảng từ 3-5 giờ cho một video 2-5 phút, trong một quy trình sử dụng TensorFlow, Python và C++ trên GeForce GTX 1080. Các phiên đào tạo sử dụng kích thước批 128 khung hình trong 500-1000 kỷ, với mỗi kỷ đại diện cho một đánh giá hoàn chỉnh của video.
Hướng tới Đồng bộ hóa Chuyển động Môi Động
Lĩnh vực đồng bộ hóa môi để phù hợp với một bản âm thanh mới đã nhận được rất nhiều sự chú ý trong nghiên cứu tầm nhìn máy tính trong những năm gần đây (xem dưới), không chỉ vì nó là một sản phẩm phụ của công nghệ deepfake gây tranh cãi.
Vào năm 2017, Đại học Washington trình bày nghiên cứu có khả năng học đồng bộ môi từ âm thanh, sử dụng nó để thay đổi chuyển động môi của cựu Tổng thống Obama. Vào năm 2018, Viện Thông tin Max Planck dẫn đầu một sáng kiến nghiên cứu khác để cho phép chuyển giao video từ danh tính này sang danh tính khác, với đồng bộ môi là một sản phẩm phụ của quá trình; và vào tháng 5 năm 2021, công ty khởi nghiệp AI FlawlessAI tiết lộ công nghệ đồng bộ môi độc quyền TrueSync, được tiếp nhận rộng rãi trong báo chí như một công cụ cho phép công nghệ lồng tiếng cải tiến cho các bản phát hành phim chính trên nhiều ngôn ngữ.
Và, tất nhiên, sự phát triển liên tục của các kho mã nguồn mở deepfake cung cấp một nhánh nghiên cứu khác đang hoạt động trong lĩnh vực tổng hợp hình ảnh khuôn mặt.











