Góc nhìn Anderson

Hệ Thống Mới cho Nhân Vật Stable Diffusion Video Temporally Consistent

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

Một sáng kiến mới từ Tập đoàn Alibaba cung cấp một trong những phương pháp tốt nhất mà tôi đã thấy để tạo ra các hình đại diện người đầy đủ từ mô hình nền tảng Stable Diffusion.

Được đặt tên là MIMO (MIMicking với Object Interactions), hệ thống này sử dụng một loạt các công nghệ và mô-đun phổ biến, bao gồm cả mô hình người CGI và AnimateDiff, để cho phép thay thế nhân vật trong video một cách nhất quán về thời gian – hoặc để điều khiển nhân vật bằng tư thế xương được người dùng xác định.

Ở đây, chúng ta thấy các nhân vật được nội suy từ một nguồn hình ảnh duy nhất và được điều khiển bởi một chuyển động được định nghĩa trước:

[Nhấp video dưới đây để phát]

Từ hình ảnh nguồn duy nhất, ba nhân vật đa dạng được điều khiển bởi một chuỗi tư thế 3D (phía trái) sử dụng hệ thống MIMO. Xem trang web dự án và video YouTube kèm theo (đính kèm ở cuối bài viết này) để biết thêm ví dụ và độ phân giải cao hơn. Nguồn: https://menyifang.github.io/projects/MIMO/index.html

Các nhân vật được tạo ra, cũng có thể được lấy từ các khung hình trong video và theo nhiều cách khác, có thể được tích hợp vào các cảnh quay thế giới thực.

MIMO cung cấp một hệ thống mới tạo ra ba mã hóa rời rạc, mỗi mã hóa cho nhân vật, cảnh và che khuất (tức là tạo mặt nạ khi một vật thể hoặc người nào đó đi qua trước nhân vật được mô tả). Các mã hóa này được tích hợp tại thời điểm suy luận.

[Nhấp video dưới đây để phát]

MIMO có thể thay thế các nhân vật gốc bằng các nhân vật photorealistic hoặc được phong cách hóa theo chuyển động từ video mục tiêu. Xem trang web dự án và video YouTube kèm theo (đính kèm ở cuối bài viết này) để biết thêm ví dụ và độ phân giải cao hơn.

Hệ thống này được đào tạo trên mô hình Stable Diffusion V1.5, sử dụng một tập dữ liệu tùy chỉnh do các nhà nghiên cứu tạo ra, và bao gồm cả video thế giới thực và mô phỏng.

Vấn đề lớn của video dựa trên sự khuếch tán là sự ổn định thời gian, nơi nội dung của video hoặc nhấp nháy hoặc ‘phát triển’ theo những cách không mong muốn cho việc đại diện nhân vật nhất quán.

MIMO, thay vào đó, sử dụng hiệu quả một hình ảnh duy nhất như một bản đồ để hướng dẫn nhất quán, có thể được điều khiển và hạn chế bởi mô hình CGI SMPL.

Kể từ khi tham chiếu nguồn là nhất quán, và mô hình nền tảng mà hệ thống được đào tạo đã được cải thiện với các ví dụ chuyển động đại diện đầy đủ, khả năng của hệ thống để tạo ra đầu ra nhất quán về thời gian là cao hơn tiêu chuẩn chung cho các hình đại diện dựa trên sự khuếch tán.

[Nhấp video dưới đây để phát]

Các ví dụ khác về nhân vật MIMO được điều khiển bởi tư thế. Xem trang web dự án và video YouTube kèm theo (đính kèm ở cuối bài viết này) để biết thêm ví dụ và độ phân giải cao hơn.

Đó là điều phổ biến hơn để sử dụng hình ảnh duy nhất làm nguồn cho các biểu diễn thần kinh hiệu quả, hoặc bằng cách kết hợp với các lời nhắc văn bản. Ví dụ, hệ thống chuyển giao khuôn mặt LivePortrait cũng có thể tạo ra các khuôn mặt giả mạo rất thuyết phục từ hình ảnh khuôn mặt duy nhất.

Các nhà nghiên cứu tin rằng các nguyên tắc được sử dụng trong hệ thống MIMO có thể được mở rộng sang các hệ thống và khuôn khổ tạo ra mới.

Bài viết mới có tiêu đề MIMO: Tổng hợp Video Nhân Vật Có thể Kiểm soát với Mô hình Không gian Phân chia, và đến từ bốn nhà nghiên cứu tại Viện Máy tính Thông minh của Tập đoàn Alibaba. Bài viết này có một trang web dự án đầy video và một video YouTube đính kèm, cũng được nhúng ở cuối bài viết này.

Phương Pháp

MIMO đạt được sự tách biệt tự động và không giám sát của ba thành phần không gian trên, trong một kiến trúc từ đầu đến cuối (tức là tất cả các quá trình con được tích hợp vào hệ thống, và người dùng chỉ cần cung cấp vật liệu đầu vào).

Sơ đồ khái niệm cho MIMO. Nguồn: https://arxiv.org/pdf/2409.16160

Sơ đồ khái niệm cho MIMO. Source: https://arxiv.org/pdf/2409.16160

Các vật thể trong video nguồn được dịch từ 2D sang 3D, ban đầu sử dụng ước lượng độ sâu đơn眼 Depth Anything. Phần nhân vật trong bất kỳ khung hình nào được trích xuất bằng các phương pháp được điều chỉnh từ dự án Tune-A-Video.

Các tính năng này sau đó được dịch thành các mặt thể tích dựa trên video thông qua kiến trúc Segment Anything 2 của Facebook Research.

Lớp cảnh được lấy bằng cách loại bỏ các vật thể được phát hiện trong hai lớp khác, cung cấp một mặt nạ tự động theo phong cách rotoscope.

Đối với chuyển động, một tập hợp các mã hóa tiềm ẩn được trích xuất cho phần nhân vật được neo vào mô hình CGI SMPL mặc định, các chuyển động của nó cung cấp ngữ cảnh cho nội dung nhân vật được kết xuất.

Bản đồ tính năng 2D cho nội dung nhân vật được lấy bằng cách sử dụng một renderer khác biệt được dẫn xuất từ một khởi xướng năm 2020 từ NVIDIA. Kết hợp dữ liệu 3D thu được từ SMPL với dữ liệu 2D thu được bằng phương pháp NVIDIA, các mã hóa tiềm ẩn đại diện cho ‘người thần kinh’ có sự tương ứng vững chắc với ngữ cảnh cuối cùng của chúng.

Ở điểm này, cần thiết phải thiết lập một tham chiếu chung thường được sử dụng trong các kiến trúc sử dụng SMPL – một tư thế chuẩn. Điều này tương tự như ‘người Vitruvian’ của Da Vinci, vì nó đại diện cho một mẫu khuôn không có tư thế có thể chấp nhận nội dung và sau đó bị biến dạng, mang nội dung được kết cấu theo nó.

Các biến dạng này, hoặc ‘sự偏差 khỏi chuẩn’, đại diện cho chuyển động của con người, trong khi mô hình SMPL bảo tồn các mã hóa tiềm ẩn tạo nên bản sắc con người đã được trích xuất, và do đó đại diện cho hình đại diện kết quả một cách chính xác về tư thế và kết cấu.

Một ví dụ về tư thế chuẩn trong hình SMPL. Nguồn: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

Một ví dụ về tư thế chuẩn trong hình SMPL. Source: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

Về vấn đề đan xen (mức độ mà dữ liệu được đào tạo có thể trở nên không linh hoạt khi bạn kéo dài nó vượt quá ranh giới và mối quan hệ đã được đào tạo), các tác giả tuyên bố*:

‘Để tách biệt hoàn toàn sự xuất hiện khỏi các khung hình video được định vị, một giải pháp lý tưởng là học đại diện con người động từ video đơn mắt và biến đổi nó từ không gian được định vị sang không gian chuẩn.

‘Vì hiệu quả, chúng tôi sử dụng một phương pháp đơn giản hóa trực tiếp biến đổi hình ảnh con người được định vị thành kết quả chuẩn trong tư thế A tiêu chuẩn bằng cách sử dụng mô hình tái định vị con người được đào tạo trước. Hình ảnh xuất hiện chuẩn được tổng hợp được cung cấp cho các bộ mã hóa ID để lấy mã .

'Thiết kế đơn giản này cho phép tách biệt hoàn toàn các thuộc tính bản sắc và chuyển động. Theo [Animate Anyone], các bộ mã hóa ID bao gồm một mã hóa hình ảnh CLIP và một kiến trúc mạng tham chiếu để nhúng cho tính năng toàn cầu và tính năng cục bộ, [tương ứng].'

Đối với các khía cạnh cảnh và che khuất, một Autoencoder (VAE - trong trường hợp này được dẫn xuất từ một xuất bản năm 2013) được sử dụng để nhúng các yếu tố cảnh và che khuất vào không gian tiềm ẩn. Các sự không nhất quán được xử lý bởi một phương pháp tô lại từ dự án ProPainter năm 2023.

Một khi được lắp ráp và chỉnh sửa theo cách này, cả nền và các vật thể che khuất trong video sẽ cung cấp một mặt nạ cho hình đại diện con người di chuyển.

Các thuộc tính phân chia này sau đó được đưa vào một kiến trúc U-Net dựa trên kiến trúc Stable Diffusion V1.5. Mã cảnh hoàn chỉnh được nối với nhiễu tiềm ẩn bản địa của hệ thống. Thành phần con người được tích hợp thông qua các lớp chú ý tự và các lớp chú ý chéo, tương ứng.

Sau đó, kết quả đã được làm sạch được xuất ra thông qua bộ giải mã VAE.

Dữ Liệu và Kiểm Tra

Để đào tạo, các nhà nghiên cứu đã tạo ra một tập dữ liệu video con người có tên HUD-7K, bao gồm 5.000 video nhân vật thực và 2.000 hoạt hình tổng hợp được tạo ra bởi hệ thống En3D. Các video thực không cần chú thích, do tính chất không ngữ nghĩa của các thủ tục trích xuất hình trong kiến trúc MIMO. Dữ liệu tổng hợp được chú thích đầy đủ.

Mô hình được đào tạo trên tám GPU NVIDIA A100 (mặc dù bài viết không chỉ định liệu đó là mô hình 40GB hoặc 80GB VRAM), trong 50 lần lặp, sử dụng 24 khung hình video và kích thước batch là bốn, cho đến khi đạt được sự hội tụ.

Mô-đun chuyển động của hệ thống được đào tạo trên các trọng số của AnimateDiff. Trong quá trình đào tạo, các trọng số của bộ mã hóa/đ码 VAE và bộ mã hóa hình ảnh CLIP được đông lạnh (trái ngược với việc đào tạo tinh chỉnh đầy đủ, sẽ có ảnh hưởng rộng hơn đến mô hình nền tảng).

Mặc dù MIMO không được thử nghiệm với các hệ thống tương tự, các nhà nghiên cứu đã kiểm tra nó trên các chuỗi chuyển động khó khăn ngoài phân phối được lấy từ AMASSMixamo. Các chuyển động này bao gồm leo núi, chơi và nhảy.

Họ cũng đã kiểm tra hệ thống trên các video con người trong thế giới thực. Trong cả hai trường hợp, bài viết báo cáo 'khả năng chống chịu cao' đối với các chuyển động 3D không nhìn thấy từ các góc nhìn khác nhau.

Mặc dù bài viết cung cấp nhiều kết quả hình ảnh tĩnh chứng minh hiệu quả của hệ thống, hiệu suất thực sự của MIMO được đánh giá tốt nhất với các kết quả video rộng rãi được cung cấp tại trang web dự án và trong video YouTube được nhúng dưới đây (từ đó các video ở đầu bài viết này được lấy).

Các tác giả kết luận:

'Kết quả thực nghiệm [chứng minh] rằng phương pháp của chúng tôi không chỉ cho phép kiểm soát nhân vật, chuyển động và cảnh linh hoạt, mà còn có khả năng mở rộng cao đến các nhân vật tùy ý, tính tổng quát đến các chuyển động 3D mới và khả năng áp dụng cho các cảnh tương tác.

'Chúng tôi cũng [tin] rằng giải pháp của chúng tôi, xem xét bản chất 3D vốn có và tự động mã hóa video 2D thành các thành phần không gian phân cấp, có thể truyền cảm hứng cho các nghiên cứu trong tương lai về tổng hợp video 3D.

'Hơn nữa, khuôn khổ của chúng tôi không chỉ phù hợp để tạo video nhân vật mà còn có thể được điều chỉnh cho các nhiệm vụ tổng hợp video có thể kiểm soát khác.'

Kết Luận

Thật tuyệt khi thấy một hệ thống hình đại diện dựa trên Stable Diffusion dường như có khả năng ổn định thời gian như vậy - không chỉ vì Gaussian Avatars dường như đang đạt được lợi thế cao trong lĩnh vực nghiên cứu cụ thể này.

Các hình đại diện được phong cách hóa trong kết quả là hiệu quả, và trong khi mức độ photorealistic mà MIMO có thể tạo ra hiện không bằng với khả năng của Gaussian Splatting, các lợi thế đa dạng của việc tạo ra con người nhất quán về thời gian trong một mạng khuếch tán tiềm ẩn dựa trên ngữ nghĩa (LDM) là đáng kể.

 

* Sự chuyển đổi của tôi từ các chú thích nội tuyến của tác giả sang các liên kết và, khi cần, các liên kết giải thích bên ngoài.

Được xuất bản lần đầu vào thứ Tư, ngày 25 tháng 9 năm 2024

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai