Mô hình và nền tảng AI

MagicDance: Tạo Video Nhảy Con Người Thực Tế

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo là một trong những lĩnh vực được thảo luận nhiều nhất trong ngành công nghiệp AI, nhờ vào các ứng dụng tiềm năng trên nhiều nhiệm vụ thời gian thực. Trong những năm gần đây, các khuôn khổ thị giác máy tính đã phát triển nhanh chóng, với các mô hình hiện đại hiện có thể phân tích các đặc điểm khuôn mặt, đối tượng và nhiều hơn nữa trong các tình huống thời gian thực. Mặc dù có những khả năng này, việc chuyển động con người vẫn là một thách thức đáng kể đối với các mô hình thị giác máy tính. Nhiệm vụ này liên quan đến việc chuyển mục tiêu các chuyển động khuôn mặt và cơ thể từ hình ảnh hoặc video nguồn đến hình ảnh hoặc video mục tiêu. Việc chuyển động con người được sử dụng rộng rãi trong các mô hình thị giác máy tính để tạo kiểu hình ảnh hoặc video, chỉnh sửa nội dung đa phương tiện, tổng hợp con người kỹ thuật số và thậm chí tạo dữ liệu cho các khuôn khổ dựa trên nhận thức.

Trong bài viết này, chúng tôi tập trung vào MagicDance, một mô hình dựa trên sự khuếch tán được thiết kế để cách mạng hóa việc chuyển động con người. Khuôn khổ MagicDance đặc biệt nhằm mục đích chuyển các biểu cảm khuôn mặt và chuyển động con người 2D lên các video nhảy con người đầy thách thức. Mục tiêu của nó là tạo ra các video nhảy con người mới với các trình tự tư thế được điều khiển bởi các bản sắc mục tiêu cụ thể trong khi duy trì bản sắc ban đầu. Khuôn khổ MagicDance sử dụng một chiến lược đào tạo hai giai đoạn, tập trung vào việc phân tách chuyển động con người và các yếu tố ngoại hình như màu da, biểu cảm khuôn mặt và quần áo. Chúng tôi sẽ khám phá khuôn khổ MagicDance, khám phá kiến trúc, chức năng và hiệu suất của nó so với các khuôn khổ chuyển động con người khác hiện có.

MagicDance: Chuyển Động Con Người Thực Tế

Như đã đề cập trước đó, việc chuyển động con người là một trong những nhiệm vụ phức tạp nhất của thị giác máy tính do sự phức tạp liên quan đến việc chuyển các chuyển động và biểu cảm con người từ hình ảnh hoặc video nguồn đến hình ảnh hoặc video mục tiêu. Truyền thống, các khuôn khổ thị giác máy tính đã đạt được việc chuyển động con người bằng cách đào tạo một mô hình sinh tổng hợp cụ thể cho nhiệm vụ, bao gồm GAN hoặc Mạng Adversarial Sinh Tổng Hợp trên các tập dữ liệu mục tiêu cho các biểu cảm khuôn mặt và tư thế cơ thể. Mặc dù đào tạo và sử dụng các mô hình sinh tổng hợp mang lại kết quả hài lòng trong một số trường hợp, chúng thường gặp phải hai hạn chế chính.

  1. Họ phụ thuộc nặng vào một thành phần biến dạng hình ảnh do đó chúng thường gặp khó khăn trong việc nội suy các bộ phận cơ thể không nhìn thấy trong hình ảnh nguồn do sự thay đổi về góc nhìn hoặc tự che khuất.
  2. Họ không thể tổng quát hóa với các hình ảnh khác được lấy từ bên ngoài, điều này hạn chế ứng dụng của chúng, đặc biệt là trong các tình huống thời gian thực trong thế giới thực.

Các mô hình khuếch tán hiện đại đã chứng minh khả năng tạo hình ảnh vượt trội trên các điều kiện khác nhau, và các mô hình khuếch tán hiện có thể trình bày các hình ảnh mạnh mẽ trên một loạt các nhiệm vụ hạ nguồn như tạo video và tạo hình ảnh bằng cách học từ các tập dữ liệu hình ảnh có quy mô web. Nhờ vào khả năng của chúng, các mô hình khuếch tán có thể là lựa chọn lý tưởng cho các nhiệm vụ chuyển động con người. Mặc dù các mô hình khuếch tán có thể được thực hiện cho việc chuyển động con người, nó vẫn có một số hạn chế, либо về chất lượng của nội dung được tạo, hoặc về việc bảo tồn bản sắc hoặc gặp phải sự không nhất quán về thời gian do hạn chế của thiết kế mô hình và chiến lược đào tạo.

Để vượt qua các chướng ngại vật mà các khuôn khổ khuếch tán và GAN gặp phải trong các nhiệm vụ chuyển động con người, các nhà phát triển đã giới thiệu MagicDance, một khuôn khổ mới nhằm khai thác tiềm năng của các khuôn khổ khuếch tán cho việc chuyển động con người, thể hiện một mức độ bảo tồn bản sắc chưa từng có, chất lượng hình ảnh vượt trội và khả năng tổng quát hóa miền. Tại lõi của nó, khái niệm cơ bản của khuôn khổ MagicDance là chia vấn đề thành hai giai đoạn: kiểm soát ngoại hình và kiểm soát chuyển động, hai khả năng cần thiết cho các khuôn khổ khuếch tán để cung cấp đầu ra chuyển động chính xác.

Hình ảnh trên cung cấp một cái nhìn tổng quan về khuôn khổ MagicDance, và như có thể thấy, khuôn khổ sử dụng Mô Hình Khuếch Tán Ổn Định, và cũng triển khai hai thành phần bổ sung: Mô Hình Kiểm Soát Ngoại Hình và Mạng Kiểm Soát Tư Thế, trong đó thành phần đầu tiên cung cấp hướng dẫn về ngoại hình cho mô hình SD từ một hình ảnh tham chiếu thông qua sự chú ý, trong khi thành phần thứ hai cung cấp hướng dẫn về biểu cảm/tư thế cho mô hình khuếch tán từ một hình ảnh hoặc video có điều kiện. Khuôn khổ cũng sử dụng một chiến lược đào tạo nhiều giai đoạn để học các mô đun con này một cách hiệu quả để phân tách kiểm soát tư thế và ngoại hình.

Tóm lại, khuôn khổ MagicDance là một

  1. Khuôn khổ mới và hiệu quả bao gồm kiểm soát tư thế phân tách ngoại hình và tiền đào tạo kiểm soát ngoại hình.
  2. Khuôn khổ MagicDance có khả năng tạo ra các biểu cảm khuôn mặt con người thực tế và chuyển động con người dưới sự kiểm soát của đầu vào tư thế và hình ảnh hoặc video tham chiếu.
  3. Khuôn khổ MagicDance nhằm tạo ra nội dung con người nhất quán về ngoại hình bằng cách giới thiệu một Mô Đun Chú Ý Nguồn Đa, cung cấp hướng dẫn chính xác cho khuôn khổ UNet Khuếch Tán Ổn Định.
  4. Khuôn khổ MagicDance cũng có thể được sử dụng như một tiện ích mở rộng hoặc tiện ích bổ sung cho khuôn khổ Khuếch Tán Ổn Định, và cũng đảm bảo khả năng tương thích với các trọng số mô hình hiện có vì nó không yêu cầu tinh chỉnh thêm các tham số.

Ngoài ra, khuôn khổ MagicDance thể hiện khả năng tổng quát hóa vượt trội cho cả ngoại hình và chuyển động.

  1. Tổng Quát Hóa Ngoại Hình: Khuôn khổ MagicDance thể hiện khả năng vượt trội khi tạo ra các ngoại hình đa dạng.
  2. Tổng Quát Hóa Chuyển Động: Khuôn khổ MagicDance cũng có khả năng tạo ra một loạt các chuyển động.

MagicDance: Mục Tiêu và Kiến Trúc

Đối với một hình ảnh tham chiếu cho một con người thực hoặc một hình ảnh được tạo kiểu, mục tiêu chính của khuôn khổ MagicDance là tạo ra một hình ảnh hoặc video đầu ra được điều kiện bởi đầu vào và đầu vào tư thế {P, F} trong đó P đại diện cho khung xương tư thế con người và F đại diện cho các điểm mốc khuôn mặt. Hình ảnh hoặc video đầu ra được tạo ra nên bảo tồn ngoại hình và bản sắc của con người tham gia cùng với nội dung nền trong hình ảnh tham chiếu trong khi giữ lại tư thế và biểu cảm được xác định bởi đầu vào tư thế.

Kiến Trúc

Trong quá trình đào tạo, khuôn khổ MagicDance được đào tạo như một nhiệm vụ tái tạo khung để tái tạo chân lý với hình ảnh tham chiếu và đầu vào tư thế lấy từ cùng một video tham chiếu. Trong quá trình kiểm tra để đạt được chuyển động, đầu vào tư thế và hình ảnh tham chiếu được lấy từ các nguồn khác nhau.

Toàn bộ kiến trúc của khuôn khổ MagicDance có thể được chia thành bốn loại: Giai Đoạn Đầu, Tiền Đào Tạo Kiểm Soát Ngoại Hình, Kiểm Soát Tư Thế Phân Tách Ngoại Hình và Mô Đun Chuyển Động.

Giai Đoạn Đầu

Các Mô Hình Khuếch Tán Tiềm Năng hoặc LDM đại diện cho các mô hình khuếch tán được thiết kế độc đáo để hoạt động trong không gian tiềm năng được tạo điều kiện bởi việc sử dụng một bộ tự mã hóa, và khuôn khổ Khuếch Tán Ổn Định là một ví dụ đáng chú ý của LDMs sử dụng một Bộ Tự Mã Hóa Vector Quantized-Variational và kiến trúc U-Net thời gian. Khuôn khổ Khuếch Tán Ổn Định sử dụng một bộ mã hóa văn bản dựa trên CLIP để xử lý các đầu vào văn bản bằng cách chuyển đổi văn bản thành các bản nhúng.

TIền Đào Tạo Kiểm Soát Ngoại Hình

Một vấn đề chính với khuôn khổ ControlNet ban đầu là khả năng không kiểm soát được ngoại hình giữa các chuyển động không gian thay đổi một cách nhất quán, mặc dù nó có xu hướng tạo ra các hình ảnh có tư thế gần giống với tư thế trong hình ảnh đầu vào, với ngoại hình chung bị ảnh hưởng chủ yếu bởi các đầu vào văn bản. Mặc dù phương pháp này hoạt động, nó không phù hợp cho các nhiệm vụ chuyển động liên quan đến việc không phải là đầu vào văn bản mà là hình ảnh tham chiếu phục vụ sebagai nguồn thông tin chính về ngoại hình.

Mô Đun Tiền Đào Tạo Kiểm Soát Ngoại Hình trong khuôn khổ MagicDance được thiết kế như một nhánh phụ để cung cấp hướng dẫn về kiểm soát ngoại hình theo cách tiếp cận từng lớp. Thay vì dựa vào đầu vào văn bản, toàn bộ mô đun tập trung vào việc tận dụng các thuộc tính ngoại hình từ hình ảnh tham chiếu với mục tiêu nâng cao khả năng của khuôn khổ trong việc tạo ra các đặc điểm ngoại hình một cách chính xác, đặc biệt là trong các tình huống liên quan đến động lực học chuyển động phức tạp. Hơn nữa, chỉ có Mô Hình Kiểm Soát Ngoại Hình mới có thể đào tạo được trong quá trình tiền đào tạo kiểm soát ngoại hình.

Kiểm Soát Tư Thế Phân Tách Ngoại Hình

Một giải pháp đơn giản để kiểm soát tư thế trong hình ảnh đầu ra là tích hợp mô hình ControlNet đã được đào tạo trước trực tiếp với Mô Hình Kiểm Soát Ngoại Hình đã được đào tạo trước mà không cần tinh chỉnh. Tuy nhiên, việc tích hợp này có thể dẫn đến việc khuôn khổ gặp khó khăn trong việc kiểm soát tư thế độc lập với ngoại hình, điều này có thể dẫn đến sự không nhất quán giữa tư thế đầu vào và tư thế được tạo ra. Để giải quyết sự không nhất quán này, khuôn khổ MagicDance tinh chỉnh mô hình Pose ControlNet cùng với Mô Hình Kiểm Soát Ngoại Hình đã được đào tạo trước.

Mô Đun Chuyển Động

Khi làm việc cùng nhau, Mạng Kiểm Soát Tư Thế Phân Tách Ngoại Hình và Mô Hình Kiểm Soát Ngoại Hình có thể đạt được chuyển động từ hình ảnh đến chuyển động chính xác và hiệu quả, mặc dù nó có thể dẫn đến sự không nhất quán về thời gian. Để đảm bảo sự nhất quán về thời gian, khuôn khổ tích hợp một mô đun chuyển động bổ sung vào kiến trúc U-Net chính của Khuếch Tán Ổn Định.

MagicDance: Đào Tạo Trước và Tập Dữ Liệu

Để đào tạo trước, khuôn khổ MagicDance sử dụng một tập dữ liệu TikTok bao gồm hơn 350 video nhảy có độ dài khác nhau từ 10 đến 15 giây, ghi lại một người đang nhảy với đa số các video này chứa khuôn mặt và thân trên của con người. Khuôn khổ MagicDance trích xuất từng video riêng lẻ ở 30 FPS và chạy OpenPose trên từng khung hình riêng biệt để suy luận tư thế khung xương, tư thế tay và các điểm mốc khuôn mặt.

Để đào tạo trước, mô hình kiểm soát ngoại hình được đào tạo trước với kích thước lô 64 trên 8 GPU NVIDIA A100 trong 10.000 bước với kích thước hình ảnh 512 x 512, tiếp theo là việc tinh chỉnh chung mô hình kiểm soát tư thế và mô hình kiểm soát ngoại hình với kích thước lô 16 trong 20.000 bước. Trong quá trình đào tạo, khuôn khổ MagicDance lấy mẫu ngẫu nhiên hai khung hình làm mục tiêu và tham chiếu, với các hình ảnh được cắt ở cùng một vị trí và cùng chiều cao. Trong quá trình đánh giá, mô hình cắt hình ảnh ở trung tâm thay vì cắt chúng ngẫu nhiên.

MagicDance: Kết Quả

Kết quả thực nghiệm được thực hiện trên khuôn khổ MagicDance được trình bày trong hình ảnh sau, và như có thể thấy, khuôn khổ MagicDance vượt trội so với các khuôn khổ hiện có như Disco và DreamPose cho việc chuyển động con người trên tất cả các chỉ số. Các khuôn khổ có dấu “*” trước tên của chúng sử dụng hình ảnh mục tiêu trực tiếp làm đầu vào, bao gồm nhiều thông tin hơn so với các khuôn khổ khác.

Điều thú vị là khuôn khổ MagicDance đạt được điểm Face-Cos là 0,426, tăng 156,62% so với khuôn khổ Disco, và gần 400% khi so sánh với khuôn khổ DreamPose. Kết quả chỉ ra khả năng mạnh mẽ của khuôn khổ MagicDance trong việc bảo tồn thông tin bản sắc và sự tăng cường hiệu suất rõ ràng cho thấy sự vượt trội của khuôn khổ MagicDance so với các phương pháp hiện có.

Các hình ảnh sau so sánh chất lượng tạo video con người giữa khuôn khổ MagicDance, Disco và TPS. Như có thể thấy, kết quả được tạo ra bởi các khuôn khổ GT, Disco và TPS bị ảnh hưởng bởi sự không nhất quán về bản sắc và biểu cảm khuôn mặt con người.

Hơn nữa, hình ảnh sau minh họa việc chuyển biểu cảm khuôn mặt và tư thế con người trên tập dữ liệu TikTok với khuôn khổ MagicDance có khả năng tạo ra các biểu cảm và chuyển động thực tế và sống động dưới các đầu vào điểm mốc khuôn mặt và tư thế khung xương đa dạng, trong khi vẫn bảo tồn chính xác thông tin bản sắc từ hình ảnh tham chiếu.

Điều đáng chú ý là khuôn khổ MagicDance tự hào về khả năng tổng quát hóa vượt trội đối với các hình ảnh tham chiếu ngoài miền của các tư thế và phong cách chưa từng thấy, với khả năng kiểm soát ngoại hình ấn tượng ngay cả khi không cần tinh chỉnh thêm trên miền mục tiêu, với kết quả được trình bày trong hình ảnh sau.

Các hình ảnh sau minh họa khả năng trực quan hóa của khuôn khổ MagicDance về việc chuyển biểu cảm khuôn mặt và chuyển động con người không có tư thế. Như có thể thấy, khuôn khổ MagicDance tổng quát hóa chuyển động con người trong thế giới thực một cách hoàn hảo.

MagicDance: Giới Hạn

OpenPose là một thành phần quan trọng của khuôn khổ MagicDance vì nó đóng vai trò quan trọng trong việc kiểm soát tư thế, ảnh hưởng đến chất lượng và sự nhất quán về thời gian của các hình ảnh được tạo ra đáng kể. Tuy nhiên, khuôn khổ MagicDance vẫn gặp một số khó khăn trong việc phát hiện các điểm mốc khuôn mặt và tư thế khung xương một cách chính xác, đặc biệt là khi các đối tượng trong hình ảnh chỉ nhìn thấy một phần hoặc có chuyển động nhanh. Những vấn đề này có thể dẫn đến các artifact trong hình ảnh được tạo ra.

Kết Luận

Trong bài viết này, chúng tôi đã thảo luận về MagicDance, một mô hình dựa trên sự khuếch tán nhằm cách mạng hóa việc chuyển động con người. Khuôn khổ MagicDance cố gắng chuyển các biểu cảm khuôn mặt và chuyển động con người 2D lên các video nhảy con người đầy thách thức, với mục tiêu tạo ra các video nhảy con người mới với các trình tự tư thế được điều khiển bởi các bản sắc mục tiêu cụ thể trong khi duy trì bản sắc ban đầu. Khuôn khổ MagicDance là một chiến lược đào tạo hai giai đoạn cho việc phân tách chuyển động con người và các yếu tố ngoại hình như màu da, biểu cảm khuôn mặt và quần áo.

MagicDance là một cách tiếp cận mới để tạo video con người thực tế bằng cách kết hợp chuyển động và biểu cảm khuôn mặt, cho phép tạo ra các hình ảnh động nhất quán trong thế giới thực mà không cần tinh chỉnh thêm, thể hiện sự tiến bộ đáng kể so với các phương pháp hiện có. Hơn nữa, khuôn khổ MagicDance thể hiện khả năng tổng quát hóa vượt trội trên các trình tự chuyển động phức tạp và các bản sắc con người đa dạng, thiết lập khuôn khổ MagicDance là người dẫn đầu trong lĩnh vực chuyển động con người được hỗ trợ bởi AI và tạo video.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.