Mô hình và nền tảng AI

DynamiCrafter: Tạo hoạt hình cho hình ảnh mở với sự khuếch tán video

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo thị giác là một trong những lĩnh vực thú vị và được nghiên cứu rộng rãi trong cộng đồng trí tuệ nhân tạo ngày nay, và mặc dù sự cải tiến nhanh chóng của các mô hình thị giác máy tính, một thách thức lâu dài vẫn còn gây khó khăn cho các nhà phát triển là tạo hoạt hình cho hình ảnh. Ngay cả ngày nay, các khung tạo hoạt hình cho hình ảnh vẫn gặp khó khăn trong việc chuyển đổi hình ảnh tĩnh thành các đoạn video tương ứng hiển thị động tự nhiên trong khi vẫn giữ nguyên hình ảnh ban đầu. Thông thường, các khung tạo hoạt hình cho hình ảnh tập trung chủ yếu vào tạo hoạt hình cho các cảnh tự nhiên với các chuyển động cụ thể theo miền hoặc các động lực học ngẫu nhiên như chất lỏng và đám mây. Mặc dù cách tiếp cận này hoạt động đến một mức độ nhất định, nhưng nó vẫn hạn chế khả năng áp dụng của các khung tạo hoạt hình này cho các nội dung hình ảnh chung hơn.

Hơn nữa, các phương pháp tạo hoạt hình cho hình ảnh truyền thống tập trung chủ yếu vào tổng hợp các chuyển động dao động và ngẫu nhiên, hoặc tùy chỉnh cho các loại đối tượng cụ thể. Tuy nhiên, một khiếm khuyết đáng chú ý của cách tiếp cận này là các giả định mạnh mẽ được áp đặt lên các phương pháp này, điều này cuối cùng hạn chế khả năng áp dụng của chúng, đặc biệt là trong các tình huống chung như tạo hoạt hình cho hình ảnh mở. Trong những năm gần đây, T2V hoặc các mô hình Video từ Văn bản đã chứng minh sự thành công đáng kể trong việc tạo ra các video sống động và đa dạng bằng cách sử dụng các lời nhắc văn bản, và đây là nền tảng cho khuôn khổ DynamiCrafter.

Khuôn khổ DynamiCrafter là một nỗ lực để vượt qua các hạn chế hiện tại của các mô hình tạo hoạt hình cho hình ảnh và mở rộng khả năng áp dụng của chúng cho các tình huống chung liên quan đến hình ảnh mở. Khuôn khổ DynamiCrafter cố gắng tổng hợp nội dung động cho hình ảnh mở, chuyển đổi chúng thành các đoạn video hoạt hình. Ý tưởng chính đằng sau DynamiCrafter là kết hợp hình ảnh như một hướng dẫn vào quá trình tạo ra, nhằm tận dụng sự ưu tiên chuyển động của các mô hình khuếch tán video từ văn bản đã tồn tại. Đối với một hình ảnh nhất định, mô hình DynamiCrafter đầu tiên thực hiện một bộ chuyển đổi truy vấn mà chiếu hình ảnh vào không gian đại diện ngữ cảnh giàu tính tương đồng, cho phép mô hình video tiêu hóa nội dung hình ảnh theo cách tương thích. Tuy nhiên, mô hình DynamiCrafter vẫn gặp khó khăn trong việc giữ lại một số chi tiết hình ảnh trong các video kết quả, một vấn đề mà mô hình DynamiCrafter vượt qua bằng cách cho ăn toàn bộ hình ảnh vào mô hình khuếch tán bằng cách kết hợp hình ảnh với các nhiễu ban đầu, do đó bổ sung mô hình với thông tin hình ảnh chính xác hơn.

Bài viết này nhằm mục đích giới thiệu khuôn khổ DynamiCrafter một cách sâu sắc, và chúng tôi khám phá cơ chế, phương pháp, kiến trúc của khuôn khổ cùng với so sánh với các khuôn khổ tạo hình ảnh và video hiện đại. Vậy hãy bắt đầu.

DynamiCrafter: Tạo hoạt hình cho hình ảnh mở

Tạo hoạt hình cho một hình ảnh tĩnh thường cung cấp một trải nghiệm hình ảnh hấp dẫn cho khán giả vì nó dường như mang hình ảnh tĩnh đến với cuộc sống. Trong những năm qua, nhiều khuôn khổ đã khám phá các phương pháp khác nhau để tạo hoạt hình cho hình ảnh tĩnh. Các khuôn khổ tạo hoạt hình ban đầu thực hiện các phương pháp dựa trên mô phỏng vật lý tập trung vào mô phỏng chuyển động của các đối tượng cụ thể. Tuy nhiên, do việc mô hình hóa độc lập của mỗi loại đối tượng, các phương pháp này không hiệu quả và không có tính tổng quát. Để tái tạo các chuyển động thực tế hơn, các phương pháp dựa trên tham chiếu đã xuất hiện, chuyển giao thông tin chuyển động hoặc ngoại hình từ các tín hiệu tham chiếu như video đến quá trình tổng hợp. Mặc dù các phương pháp dựa trên tham chiếu cung cấp kết quả tốt hơn với sự nhất quán thời gian tốt hơn so với các phương pháp dựa trên mô phỏng, chúng cần hướng dẫn bổ sung, điều này hạn chế ứng dụng thực tế của chúng.

Trong những năm gần đây, hầu hết các khuôn khổ tạo hoạt hình tập trung chủ yếu vào tạo hoạt hình cho các cảnh tự nhiên với các chuyển động ngẫu nhiên, cụ thể theo miền hoặc dao động. Mặc dù cách tiếp cận được thực hiện bởi các khuôn khổ này hoạt động đến một mức độ nhất định, kết quả mà chúng tạo ra không令人 hài lòng, với nhiều khoảng trống để cải thiện. Những kết quả đáng chú ý đạt được bởi các mô hình tạo video từ văn bản trong những năm gần đây đã truyền cảm hứng cho các nhà phát triển khuôn khổ DynamiCrafter để tận dụng khả năng tạo ra của các mô hình video từ văn bản cho việc tạo hoạt hình cho hình ảnh.

Ý tưởng chính của khuôn khổ DynamiCrafter là kết hợp một hình ảnh có điều kiện vào quá trình tạo video của các mô hình khuếch tán video từ văn bản. Tuy nhiên, mục tiêu cuối cùng của việc tạo hoạt hình cho hình ảnh vẫn còn không tầm thường vì tạo hoạt hình cho hình ảnh đòi hỏi phải giữ lại chi tiết cũng như hiểu ngữ cảnh hình ảnh cần thiết để tạo ra động. Tuy nhiên, các mô hình khuếch tán video có thể điều khiển đa phương tiện như VideoComposer đã cố gắng cho phép tạo video với hướng dẫn hình ảnh từ một hình ảnh. Tuy nhiên, những cách tiếp cận này không phù hợp cho việc tạo hoạt hình cho hình ảnh vì chúng hoặc dẫn đến các thay đổi thời gian đột ngột hoặc sự phù hợp hình ảnh thấp với hình ảnh đầu vào do các cơ chế tiêm hình ảnh không đầy đủ. Để vượt qua chướng ngại vật này, khuôn khổ DynamiCrafter đề xuất một phương pháp tiêm kép, bao gồm hướng dẫn chi tiết hình ảnh và đại diện ngữ cảnh tương đồng với văn bản. Phương pháp tiêm kép cho phép khuôn khổ DynamiCrafter đảm bảo mô hình khuếch tán video tổng hợp nội dung động được bảo tồn chi tiết theo cách bổ sung.

Đối với một hình ảnh nhất định, khuôn khổ DynamiCrafter đầu tiên chiếu hình ảnh vào không gian đại diện ngữ cảnh giàu tính tương đồng bằng cách sử dụng một mạng học ngữ cảnh đặc biệt. Cụ thể hơn, không gian đại diện ngữ cảnh bao gồm một bộ chuyển đổi truy vấn có thể học được để thúc đẩy sự thích nghi của nó với các mô hình khuếch tán, và một mã hóa hình ảnh CLIP được đào tạo trước để trích xuất các tính năng hình ảnh tương đồng với văn bản. Mô hình sau đó sử dụng các tính năng ngữ cảnh giàu tính thông qua các lớp chú ý chéo, và mô hình sử dụng sự kết hợp cổng để kết hợp các tính năng văn bản này với các lớp chú ý chéo. Tuy nhiên, cách tiếp cận này trao đổi các biểu diễn ngữ cảnh đã học với các chi tiết hình ảnh tương đồng với văn bản, điều này cho phép hiểu ngữ cảnh hình ảnh một cách hợp lý và tổng hợp các động thực tế. Hơn nữa, trong một nỗ lực để bổ sung thêm các chi tiết hình ảnh, khuôn khổ kết hợp hình ảnh đầy đủ với nhiễu ban đầu vào mô hình khuếch tán. Kết quả là, cách tiếp cận tiêm kép được thực hiện bởi khuôn khổ DynamiCrafter đảm bảo sự phù hợp hình ảnh cũng như nội dung động hợp lý cho hình ảnh đầu vào.

Tiếp theo, các mô hình khuếch tán hoặc DM đã chứng minh hiệu suất đáng chú ý và khả năng tạo ra trong việc tạo hình ảnh từ văn bản. Để tái tạo thành công của các mô hình T2I cho việc tạo video, các Mô hình Khuếch tán Video hoặc VDM được đề xuất, sử dụng kiến trúc U-New không gian thời gian trong không gian pixel để mô hình hóa video độ phân giải thấp. Chuyển giao kiến thức từ các khuôn khổ T2I sang T2V sẽ giúp giảm chi phí đào tạo. Mặc dù VDM hoặc các Mô hình Khuếch tán Video có khả năng tạo ra video chất lượng cao, chúng chỉ chấp nhận lời nhắc văn bản như hướng dẫn ngữ nghĩa duy nhất, điều này có thể không phản ánh ý định thực sự của người dùng hoặc có thể không rõ ràng. Tuy nhiên, kết quả của hầu hết các mô hình VDM hiếm khi tuân thủ hình ảnh đầu vào và gặp phải vấn đề biến đổi thời gian không thực tế. Cách tiếp cận DynamiCrafter được xây dựng trên các Mô hình Khuếch tán Video có điều kiện văn bản, tận dụng sự ưu tiên động giàu tính của chúng để tạo hoạt hình cho hình ảnh mở. Nó làm như vậy bằng cách kết hợp các thiết kế tùy chỉnh cho sự hiểu biết ngữ nghĩa và phù hợp hơn với hình ảnh đầu vào.

DynamiCrafter: Phương pháp và Kiến trúc

Đối với một hình ảnh tĩnh nhất định, khuôn khổ DynamiCrafter cố gắng tạo hoạt hình cho hình ảnh, tức là sản xuất một đoạn video ngắn. Đoạn video này kế thừa nội dung hình ảnh từ hình ảnh và hiển thị động tự nhiên. Tuy nhiên, có thể hình ảnh sẽ xuất hiện ở vị trí tùy ý trong chuỗi khung hình kết quả. Sự xuất hiện của hình ảnh ở vị trí tùy ý là một loại thách thức đặc biệt được quan sát trong các nhiệm vụ tạo video có điều kiện hình ảnh với yêu cầu phù hợp hình ảnh cao. Khuôn khổ DynamiCrafter vượt qua thách thức này bằng cách sử dụng các ưu tiên tạo ra của các mô hình khuếch tán video đã được đào tạo trước.

Động từ Video từ Ưu tiên Khuếch tán

Thông thường, các mô hình tạo video từ văn bản mở đều được biết đến với việc hiển thị nội dung hình ảnh động được mô hình hóa có điều kiện trên các mô tả văn bản. Để tạo hoạt hình cho một hình ảnh tĩnh với các ưu tiên tạo ra từ văn bản, các khuôn khổ cần phải tiêm thông tin hình ảnh vào quá trình tạo video một cách toàn diện. Hơn nữa, để tổng hợp động, mô hình T2V cần tiêu hóa hình ảnh để hiểu ngữ cảnh, đồng thời cũng phải giữ lại các chi tiết hình ảnh trong các video tạo ra.

Đại diện Ngữ cảnh Tương đồng với Văn bản

Để hướng dẫn tạo video với ngữ cảnh hình ảnh, khuôn khổ DynamiCrafter cố gắng chiếu hình ảnh vào một không gian nhúng tương đồng, cho phép mô hình video sử dụng thông tin hình ảnh theo cách tương thích. Tiếp theo, khuôn khổ DynamiCrafter sử dụng mã hóa hình ảnh để trích xuất các tính năng hình ảnh từ hình ảnh đầu vào, vì các nhúng văn bản được tạo ra bằng cách sử dụng mã hóa văn bản CLIP được đào tạo trước. Bây giờ, mặc dù các token ngữ nghĩa toàn cầu từ mã hóa hình ảnh CLIP được căn chỉnh với các chú thích hình ảnh, nhưng chúng chủ yếu đại diện cho nội dung hình ảnh ở mức ngữ nghĩa, do đó không thể nắm bắt được toàn bộ hình ảnh. Khuôn khổ DynamiCrafter thực hiện các token hình ảnh đầy đủ từ lớp cuối cùng của mã hóa CLIP để trích xuất thông tin đầy đủ hơn, vì các token hình ảnh này đã chứng minh sự trung thực cao trong các nhiệm vụ tạo hình ảnh có điều kiện. Hơn nữa, khuôn khổ sử dụng các nhúng ngữ cảnh và văn bản để tương tác với các tính năng trung gian của U-Net bằng cách sử dụng các lớp chú ý chéo kép. Thiết kế của thành phần này cho phép mô hình hấp thụ các điều kiện hình ảnh theo cách phụ thuộc vào lớp. Hơn nữa, vì các lớp trung gian của kiến trúc U-Net liên quan nhiều hơn đến các tư thế hoặc hình dạng của đối tượng, nên có thể dự đoán rằng các tính năng hình ảnh sẽ ảnh hưởng chủ yếu đến ngoại hình của video, đặc biệt là vì các lớp cuối cùng liên quan nhiều hơn đến ngoại hình.

Hướng dẫn Chi tiết Hình ảnh

Khuôn khổ DynamiCrafter sử dụng đại diện ngữ cảnh giàu thông tin cho phép mô hình khuếch tán video trong kiến trúc của nó tạo ra các video giống với hình ảnh đầu vào. Tuy nhiên, như được minh họa trong hình ảnh sau, nội dung tạo ra có thể hiển thị một số sự không phù hợp do khả năng hạn chế của mã hóa CLIP được đào tạo trước để giữ lại thông tin đầu vào hoàn toàn, vì nó được thiết kế để căn chỉnh các tính năng ngôn ngữ và hình ảnh.

Để tăng cường sự phù hợp hình ảnh, khuôn khổ DynamiCrafter đề xuất cung cấp mô hình khuếch tán video với các chi tiết hình ảnh bổ sung được trích xuất từ hình ảnh đầu vào. Để đạt được điều này, mô hình DynamiCrafter kết hợp hình ảnh có điều kiện với nhiễu ban đầu cho mỗi khung hình và cho ăn chúng vào thành phần U-Net làm sạch như hướng dẫn.

Quy trình Đào tạo

Khuon khổ DynamiCrafter tích hợp hình ảnh có điều kiện thông qua hai luồng bổ sung, đóng vai trò quan trọng trong hướng dẫn chi tiết và kiểm soát ngữ cảnh. Để thực hiện điều này, mô hình DynamiCrafter sử dụng một quá trình đào tạo ba bước

  1. Trong bước đầu tiên, mô hình đào tạo mạng lưới đại diện ngữ cảnh hình ảnh.
  2. Trong bước thứ hai, mô hình thích nghi mạng lưới đại diện ngữ cảnh hình ảnh với mô hình video từ văn bản.
  3. Trong bước thứ ba và cuối cùng, mô hình tinh chỉnh mạng lưới đại diện ngữ cảnh hình ảnh cùng với thành phần Hướng dẫn Chi tiết Hình ảnh.

Để thích nghi thông tin hình ảnh cho tính tương thích với mô hình T2V, khuôn khổ DynamiCrafter đề xuất phát triển một mạng lưới đại diện ngữ cảnh, P, được thiết kế để nắm bắt các chi tiết hình ảnh tương đồng với văn bản từ hình ảnh cho trước. Nhận ra rằng P đòi hỏi nhiều bước tối ưu hóa để hội tụ, cách tiếp cận của khuôn khổ liên quan đến việc đào tạo nó trước bằng cách sử dụng một mô hình T2I đơn giản hơn. Chiến lược này cho phép mạng lưới đại diện ngữ cảnh tập trung vào việc học về ngữ cảnh hình ảnh trước khi tích hợp nó với mô hình T2V thông qua đào tạo chung với P và các lớp không gian, trái ngược với các lớp thời gian, của mô hình T2V.

Để đảm bảo tính tương thích T2V, khuôn khổ DynamiCrafter kết hợp hình ảnh đầu vào với nhiễu cho mỗi khung hình, tiếp theo là tinh chỉnh cả P và các lớp không gian của Mô hình Phân biệt Hình ảnh. Phương pháp này được chọn để duy trì tính toàn vẹn của các hiểu biết thời gian hiện có của mô hình T2V mà không có tác động tiêu cực của việc trộn hình ảnh dày đặc, điều này có thể ảnh hưởng đến hiệu suất và đi chệch khỏi mục tiêu chính của chúng tôi. Hơn nữa, khuôn khổ sử dụng chiến lược chọn ngẫu nhiên một khung hình video làm điều kiện hình ảnh để đạt được hai mục tiêu: (i) để tránh mạng phát triển một mẫu dự đoán trực tiếp liên kết hình ảnh kết hợp với một vị trí khung hình cụ thể, và (ii) để khuyến khích một đại diện ngữ cảnh có thể thích nghi hơn bằng cách ngăn chặn việc cung cấp thông tin quá cứng nhắc cho bất kỳ khung hình cụ thể nào.

DynamiCrafter: Thử nghiệm và Kết quả

Khuôn khổ DynamiCrafter đầu tiên đào tạo mạng lưới đại diện ngữ cảnh và các lớp chú ý chéo hình ảnh trên Sự khuếch tán ổn định. Sau đó, khuôn khổ thay thế thành phần Sự khuếch tán ổn định bằng VideoCrafter và tiếp tục tinh chỉnh mạng lưới đại diện ngữ cảnh và các lớp không gian để thích nghi, và với việc kết hợp hình ảnh. Tại thời điểm suy luận, khuôn khổ áp dụng mẫu DDIM với hướng dẫn phân loại miễn phí đa điều kiện. Hơn nữa, để đánh giá sự nhất quán thời gian và chất lượng của các video được tổng hợp trong cả miền thời gian và không gian, khuôn khổ báo cáo FVD hoặc Khoảng cách Video Frechet, cũng như KVD hoặc Khoảng cách Video Nhân, và đánh giá hiệu suất không cần đào tạo trên tất cả các phương pháp của các chuẩn mực MSR-VTT và UCF-101. Để điều tra sự phù hợp nhận thức giữa các kết quả tạo ra và hình ảnh đầu vào, khuôn khổ giới thiệu PIC hoặc Sự phù hợp Đầu vào Nhận thức, và áp dụng khoảng cách nhận thức DreamSim làm hàm khoảng cách.

Hình sau minh họa so sánh trực quan của nội dung hoạt hình tạo ra với các phong cách và nội dung khác nhau.

Như có thể quan sát được, trong số các phương pháp khác nhau, khuôn khổ DynamiCrafter tuân thủ điều kiện hình ảnh đầu vào tốt và tạo ra các video nhất quán về thời gian. Bảng sau chứa thống kê từ một nghiên cứu người dùng với 49 người tham gia về tỷ lệ ưu tiên cho Sự nhất quán Thời gian (T.C), và Chất lượng Chuyển động (M.C) cùng với tỷ lệ chọn cho sự phù hợp hình ảnh với hình ảnh đầu vào (I.C). Như có thể quan sát được, khuôn khổ DynamiCrafter có thể vượt trội so với các phương pháp hiện có với một khoảng cách đáng kể.

Hình sau minh họa kết quả đạt được bằng cách sử dụng phương pháp tiêm kép và quy trình đào tạo.

Thoughts Cuối cùng

Trong bài viết này, chúng tôi đã thảo luận về DynamiCrafter, một nỗ lực để vượt qua các hạn chế hiện tại của các mô hình tạo hoạt hình cho hình ảnh và mở rộng khả năng áp dụng của chúng cho các tình huống chung liên quan đến hình ảnh mở. Khuôn khổ DynamiCrafter cố gắng tổng hợp nội dung động cho hình ảnh mở, chuyển đổi chúng thành các đoạn video hoạt hình. Ý tưởng chính đằng sau DynamiCrafter là kết hợp hình ảnh như một hướng dẫn vào quá trình tạo ra, nhằm tận dụng sự ưu tiên chuyển động của các mô hình khuếch tán video từ văn bản đã tồn tại. Đối với một hình ảnh nhất định, mô hình DynamiCrafter đầu tiên thực hiện một bộ chuyển đổi truy vấn mà chiếu hình ảnh vào không gian đại diện ngữ cảnh giàu tính tương đồng, cho phép mô hình video tiêu hóa nội dung hình ảnh theo cách tương thích. Tuy nhiên, mô hình DynamiCrafter vẫn gặp khó khăn trong việc giữ lại một số chi tiết hình ảnh trong các video kết quả, một vấn đề mà mô hình DynamiCrafter vượt qua bằng cách cho ăn toàn bộ hình ảnh vào mô hình khuếch tán bằng cách kết hợp hình ảnh với các nhiễu ban đầu, do đó bổ sung mô hình với thông tin hình ảnh chính xác hơn.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.