Mô hình và nền tảng AI

Mô hình khuếch tán video ổn định: Mô hình khuếch tán video tiềm ẩn và mô hình video tạo sinh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trí tuệ nhân tạo tạo sinh đã là một lực lượng thúc đẩy trong cộng đồng trí tuệ nhân tạo trong một thời gian, và những tiến bộ trong lĩnh vực mô hình hóa hình ảnh tạo sinh, đặc biệt là với việc sử dụng mô hình khuếch tán, đã giúp các mô hình video tạo sinh tiến bộ đáng kể không chỉ trong nghiên cứu mà còn trong các ứng dụng thực tế. Thông thường, các mô hình video tạo sinh được đào tạo từ đầu hoặc được tinh chỉnh một phần hoặc hoàn toàn từ các mô hình hình ảnh được đào tạo trước với các lớp thời gian bổ sung, trên một hỗn hợp của các tập dữ liệu hình ảnh và video.

Tiếp tục các tiến bộ trong mô hình video tạo sinh, trong bài viết này, chúng ta sẽ nói về Mô hình khuếch tán video ổn định, một mô hình khuếch tán video tiềm ẩn có khả năng tạo ra nội dung video chất lượng cao, hình ảnh đến video và văn bản đến video. Chúng ta sẽ nói về cách các mô hình khuếch tán tiềm ẩn được đào tạo để tổng hợp hình ảnh 2D đã cải thiện khả năng và hiệu quả của các mô hình video tạo sinh bằng cách thêm các lớp thời gian và tinh chỉnh các mô hình trên các tập dữ liệu nhỏ gồm các video chất lượng cao. Chúng ta sẽ có một cái nhìn sâu hơn về kiến trúc và hoạt động của Mô hình khuếch tán video ổn định, và đánh giá hiệu suất của nó trên các chỉ số và so sánh nó với các khuôn khổ tạo sinh video hiện tại.

Mô hình khuếch tán video ổn định và mô hình video tạo sinh: Giới thiệu

Cảm ơn tiềm năng gần như vô tận của nó, Trí tuệ nhân tạo tạo sinh đã là chủ đề nghiên cứu chính cho các nhà thực hành trí tuệ nhân tạo và máy học trong một thời gian, và những năm gần đây đã chứng kiến sự tiến bộ nhanh chóng cả về hiệu suất và hiệu quả của các mô hình hình ảnh tạo sinh. Những kiến thức từ các mô hình hình ảnh tạo sinh đã cho phép các nhà nghiên cứu và nhà phát triển tiến bộ trong mô hình video tạo sinh, dẫn đến sự tăng cường về tính thực tế và ứng dụng thực tế. Tuy nhiên, hầu hết các nghiên cứu nhằm cải thiện khả năng của các mô hình video tạo sinh tập trung chủ yếu vào việc sắp xếp chính xác các lớp thời gian và không gian, với ít chú ý đến việc điều tra ảnh hưởng của việc chọn dữ liệu phù hợp đến kết quả của các mô hình tạo sinh này.

Cảm ơn sự tiến bộ của các mô hình hình ảnh tạo sinh, các nhà nghiên cứu đã quan sát thấy rằng tác động của phân phối dữ liệu đào tạo đến hiệu suất của các mô hình tạo sinh là rất quan trọng và không thể phủ nhận. Hơn nữa, các nhà nghiên cứu cũng đã quan sát thấy rằng việc đào tạo trước một mô hình hình ảnh tạo sinh trên một tập dữ liệu lớn và đa dạng, sau đó tinh chỉnh nó trên một tập dữ liệu nhỏ hơn với chất lượng tốt hơn thường dẫn đến cải thiện hiệu suất đáng kể. Thông thường, các mô hình video tạo sinh thực hiện các kiến thức thu được từ các mô hình hình ảnh tạo sinh thành công, và các nhà nghiên cứu vẫn chưa nghiên cứu về ảnh hưởng của dữ liệu và chiến lược đào tạo. Mô hình khuếch tán video ổn định là một nỗ lực để cải thiện khả năng của các mô hình video tạo sinh bằng cách đi vào các lãnh vực chưa được khám phá trước đây, với sự tập trung đặc biệt vào việc chọn dữ liệu.

Các mô hình video tạo sinh gần đây dựa trên mô hình khuếch tán, và các phương pháp điều kiện văn bản hoặc hình ảnh để tổng hợp nhiều khung hình video hoặc hình ảnh nhất quán. Mô hình khuếch tán được biết đến với khả năng học cách dần dần làm sạch một mẫu từ phân phối chuẩn bằng cách thực hiện một quá trình tinh chỉnh lặp lại, và chúng đã mang lại kết quả mong muốn trên tổng hợp video và văn bản đến hình ảnh chất lượng cao. Sử dụng cùng nguyên tắc cốt lõi, Mô hình khuếch tán video ổn định đào tạo một mô hình khuếch tán video tiềm ẩn trên tập dữ liệu video của nó, cùng với việc sử dụng Mạng đối nghịch tạo sinh hoặc GAN, và thậm chí các mô hình tự hồi quy đến một mức độ nhất định.

Mô hình khuếch tán video ổn định theo đuổi một chiến lược độc đáo chưa từng được thực hiện bởi bất kỳ mô hình video tạo sinh nào, vì nó dựa trên các mô hình khuếch tán video tiềm ẩn với kiến trúc cố định và chiến lược đào tạo cố định, sau đó đánh giá ảnh hưởng của việc thu thập dữ liệu. Mô hình khuếch tán video ổn định nhằm thực hiện các đóng góp sau trong lĩnh vực mô hình hóa video tạo sinh.

  1. Trình bày một quy trình thu thập dữ liệu hệ thống và hiệu quả nhằm chuyển đổi một tập hợp lớn các mẫu video không được thu thập thành một tập dữ liệu chất lượng cao được sử dụng bởi các mô hình video tạo sinh.
  2. Đào tạo các mô hình hình ảnh đến video và văn bản đến video hiện đại vượt trội so với các khuôn khổ hiện tại.
  3. Tiến hành các thí nghiệm chuyên biệt để kiểm tra sự hiểu biết 3D và sự ưu tiên mạnh mẽ của chuyển động của mô hình.

Bây giờ, Mô hình khuếch tán video ổn định thực hiện các kiến thức từ các mô hình khuếch tán video tiềm ẩn và kỹ thuật thu thập dữ liệu tại cốt lõi của nền tảng của nó.

Mô hình khuếch tán video tiềm ẩn

Mô hình khuếch tán video tiềm ẩn hoặc Video-LDM thực hiện cách tiếp cận đào tạo mô hình tạo sinh chính trong không gian tiềm ẩn với độ phức tạp tính toán giảm, và hầu hết các Video-LDM thực hiện một mô hình văn bản đến hình ảnh được đào tạo trước kết hợp với việc thêm các lớp trộn thời gian vào kiến trúc đào tạo trước. Kết quả là, hầu hết các Mô hình khuếch tán video tiềm ẩn chỉ đào tạo các lớp thời gian hoặc bỏ qua quá trình đào tạo hoàn toàn, không giống như Mô hình khuếch tán video ổn định, nó tinh chỉnh toàn bộ khuôn khổ.

Thu thập dữ liệu

Thu thập dữ liệu là một thành phần thiết yếu không chỉ của Mô hình khuếch tán video ổn định mà còn của các mô hình tạo sinh nói chung, vì điều quan trọng là phải đào tạo trước các mô hình lớn trên các tập dữ liệu lớn để tăng hiệu suất trên các nhiệm vụ khác nhau, bao gồm mô hình hóa ngôn ngữ, hoặc tạo sinh văn bản đến hình ảnh phân biệt, và nhiều hơn nữa. Thu thập dữ liệu đã được thực hiện thành công trên các mô hình hình ảnh tạo sinh bằng cách tận dụng khả năng của các biểu diễn ngôn ngữ-hình ảnh hiệu quả, mặc dù những cuộc thảo luận như vậy chưa bao giờ tập trung vào việc phát triển các mô hình video tạo sinh.

Thu thập dữ liệu cho tổng hợp video chất lượng cao

Như đã thảo luận trong phần trước, Mô hình khuếch tán video ổn định thực hiện một chiến lược đào tạo ba giai đoạn, dẫn đến kết quả được cải thiện và tăng hiệu suất đáng kể. Giai đoạn I là đào tạo hình ảnh sử dụng một mô hình khuếch tán hình ảnh đến văn bản 2D. Giai đoạn II là đào tạo video trong đó khuôn khổ đào tạo trên một lượng lớn dữ liệu video. Cuối cùng, chúng ta có Giai đoạn III cho tinh chỉnh video trong đó mô hình được tinh chỉnh trên một tập con nhỏ của các video chất lượng cao và độ phân giải cao.

Tuy nhiên, trước khi Mô hình khuếch tán video ổn định thực hiện các giai đoạn này, điều quan trọng là phải xử lý và chú thích dữ liệu vì nó phục vụ sebagai cơ sở cho Giai đoạn II hoặc giai đoạn đào tạo video, và đóng vai trò quan trọng trong việc đảm bảo đầu ra tối ưu. Để đảm bảo hiệu quả tối đa, khuôn khổ đầu tiên thực hiện một đường ống phát hiện cắt giảm ở 3 mức FPS hoặc khung hình mỗi giây khác nhau, và nhu cầu về đường ống này được chứng minh trong hình ảnh sau.

Tiếp theo, Mô hình khuếch tán video ổn định chú thích mỗi đoạn video bằng ba phương pháp chú thích tổng hợp khác nhau. Bảng sau比较 các tập dữ liệu được sử dụng trong Khung khổ khuếch tán ổn định trước và sau quá trình lọc.

Giai đoạn I: Đào tạo hình ảnh

Giai đoạn đầu tiên trong quy trình ba giai đoạn được thực hiện trong Mô hình khuếch tán video ổn định là đào tạo hình ảnh, và để đạt được điều này, khuôn khổ Mô hình khuếch tán video ổn định ban đầu được dựa trên một mô hình khuếch tán hình ảnh được đào tạo trước, cụ thể là Stable Diffusion 2.1 mô hình, trang bị cho nó các biểu diễn trực quan mạnh mẽ hơn.

Giai đoạn II: Đào tạo video

Giai đoạn thứ hai là Giai đoạn đào tạo video, và nó xây dựng trên những phát hiện cho rằng việc sử dụng thu thập dữ liệu trong các mô hình hình ảnh tạo sinh đa phương thức thường dẫn đến kết quả tốt hơn và hiệu quả được tăng cường cùng với khả năng tạo sinh hình ảnh phân biệt mạnh mẽ. Tuy nhiên, do thiếu các biểu diễn mạnh mẽ và sẵn có để lọc ra các mẫu không mong muốn cho các mô hình video tạo sinh, Mô hình khuếch tán video ổn định dựa trên các tín hiệu đầu vào của sở thích con người để tạo ra một tập dữ liệu phù hợp cho việc đào tạo trước khuôn khổ.

Cụ thể hơn, khuôn khổ sử dụng các phương pháp khác nhau để thu thập các tập con của khuếch tán video tiềm ẩn, và xem xét xếp hạng của các mô hình LVD được đào tạo trên các tập dữ liệu này. Hơn nữa, khuôn khổ Mô hình khuếch tán video ổn định cũng phát hiện ra rằng việc sử dụng các tập dữ liệu được thu thập để đào tạo khuôn khổ giúp tăng hiệu suất của khuôn khổ, và các mô hình khuếch tán nói chung. Hơn nữa, chiến lược thu thập dữ liệu cũng hoạt động trên các tập dữ liệu lớn hơn, liên quan và thực tế hơn.

Giai đoạn III: Tinh chỉnh chất lượng cao

Đến giai đoạn II, khuôn khổ Mô hình khuếch tán video ổn định tập trung vào việc cải thiện hiệu suất trước khi đào tạo video, và trong giai đoạn thứ ba, khuôn khổ tập trung vào việc tối ưu hóa hoặc tăng cường hiệu suất của khuôn khổ sau khi tinh chỉnh video chất lượng cao, và cách chuyển đổi từ Giai đoạn II sang Giai đoạn III được thực hiện trong khuôn khổ. Trong Giai đoạn III, khuôn khổ dựa trên các kỹ thuật đào tạo được vay mượn từ các mô hình khuếch tán hình ảnh tiềm ẩn, và tăng độ phân giải của các ví dụ đào tạo.

Kết quả và phát hiện

Đã đến lúc xem xét cách khuôn khổ Mô hình khuếch tán video ổn định hoạt động trên các nhiệm vụ thực tế, và cách nó so sánh với các khuôn khổ tạo sinh video hiện tại. Khuôn khổ Mô hình khuếch tán video ổn định đầu tiên sử dụng cách tiếp cận dữ liệu tối ưu để đào tạo một mô hình cơ sở, và sau đó thực hiện tinh chỉnh để tạo ra nhiều mô hình hiện đại, mỗi mô hình thực hiện một nhiệm vụ cụ thể.

Hình ảnh trên đại diện cho các mẫu hình ảnh đến video chất lượng cao được tạo ra bởi khuôn khổ, trong khi hình ảnh sau chứng minh khả năng của khuôn khổ trong việc tạo ra các mẫu văn bản đến video chất lượng cao.

Mô hình cơ sở được đào tạo trước

Như đã thảo luận trước đó, Mô hình khuếch tán video ổn định được xây dựng trên khuôn khổ Stable Diffusion 2.1, và dựa trên những phát hiện gần đây, nó là rất quan trọng đối với các nhà phát triển để áp dụng lịch trình nhiễu và tăng nhiễu để có được hình ảnh với độ phân giải tốt hơn khi đào tạo các mô hình khuếch tán hình ảnh. Nhờ cách tiếp cận này, mô hình cơ sở Mô hình khuếch tán video ổn định học được các biểu diễn chuyển động mạnh mẽ, và trong quá trình này, vượt trội so với các mô hình cơ sở cho việc tạo sinh văn bản đến video trong một thiết lập không có dấu vết, và kết quả được hiển thị trong bảng sau.

Đ间 hình ảnh và tạo sinh đa góc nhìn

Khuôn khổ Mô hình khuếch tán video ổn định tinh chỉnh mô hình hình ảnh đến video trên các tập dữ liệu đa góc nhìn để có được nhiều góc nhìn mới của một đối tượng, và mô hình này được gọi là SVD-MV hoặc Mô hình khuếch tán video ổn định – Đa góc nhìn. Mô hình SVD ban đầu được tinh chỉnh với sự giúp đỡ của hai tập dữ liệu theo cách mà khuôn khổ nhập một hình ảnh đơn, và trả về một chuỗi hình ảnh đa góc nhìn làm đầu ra.

Như có thể thấy trong hình ảnh sau, khuôn khổ Mô hình khuếch tán video ổn định – Đa góc nhìn mang lại hiệu suất cao so sánh được với khuôn khổ Đa góc nhìn từ đầu, và kết quả là một minh chứng rõ ràng về khả năng của SVD-MV trong việc tận dụng các kiến thức thu được từ mô hình SVD ban đầu để tạo sinh đa góc nhìn.

Trong hình ảnh trên, các chỉ số được chỉ định ở phía bên trái và như có thể thấy, khuôn khổ Mô hình khuếch tán video ổn định – Đa góc nhìn vượt trội so với khuôn khổ Scratch-MV và SD2.1 Đa góc nhìn với một khoảng cách tốt. Hình ảnh thứ hai chứng minh ảnh hưởng của số lần lặp đào tạo đến hiệu suất tổng thể của khuôn khổ về điểm số Clip, và các khuôn khổ SVD-MV mang lại kết quả bền vững.

Thoughts cuối cùng

Trong bài viết này, chúng ta đã nói về Mô hình khuếch tán video ổn định, một mô hình khuếch tán video tiềm ẩn có khả năng tạo ra nội dung video chất lượng cao, hình ảnh đến video và văn bản đến video. Mô hình khuếch tán video ổn định theo đuổi một chiến lược độc đáo chưa từng được thực hiện bởi bất kỳ mô hình video tạo sinh nào, vì nó dựa trên các mô hình khuếch tán video tiềm ẩn với kiến trúc cố định và chiến lược đào tạo cố định, sau đó đánh giá ảnh hưởng của việc thu thập dữ liệu.

Chúng ta đã nói về cách các mô hình khuếch tán tiềm ẩn được đào tạo để tổng hợp hình ảnh 2D đã cải thiện khả năng và hiệu quả của các mô hình video tạo sinh bằng cách thêm các lớp thời gian và tinh chỉnh các mô hình trên các tập dữ liệu nhỏ gồm các video chất lượng cao. Để thu thập dữ liệu đào tạo trước, khuôn khổ thực hiện một nghiên cứu về khả năng mở rộng và tuân theo các phương pháp thu thập dữ liệu hệ thống, và cuối cùng đề xuất một phương pháp để thu thập một lượng lớn dữ liệu video và chuyển đổi các video nhiễu thành dữ liệu đầu vào phù hợp cho các mô hình video tạo sinh.

Hơn nữa, khuôn khổ Mô hình khuếch tán video ổn định sử dụng ba giai đoạn đào tạo mô hình video riêng biệt được phân tích độc lập để đánh giá ảnh hưởng của chúng đến hiệu suất của khuôn khổ. Khuôn khổ cuối cùng đầu ra một biểu diễn video đủ mạnh để tinh chỉnh các mô hình cho tổng hợp video tối ưu, và kết quả so sánh được với các mô hình tạo sinh video hiện tại.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.