Mô hình và nền tảng AI

AnimateLCM: Tăng Tốc Hoá Ảnh Hoạt Hình Của Mô Hình Khói Nhân Tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong những năm gần đây, các mô hình khói đã đạt được thành công và công nhận lớn cho các nhiệm vụ tạo ảnh và video. Các mô hình khói video, đặc biệt, đã thu hút sự chú ý đáng kể do khả năng tạo ra video với độ nhất quán cao cũng như độ trung thực. Những mô hình này tạo ra video chất lượng cao bằng cách sử dụng quá trình làm sạch dần dần trong kiến trúc của chúng, biến đổi dần dần nhiễu cao chiều từ dữ liệu thực.

Mô hình Stable Diffusion là một trong những mô hình đại diện nhất cho các nhiệm vụ tạo ảnh, dựa trên mã tự động Variational (VAE) để ánh xạ giữa ảnh thực và tính năng ẩn giảm mẫu. Điều này cho phép mô hình giảm chi phí tạo, trong khi cơ chế chú ý chéo trong kiến trúc của nó giúp tạo ảnh có điều kiện văn bản. Gần đây, khuôn khổ Stable Diffusion đã xây dựng nền tảng cho nhiều bộ điều chỉnh plug-and-play để đạt được các chức năng tạo ảnh hoặc video sáng tạo và hiệu quả hơn. Tuy nhiên, quá trình tạo dần dần được sử dụng bởi hầu hết các mô hình khói video làm cho quá trình tạo ảnh tốn thời gian và tương đối tốn kém, hạn chế ứng dụng của nó.

Trong bài viết này, chúng tôi sẽ nói về AnimateLCM, một mô hình khói nhân tạo với các bộ điều chỉnh nhằm tạo ra video chất lượng cao với số bước tối thiểu và chi phí tính toán thấp. Khung khổ AnimateLCM được lấy cảm hứng từ Mô hình Nhất quán, giúp tăng tốc lấy mẫu với số bước tối thiểu bằng cách chưng cất các mô hình khói ảnh đã được đào tạo trước. Hơn nữa, sự mở rộng thành công của Mô hình Nhất quán, Mô hình Nhất quán Latent (LCM), giúp tạo ảnh có điều kiện. Thay vì thực hiện học nhất quán trực tiếp trên tập dữ liệu video thô, khung khổ AnimateLCM đề xuất sử dụng chiến lược học nhất quán phân tách. Chiến lược này phân tách sự chưng cất của các priors tạo chuyển động và priors tạo ảnh, cho phép mô hình cải thiện chất lượng hình ảnh của nội dung được tạo và tăng hiệu suất đào tạo đồng thời.

Bài viết này nhằm mục đích giới thiệu khung khổ AnimateLCM một cách sâu sắc. Chúng tôi khám phá cơ chế, phương pháp và kiến trúc của khung khổ, cùng với so sánh với các khuôn khổ tạo ảnh và video hiện đại. Vậy, hãy bắt đầu.

AnimateLCM: Ảnh Hoạt Hình Của Mô Hình Khói Nhân Tạo

Các mô hình khói đã trở thành khuôn khổ đi đến cho các nhiệm vụ tạo ảnh và video nhờ vào hiệu quả và khả năng của chúng trên các nhiệm vụ tạo. Hầu hết các mô hình khói dựa trên quá trình làm sạch dần dần để tạo ảnh, biến đổi nhiễu cao chiều từ dữ liệu thực. Mặc dù phương pháp này mang lại kết quả tương đối hài lòng, quá trình lặp lại và số lượng mẫu lặp lại làm chậm quá trình tạo và cũng tăng yêu cầu tính toán của các mô hình khói, chậm hơn so với các khuôn khổ tạo khác như GAN hoặc Mạng Đối Nghịch Tạo. Trong những năm gần đây, các Mô hình Nhất quán hoặc CM đã được đề xuất như một sự thay thế cho các mô hình khói lặp lại để tăng tốc quá trình tạo trong khi giữ nguyên yêu cầu tính toán.

Điểm nổi bật của các mô hình nhất quán là chúng học các ánh xạ nhất quán để duy trì tính nhất quán của các đường đi được giới thiệu bởi các mô hình khói đã được đào tạo trước. Quá trình học của các Mô hình Nhất quán cho phép nó tạo ra ảnh chất lượng cao với số bước tối thiểu và cũng loại bỏ nhu cầu về các lần lặp tính toán đòi hỏi. Hơn nữa, Mô hình Nhất quán Latent hoặc LCM được xây dựng trên khuôn khổ khói ổn định có thể được tích hợp vào giao diện người dùng web với các bộ điều chỉnh hiện có để đạt được nhiều chức năng bổ sung như dịch ảnh thời gian thực.

Điều đó dẫn chúng ta đến AnimateLCM, một khuôn khổ tạo video chất lượng cao cần số bước tối thiểu cho các nhiệm vụ tạo video. Theo Mô hình Nhất quán Latent, AnimateLCM xử lý quá trình khuếch tán ngược như giải quyết CFG hoặc Lưu lượng Augmented Classifier Free, và đào tạo mô hình để dự đoán giải pháp của các lưu lượng xác suất này trực tiếp trong không gian ẩn. Tuy nhiên, thay vì thực hiện học nhất quán trên dữ liệu video thô trực tiếp đòi hỏi tài nguyên đào tạo và tính toán lớn, và thường dẫn đến chất lượng kém, AnimateLCM đề xuất một chiến lược học nhất quán phân tách.

AnimateLCM đầu tiên thực hiện sự chưng cất nhất quán để điều chỉnh mô hình khói ảnh cơ sở thành mô hình nhất quán ảnh, và sau đó thực hiện việc lạm phát 3D cho cả mô hình nhất quán ảnh và mô hình khói ảnh để chứa các tính năng 3D. Cuối cùng, AnimateLCM thu được mô hình nhất quán video bằng cách thực hiện sự chưng cất nhất quán trên dữ liệu video. Hơn nữa, để giảm thiểu sự phá hủy tính năng tiềm ẩn do quá trình khói, AnimateLCM cũng đề xuất sử dụng chiến lược khởi tạo.

Ngoài ra, để đào tạo các bộ điều chỉnh cụ thể từ đầu hoặc để phù hợp với các bộ điều chỉnh công khai tốt hơn, AnimateLCM đề xuất một chiến lược tăng tốc hiệu quả cho các bộ điều chỉnh không yêu cầu đào tạo các mô hình giáo viên cụ thể.

Các đóng góp của khuôn khổ AnimateLCM có thể được tóm tắt như sau: Khung khổ AnimateLCM đề xuất nhằm đạt được tạo video chất lượng cao, nhanh và trung thực, và để đạt được điều này, AnimateLCM đề xuất một chiến lược chưng cất phân tách phân tách các priors tạo chuyển động và priors tạo ảnh, dẫn đến chất lượng tạo tốt hơn và hiệu suất đào tạo được cải thiện.

InstantID: Phương Pháp và Kiến Trúc

Ở cốt lõi, khuôn khổ InstantID lấy cảm hứng nặng từ các mô hình khói và chiến lược tăng tốc lấy mẫu. Các mô hình khói, cũng được gọi là mô hình tạo dựa trên điểm số, đã chứng minh khả năng tạo ảnh đáng chú ý. Dưới sự hướng dẫn của hướng điểm số, chiến lược lấy mẫu lặp lại được thực hiện bởi các mô hình khói làm sạch dữ liệu bị nhiễu dần dần. Hiệu quả của các mô hình khói là một trong những lý do chính tại sao chúng được sử dụng bởi hầu hết các mô hình khói video bằng cách đào tạo trên các lớp thời gian thêm.

Tiếp theo, khuôn khổ InstantID được xây dựng trên mô hình khói ổn định cho phép InstantID áp dụng các khái niệm liên quan. Mô hình này xử lý quá trình khuếch tán thuận như một Phương trình vi phân Thời gian Liên tục Bảo toàn Phương sai. Hơn nữa, mô hình khói ổn định là một mở rộng của DDPM hoặc Mô hình Khói Tạo Ngẫu nhiên, trong đó điểm dữ liệu đào tạo bị làm nhiễu dần dần bởi chuỗi Markov rời rạc với một hạt nhân làm nhiễu cho phép phân phối dữ liệu nhiễu tại các bước thời gian khác nhau.

Để đạt được tạo video chất lượng cao với số bước tối thiểu, khuôn khổ AnimateLCM thuần hóa các mô hình video dựa trên khói ổn định để tuân theo tính nhất quán tự nhiên. Cấu trúc đào tạo tổng thể của khuôn khổ AnimateLCM bao gồm một chiến lược học nhất quán phân tách cho việc thích nghi giáo viên miễn phí và học nhất quán hiệu quả.

Chuyển Từ Mô Hình Khói Sang Mô Hình Nhất quán

Khuôn khổ AnimateLCM giới thiệu sự thích nghi của mình với Mô hình Diffusion hoặc DM sang Mô hình Nhất quán hoặc CM theo thiết kế của Mô hình Nhất quán Latent hoặc LCM. Điều đáng chú ý là mặc dù các mô hình khói ổn định thường dự đoán nhiễu được thêm vào các mẫu, chúng là các mô hình khói sigma thiết yếu. Điều này trái ngược với các mô hình nhất quán nhằm dự đoán giải pháp trực tiếp cho đường đi PF-ODE.

Học Nhất quán Phân Tách

Đối với quá trình chưng cất nhất quán, các nhà phát triển đã quan sát thấy rằng dữ liệu được sử dụng cho đào tạo ảnh hưởng nặng đến chất lượng của tạo cuối cùng của các mô hình nhất quán. Tuy nhiên, vấn đề chính với các tập dữ liệu công khai hiện tại là chúng thường bao gồm dữ liệu có watermark, hoặc chất lượng thấp, và có thể chứa các chú thích quá ngắn hoặc không rõ ràng.

AnimateLCM đầu tiên thực hiện sự chưng cất nhất quán để điều chỉnh mô hình khói ảnh cơ sở thành mô hình nhất quán ảnh, và sau đó thực hiện việc lạm phát 3D cho cả mô hình nhất quán ảnh và mô hình khói ảnh để chứa các tính năng 3D. Cuối cùng, AnimateLCM thu được mô hình nhất quán video bằng cách thực hiện sự chưng cất nhất quán trên dữ liệu video.

Thích Nghi Giáo Viên Miễn Phí

Các mô hình khói ổn định và các bộ điều chỉnh plug-and-play thường đi cùng nhau. Tuy nhiên, đã được quan sát thấy rằng mặc dù các bộ điều chỉnh plug-and-play hoạt động đến một mức độ nào đó, chúng có xu hướng mất kiểm soát trong các chi tiết ngay cả khi đa số các bộ điều chỉnh này được đào tạo với các mô hình khói ảnh.

AnimateLCM: Thử Nghiệm và Kết Quả

Khuôn khổ AnimateLCM sử dụng mô hình Stable Diffusion v1-5 làm mô hình cơ sở, và thực hiện giải pháp ODE DDIM cho mục đích đào tạo. Khuôn khổ cũng áp dụng mô hình Stable Diffusion v1-5 với trọng số chuyển động mã nguồn mở làm mô hình khói video giáo viên với các thí nghiệm được thực hiện trên tập dữ liệu WebVid2M mà không có dữ liệu bổ sung hoặc tăng cường.

Kết Quả Định Lượng

Hình sau minh họa kết quả của phương pháp tạo bốn bước được thực hiện bởi khuôn khổ AnimateLCM trong tạo video từ văn bản, tạo video từ ảnh, và tạo video có thể kiểm soát.

Kết Quả Định Lượng

Hình sau minh họa kết quả định lượng và so sánh của khuôn khổ AnimateLCM với các phương pháp DDIM và DPM++ hiện đại.

Tư Duy Cuối Cùng

Trong bài viết này, chúng tôi đã nói về AnimateLCM, một mô hình khói nhân tạo với các bộ điều chỉnh nhằm tạo ra video chất lượng cao với số bước tối thiểu và chi phí tính toán thấp. Khuôn khổ AnimateLCM được lấy cảm hứng từ Mô hình Nhất quán, giúp tăng tốc lấy mẫu với số bước tối thiểu bằng cách chưng cất các mô hình khói ảnh đã được đào tạo trước.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.