Góc nhìn Anderson
Trình tạo video AI tốt hơn bằng cách xáo trộn khung hình trong quá trình đào tạo

Một bài báo mới được xuất bản trên Arxiv giải quyết một vấn đề mà bất kỳ ai đã áp dụng Hunyuan Video hoặc Wan 2.1 trình tạo video AI sẽ gặp phải: hiện tượng sai biệt thời gian, nơi quá trình tạo ra video có xu hướng tăng tốc đột ngột, trộn lẫn, bỏ qua hoặc làm hỏng các khoảnh khắc quan trọng trong video tạo ra:
Click để phát. Một số hiện tượng sai biệt thời gian đang trở nên quen thuộc với người dùng các hệ thống video tạo ra mới, được nhấn mạnh trong bài báo mới. Ở bên phải, hiệu ứng cải thiện của phương pháp FluxFlow mới. Nguồn: https://haroldchen19.github.io/FluxFlow/
Video trên bao gồm các đoạn trích từ các video thử nghiệm tại trang web dự án của bài báo. Chúng ta có thể thấy một số vấn đề ngày càng quen thuộc đang được giải quyết bằng phương pháp của các tác giả (hình bên phải trong video), đây基本 là một kỹ thuật xử lý dữ liệu trước có thể áp dụng cho bất kỳ kiến trúc video tạo ra nào.
Trong ví dụ đầu tiên, với ‘hai đứa trẻ chơi bóng’, được tạo ra bởi CogVideoX, chúng ta thấy (bên trái trong video tổng hợp trên và trong ví dụ cụ thể dưới đây) rằng việc tạo ra bản địa nhanh chóng nhảy qua một số chuyển động vi mô quan trọng, tăng tốc hoạt động của trẻ lên đến mức ‘hoạt hình’. Ngược lại, cùng một tập dữ liệu và phương pháp cho kết quả tốt hơn với kỹ thuật xử lý trước mới, được gọi là FluxFlow (bên phải của hình ảnh trong video dưới đây):
Click để phát.
Trong ví dụ thứ hai (sử dụng NOVA-0.6B) chúng ta thấy rằng một chuyển động trung tâm liên quan đến một con mèo đã bị hư hỏng hoặc lấy mẫu không đầy đủ ở giai đoạn đào tạo, đến mức hệ thống tạo ra video trở nên ‘đóng băng’ và không thể di chuyển chủ thể:
Click để phát.
Hiện tượng này, nơi chuyển động hoặc chủ thể bị ‘đóng băng’, là một trong những vấn đề thường gặp nhất của HV và Wan, trong các nhóm tổng hợp hình ảnh và video.
Một số vấn đề này liên quan đến vấn đề chú thích video trong tập dữ liệu nguồn, mà chúng tôi đã xem xét tuần này; nhưng các tác giả của công việc mới tập trung nỗ lực của họ vào các đặc tính thời gian của dữ liệu đào tạo, và đưa ra một lập luận thuyết phục rằng giải quyết các thách thức từ góc độ đó có thể mang lại kết quả hữu ích.
Như đã đề cập trong bài viết trước về chú thích video, một số thể thao đặc biệt khó để cô đọng thành các khoảnh khắc quan trọng, có nghĩa là các sự kiện quan trọng (như một cú dunk) không nhận được sự chú ý cần thiết trong quá trình đào tạo:
Click để phát.
Trong ví dụ trên, hệ thống tạo ra video không biết cách chuyển sang giai đoạn tiếp theo của chuyển động, và chuyển đổi bất hợp lý từ một tư thế sang tư thế khác, thay đổi thái độ và hình học của người chơi trong quá trình này.
Đây là những chuyển động lớn đã bị mất trong quá trình đào tạo – nhưng cũng dễ bị tổn thương là các chuyển động nhỏ nhưng quan trọng, chẳng hạn như việc một con bướm vỗ cánh:
Click để phát.
Không giống như cú dunk, việc vỗ cánh của bướm không phải là một sự kiện ‘hiếm’ mà là một sự kiện liên tục và đơn điệu. Tuy nhiên, sự nhất quán của nó bị mất trong quá trình lấy mẫu, vì chuyển động quá nhanh để có thể thiết lập thời gian.
Đây không phải là những vấn đề mới, nhưng chúng đang nhận được sự chú ý nhiều hơn bây giờ khi các mô hình video tạo ra mạnh mẽ có sẵn cho những người đam mê để cài đặt và tạo ra miễn phí.
Các cộng đồng trên Reddit và Discord ban đầu đã coi những vấn đề này là ‘liên quan đến người dùng’. Đây là một giả định hợp lý, vì các hệ thống đang được đề cập rất mới và tài liệu tối thiểu. Do đó, các chuyên gia đã đề xuất các giải pháp đa dạng (và không phải lúc nào cũng hiệu quả) cho một số lỗi được ghi lại ở đây, chẳng hạn như thay đổi cài đặt trong các thành phần khác nhau của các luồng ComfyUI khác nhau cho Hunyuan Video (HV) và Wan 2.1.
Trong một số trường hợp, thay vì tạo ra chuyển động nhanh, cả HV và Wan sẽ tạo ra chuyển động chậm. Các đề xuất từ Reddit và ChatGPT (đa số dựa trên Reddit) bao gồm thay đổi số khung hình trong quá trình tạo ra, hoặc giảm đáng kể tốc độ khung hình*.
Đây là tất cả những việc tuyệt vọng; sự thật đang nổi lên là chúng ta vẫn chưa biết nguyên nhân chính xác hoặc giải pháp chính xác cho những vấn đề này; rõ ràng, việc tra tấn các cài đặt tạo ra để làm việc xung quanh chúng (đặc biệt là khi điều này làm giảm chất lượng đầu ra, ví dụ như tốc độ khung hình quá thấp) chỉ là một giải pháp tạm thời, và thật tốt khi thấy rằng cảnh nghiên cứu đang giải quyết các vấn đề mới nổi này một cách nhanh chóng.
Vì vậy, bên cạnh việc xem xét cách chú thích ảnh hưởng đến đào tạo, hãy cùng xem xét bài báo mới về điều hòa thời gian, và những cải tiến nó có thể mang lại cho cảnh video tạo ra hiện tại.
Ý tưởng trung tâm khá đơn giản và tinh tế, và không kém phần quan trọng; tuy nhiên, bài báo có phần bị lạm phát để đạt được tám trang quy định, và chúng ta sẽ bỏ qua phần lạm phát này khi cần thiết.

Cá trong quá trình tạo ra bản địa của khuôn khổ VideoCrafter là tĩnh, trong khi phiên bản FluxFlow-altered thu được các thay đổi cần thiết. Nguồn: https://arxiv.org/pdf/2503.15417
Bài báo mới này có tiêu đề Điều hòa thời gian làm cho trình tạo video của bạn mạnh mẽ hơn, và đến từ tám nhà nghiên cứu trên Everlyn AI, Đại học Khoa học và Công nghệ Hồng Kông (HKUST), Đại học Trung Florida (UCF), và Đại học Hồng Kông (HKU).
(tại thời điểm viết, có một số vấn đề với trang web dự án đính kèm)
FluxFlow
Ý tưởng trung tâm đằng sau FluxFlow, lược đồ đào tạo trước mới của các tác giả, là để vượt qua các vấn đề phổ biến lấp lánh và không nhất quán thời gian bằng cách xáo trộn các khối và nhóm khối trong thứ tự khung thời gian khi dữ liệu nguồn được hiển thị cho quá trình đào tạo:

Ý tưởng trung tâm đằng sau FluxFlow là di chuyển các khối và nhóm khối vào các vị trí không thời gian và không mong đợi, như một hình thức tăng cường dữ liệu.
Bài báo giải thích:
‘[Hiện tượng] này bắt nguồn từ một hạn chế cơ bản: mặc dù tận dụng các tập dữ liệu lớn, các mô hình hiện tại thường dựa vào các mẫu thời gian đơn giản hóa trong dữ liệu đào tạo (ví dụ: hướng đi bộ cố định hoặc chuyển tiếp khung hình lặp lại) chứ không phải học các động thái thời gian đa dạng và hợp lý.
‘Vấn đề này còn được làm trầm trọng thêm bởi sự thiếu tăng cường thời gian rõ ràng trong quá trình đào tạo, khiến các mô hình dễ bị quá拟 với các mối tương quan thời gian ngẫu nhiên (ví dụ: “khung hình #5 phải theo sau #4”) chứ không phải tổng quát hóa trên các kịch bản chuyển động đa dạng.’
Hầu hết các mô hình tạo video, các tác giả giải thích, vẫn vay mượn quá nhiều từ hình ảnh tổng hợp, tập trung vào độ trung thực không gian trong khi hầu như bỏ qua trục thời gian. Mặc dù các kỹ thuật như cắt, lật và làm mờ màu đã giúp cải thiện chất lượng hình ảnh tĩnh, nhưng chúng không phải là các giải pháp đủ khi áp dụng cho video, nơi ảo giác chuyển động phụ thuộc vào các chuyển tiếp nhất quán trên các khung hình.
Kết quả là các vấn đề bao gồm các kết cấu lấp lánh, các cắt không mịn giữa các khung hình và các mẫu chuyển động quá đơn giản hoặc lặp lại.
Click để phát.
Bài báo cho rằng mặc dù một số mô hình – bao gồm Stable Video Diffusion và LlamaGen – bù đắp bằng các kiến trúc phức tạp hơn hoặc các ràng buộc được thiết kế, nhưng những điều này có chi phí về tính toán và linh hoạt.
Vì tăng cường dữ liệu thời gian đã được chứng minh là hữu ích trong các nhiệm vụ hiểu biết video (trong các khuôn khổ như FineCliper, SeFAR và SVFormer) nó thật đáng ngạc nhiên khi các tác giả khẳng định rằng chiến thuật này hiếm khi được áp dụng trong một ngữ cảnh tạo ra.
Hành vi phá vỡ
Các nhà nghiên cứu cho rằng các gián đoạn đơn giản, có cấu trúc trong thứ tự thời gian trong quá trình đào tạo giúp các mô hình tổng quát hóa tốt hơn đến các chuyển động đa dạng và thực tế:
‘Bằng cách đào tạo trên các chuỗi không có thứ tự, trình tạo ra học cách khôi phục các đường dẫn hợp lý, hiệu quả điều chỉnh entropy thời gian. FLUXFLOW bắc cầu khoảng cách giữa tăng cường thời gian phân biệt và tạo ra, cung cấp một giải pháp nâng cao plug-and-play cho việc tạo video thời gian hợp lý trong khi cải thiện chất lượng chung.
‘Không giống như các phương pháp hiện có giới thiệu các thay đổi kiến trúc hoặc dựa vào hậu xử lý, FLUXFLOW hoạt động trực tiếp ở cấp độ dữ liệu, giới thiệu các gián đoạn thời gian được kiểm soát trong quá trình đào tạo.’
Click để phát.
Các gián đoạn ở cấp độ khung hình, các tác giả cho biết, giới thiệu các gián đoạn tinh tế trong một chuỗi. Loại gián đoạn này không khác gì tăng cường dữ liệu bằng cách che, nơi các phần của dữ liệu được chặn một cách ngẫu nhiên, để ngăn chặn hệ thống quá拟 trên các điểm dữ liệu, và khuyến khích tổng quát hóa tốt hơn.
Thử nghiệm
Mặc dù ý tưởng trung tâm ở đây không đủ để tạo thành một bài báo đầy đủ, nhưng vẫn có một phần thử nghiệm mà chúng ta có thể xem xét.
Các tác giả đã thử nghiệm bốn truy vấn liên quan đến chất lượng thời gian được cải thiện trong khi vẫn duy trì độ trung thực không gian; khả năng học các động thái chuyển động / dòng quang học; duy trì chất lượng thời gian trong việc tạo ra ngoài; và độ nhạy với các siêu tham số chính.
Các nhà nghiên cứu đã áp dụng FluxFlow cho ba kiến trúc tạo ra: dựa trên U-Net, dưới dạng VideoCrafter2; dựa trên DiT, dưới dạng CogVideoX-2B; và dựa trên AR, dưới dạng NOVA-0.6B.
Để so sánh công bằng, họ đã tinh chỉnh các mô hình cơ sở của các kiến trúc với FluxFlow như một giai đoạn đào tạo bổ sung, trong một epoch, trên tập dữ liệu OpenVidHD-0.4M.
Các mô hình đã được đánh giá chống lại hai chuẩn mực phổ biến: UCF-101; và VBench.
Đối với UCF, Fréchet Video Distance (FVD) và Inception Score (IS) đã được sử dụng. Đối với VBench, các nhà nghiên cứu tập trung vào chất lượng thời gian, chất lượng khung hình và chất lượng chung.

Đánh giá ban đầu định lượng của FluxFlow-Frame. "+ Original" chỉ đào tạo mà không có FLUXFLOW, trong khi "+ Num × 1" cho thấy các cấu hình FluxFlow-Frame khác nhau. Kết quả tốt nhất được đánh dấu; kết quả tốt thứ hai được gạch chân cho mỗi mô hình.
Khi bình luận về những kết quả này, các tác giả cho biết:
‘Cả FLUXFLOW-FRAME và FLUXFLOW-BLOCK đều cải thiện đáng kể chất lượng thời gian, như được chứng minh bởi các chỉ số trong Tabs. 1, 2 (tức là FVD, Chủ đề, Lấp lánh, Chuyển động và Động) và kết quả định lượng trong [hình ảnh dưới].
‘Ví dụ, chuyển động của chiếc xe trôi dạt trong VC2, con mèo đuổi đuổi đuôi trong NOVA, và người lướt sóng cưỡi sóng trong CVX trở nên lưu loát hơn đáng kể với FLUXFLOW. Quan trọng là, những cải thiện thời gian này được thực hiện mà không hy sinh độ trung thực không gian, như được chứng minh bởi các chi tiết sắc nét của nước bắn, khói, và kết cấu sóng, cùng với các chỉ số về độ trung thực không gian và chung.’
Dưới đây là một số kết quả định lượng mà các tác giả đề cập (vui lòng xem bài báo gốc để có kết quả đầy đủ và độ phân giải tốt hơn):

Một số kết quả định lượng.
Bài báo cho rằng mặc dù cả hai phương pháp gián đoạn ở cấp độ khung hình và khối đều cải thiện chất lượng thời gian, nhưng phương pháp cấp độ khung hình có xu hướng hoạt động tốt hơn. Điều này được cho là do sự tinh tế hơn của chúng, cho phép điều chỉnh thời gian chính xác hơn. Các gián đoạn ở cấp độ khối có thể giới thiệu tiếng ồn do các mẫu không gian và thời gian được耦合 chặt chẽ trong các khối, giảm hiệu quả của chúng.
Kết luận
Bài báo này, cùng với sự hợp tác chú thích của Bytedance-Tsinghua được phát hành tuần này, đã làm rõ với tôi rằng những khiếm khuyết rõ ràng trong thế hệ mới của các mô hình video tạo ra có thể không phải là do lỗi của người dùng, sai lầm của tổ chức hoặc hạn chế về tài chính, mà là do sự tập trung nghiên cứu đã ưu tiên các thách thức cấp bách hơn, chẳng hạn như sự nhất quán thời gian và tính nhất quán, hơn những vấn đề nhỏ hơn này.
Cho đến gần đây, kết quả từ các hệ thống tạo video tạo ra miễn phí và có thể tải xuống đã bị ảnh hưởng đến mức không có nỗ lực lớn nào xuất hiện từ cộng đồng những người đam mê để giải quyết các vấn đề (chủ yếu là vì các vấn đề này là cơ bản và không dễ giải quyết).
Giờ đây, khi chúng ta đang tiến gần hơn đến kỷ nguyên dự đoán của video tạo ra hoàn toàn bằng AI, rõ ràng là cả cộng đồng nghiên cứu và cộng đồng thông thường đang quan tâm sâu sắc hơn và sản xuất hơn để giải quyết các vấn đề còn lại; với một chút may mắn, những vấn đề này không phải là không thể khắc phục.
* Tốc độ khung hình bản địa của Wan là 16fps, và để đáp ứng các vấn đề của riêng tôi, tôi lưu ý rằng các diễn đàn đã đề xuất giảm tốc độ khung hình xuống thấp đến 12fps, sau đó sử dụng FlowFrames hoặc các hệ thống tái tạo dòng chảy AI khác để nội suy các khoảng trống giữa số khung hình thưa thớt như vậy.
Được xuất bản lần đầu vào thứ Sáu, ngày 21 tháng 3 năm 2025












