Góc nhìn Anderson
Chỉnh sửa nội dung video AI nhất quán với đầu vào được hướng dẫn bằng văn bản

Trong khi cộng đồng VFX chuyên nghiệp bị thu hút – và đôi khi cảm thấy bị đe dọa – bởi những đổi mới mới trong tổng hợp hình ảnh và video, sự thiếu tính liên tục thời gian trong hầu hết các dự án chỉnh sửa video dựa trên AI khiến nhiều nỗ lực này thuộc về lĩnh vực ‘psychedelic’, với texture và cấu trúc thay đổi nhanh chóng và các hiệu ứng không nhất quán và công nghệ thô sơ giống như thời kỳ photochemical của hiệu ứng hình ảnh.
Nếu bạn muốn thay đổi một điều gì đó rất cụ thể trong một video không thuộc phạm vi của deepfakes (tức là áp đặt một bản sắc mới lên footage hiện có của một người), hầu hết các giải pháp hiện tại hoạt động dưới các hạn chế nghiêm trọng, về độ chính xác cần thiết cho hiệu ứng hình ảnh chất lượng sản xuất.
Một ngoại lệ là công việc đang diễn ra của một liên minh lỏng lẻo của các học giả từ Viện Khoa học Weizmann. Vào năm 2021, ba nhà nghiên cứu của nó, liên kết với Adobe, đã công bố một phương pháp mới để phân hủy video và áp dụng một bản đồ nội bộ nhất quán – một atlas thần kinh phân lớp – vào một đầu ra tổng hợp, hoàn chỉnh với các kênh alpha và đầu ra nhất quán theo thời gian.

Từ bài báo năm 2021: một ước tính của toàn bộ hành trình của con đường trong clip nguồn được chỉnh sửa thông qua một mạng thần kinh theo cách truyền thống sẽ yêu cầu quay và chỉnh sửa rộng rãi. Vì các yếu tố nền và tiền cảnh được xử lý bởi các mạng khác nhau, các mặt nạ thực sự là ‘tự động’. Nguồn: https://layered-neural-atlases.github.io/
Mặc dù nó rơi vào một lĩnh vực được bao phủ bởi lưu lượng quang học trong các pipeline VFX, atlas phân lớp không có tương đương trực tiếp trong các công việc CGI truyền thống, vì nó cơ bản cấu thành một ‘bản đồ texture thời gian’ có thể được sản xuất và chỉnh sửa thông qua các phương pháp phần mềm truyền thống. Trong hình ảnh thứ hai trong hình minh họa trên, nền của bề mặt đường được đại diện (tượng trưng) trên toàn bộ thời gian chạy của video. Thay đổi hình ảnh cơ sở (hình ảnh thứ ba từ trái trong hình minh họa trên) tạo ra một thay đổi nhất quán trong nền.
Các hình ảnh của ‘atlas mở rộng’ trên chỉ đại diện cho các khung hình riêng lẻ được giải thích; các thay đổi nhất quán trong bất kỳ khung hình mục tiêu nào được ánh xạ lại đến khung hình gốc, giữ lại bất kỳ che khuất cần thiết nào và các hiệu ứng cảnh khác, chẳng hạn như bóng hoặc phản xạ.
Cấu trúc cốt lõi sử dụng một Multilayer Perceptron (MLP) để đại diện cho các atlas mở rộng, kênh alpha và ánh xạ, tất cả đều được tối ưu hóa cùng nhau, và hoàn toàn trong không gian 2D, loại bỏ sự cần thiết của kiến thức trước về các điểm hình học 3D, bản đồ độ sâu và các yếu tố CGI khác.
Atlas tham chiếu của các đối tượng riêng lẻ cũng có thể được thay đổi một cách đáng tin cậy:

Thay đổi nhất quán đối với một đối tượng di chuyển theo khuôn khổ năm 2021. Nguồn: https://www.youtube.com/watch?v=aQhakPFC4oQ
Text2Live
Ba nhà nghiên cứu gốc của bài báo năm 2021, cùng với nghiên cứu của NVIDIA, là những người đóng góp cho một đổi mới mới về kỹ thuật kết hợp sức mạnh của các atlas phân lớp với loại công nghệ hướng dẫn văn bản CLIP đã trở lại nổi bật vào tuần này với phát hành khuôn khổ DALL-E 2 của OpenAI.
Kiến trúc mới, có tên Text2Live, cho phép người dùng cuối tạo các chỉnh sửa cục bộ cho nội dung video thực dựa trên các lệnh văn bản:


Hai ví dụ về chỉnh sửa tiền cảnh. Để có độ phân giải và định nghĩa tốt hơn, hãy xem các video gốc tại https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live cung cấp chỉnh sửa ngữ nghĩa và cục bộ cao mà không cần sử dụng một máy phát sinh trước, bằng cách sử dụng một cơ sở dữ liệu nội bộ cụ thể cho clip video đang bị ảnh hưởng.

Biến đổi nền và tiền cảnh (đối tượng) dưới Text2Live. Nguồn: https://text2live.github.io/sm/pages/video_results_atlases.html
Kỹ thuật này không yêu cầu người dùng cung cấp mặt nạ, chẳng hạn như một quy trình quay và chỉnh sửa thông thường, mà thay vào đó ước tính bản đồ liên quan thông qua một kỹ thuật khởi động dựa trên nghiên cứu năm 2021 từ Trường Khoa học Máy tính tại Đại học Tel Aviv và Nghiên cứu Trí tuệ Nhân tạo Facebook (FAIR).

Bản đồ đầu ra được tạo ra thông qua mô hình chú ý chung dựa trên biến thể.
Cấu trúc
Text2Live bao gồm một máy phát sinh được đào tạo trên một hình ảnh đầu vào duy nhất và các lệnh văn bản mục tiêu. Một mô hình CLIP được đào tạo trước trên 400 triệu cặp văn bản/hình ảnh cung cấp tài liệu trực quan liên quan mà các biến đổi người dùng có thể được giải thích.

Máy phát sinh chấp nhận một hình ảnh đầu vào (khung hình) và đầu ra một lớp RGBA mục tiêu chứa thông tin màu sắc và độ trong suốt. Lớp này sau đó được tổng hợp vào footage gốc với các tăng cường thêm.

Kênh alpha trong lớp RGBA được tạo ra cung cấp một chức năng tổng hợp nội bộ mà không cần đến các pipeline truyền thống liên quan đến phần mềm dựa trên pixel như After Effects.
Bằng cách đào tạo trên các hình ảnh nội bộ liên quan đến video hoặc hình ảnh mục tiêu, Text2Live tránh yêu cầu phải đảo ngược hình ảnh đầu vào vào không gian tiềm ẩn của một Mạng Đối nghịch Sinh (GAN), một thực hành hiện tại chưa chính xác cho yêu cầu chỉnh sửa video sản xuất, hoặc sử dụng một mô hình khuếch tán mà chính xác và có thể định cấu hình hơn, nhưng không thể duy trì độ trung thực với video mục tiêu.

Sundry prompt-based transformation edits từ Text2Live.
Các phương pháp trước đây đã sử dụng phương pháp dựa trên sự lan truyền hoặc các phương pháp dựa trên lưu lượng quang học. Vì những kỹ thuật này là dựa trên khung hình theo một mức độ nào đó, không có khả năng tạo ra một ngoại hình nhất quán theo thời gian của các thay đổi trong video đầu ra. Thay vào đó, một atlas thần kinh phân lớp cung cấp một không gian duy nhất để giải quyết các thay đổi, có thể vẫn trung thành với thay đổi đã cam kết khi video tiến triển.

Không có ‘sizzling’ hoặc ảo giác ngẫu nhiên: Text2Live thu được một giải thích của lệnh văn bản ‘xe jeep gỉ sét’, và áp dụng nó một lần vào atlas thần kinh phân lớp của xe trong video, thay vì khởi động lại biến đổi cho mỗi khung hình được giải thích.
Text2Live gần hơn với một bước đột phá trong lĩnh vực tổng hợp AI, hơn là trong không gian văn bản-sang-hình ảnh phong phú đã thu hút sự chú ý lớn vào tuần này với việc phát hành thế hệ thứ hai của khuôn khổ DALL-E của OpenAI (có thể kết hợp hình ảnh mục tiêu như một phần của quá trình biến đổi, nhưng vẫn bị giới hạn trong khả năng can thiệp trực tiếp vào một bức ảnh, ngoài các hạn chế về dữ liệu đào tạo nguồn và áp dụng các bộ lọc được thiết kế để ngăn chặn lạm dụng người dùng).
Thay vào đó, Text2Live cho phép người dùng cuối trích xuất một atlas và sau đó chỉnh sửa nó trong một lần trong các môi trường pixel có kiểm soát cao như Photoshop (và có thể thậm chí là các khung tổng hợp hình ảnh trừu tượng hơn như NeRF), trước khi đưa nó trở lại vào một môi trường được định hướng đúng cách mà không dựa vào ước tính 3D hoặc các phương pháp CGI dựa trên hậu cảnh.
Hơn nữa, Text2Live, theo các tác giả, là khuôn khổ đầu tiên có thể đạt được mặt nạ và tổng hợp trong một cách hoàn toàn tự động.
Được xuất bản lần đầu vào ngày 7 tháng 4 năm 2022.













