Góc nhìn Anderson

Chỉnh sửa Đối tượng Trợ giúp bởi Trí tuệ Nhân tạo với Google’s Imagic và Runway’s ‘Xóa và Thay thế’

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Tuần này, hai thuật toán đồ họa mới được thúc đẩy bởi trí tuệ nhân tạo đang cung cấp các cách mới để người dùng thực hiện các thay đổi chi tiết và hiệu quả đối với các đối tượng trong ảnh.

Thuật toán đầu tiên là Imagic, từ Google Research, liên kết với Viện Công nghệ Israel và Viện Khoa học Weizmann. Imagic cung cấp chỉnh sửa đối tượng tinh tế thông qua việc tinh chỉnh các mô hình khuếch tán.

Thay đổi những gì bạn muốn, và giữ lại phần còn lại - Imagic hứa hẹn chỉnh sửa tinh tế chỉ những phần bạn muốn thay đổi. Nguồn: https://arxiv.org/pdf/2210.09276.pdf

Thay đổi những gì bạn muốn, và giữ lại phần còn lại – Imagic hứa hẹn chỉnh sửa tinh tế chỉ những phần bạn muốn thay đổi. Nguồn: https://arxiv.org/pdf/2210.09276.pdf

Bất kỳ ai đã từng cố gắng thay đổi chỉ một yếu tố trong một bản render lại của Stable Diffusion sẽ biết quá rõ rằng đối với mỗi chỉnh sửa thành công, hệ thống sẽ thay đổi năm thứ mà bạn thích chính xác như nó vốn là. Đây là một hạn chế hiện đang khiến nhiều người hâm mộ SD tài năng phải liên tục chuyển đổi giữa Stable Diffusion và Photoshop, để sửa chữa loại “tổn thất ngoài ý muốn” này. Từ góc độ này, thành tựu của Imagic dường như đáng chú ý.

Ở thời điểm viết bài, Imagic vẫn chưa có thậm chí một video quảng cáo, và given thái độ thận trọng của Google khi phát hành các công cụ tổng hợp hình ảnh không bị kiểm soát, điều không chắc chắn là chúng ta sẽ có cơ hội kiểm tra hệ thống này đến mức độ nào, nếu có.

Ứng dụng thứ hai là tính năng Xóa và Thay thế của Runway ML, một tính năng mới trong phần “Công cụ Ma thuật Trí tuệ Nhân tạo” của bộ công cụ tiện ích trực tuyến dựa trên học máy.

Tính năng Xóa và Thay thế của Runway ML, đã được xem trong một bản xem trước cho hệ thống chỉnh sửa video dựa trên văn bản. Nguồn: https://www.youtube.com/watch?v=41Qb58ZPO60

Tính năng Xóa và Thay thế của Runway ML, đã được xem trong một bản xem trước cho hệ thống chỉnh sửa video dựa trên văn bản. Nguồn: https://www.youtube.com/watch?v=41Qb58ZPO60

Hãy cùng xem xét ứng dụng của Runway trước.

Xóa và Thay thế

Giống như Imagic, Xóa và Thay thế chỉ liên quan đến hình ảnh tĩnh, mặc dù Runway đã xem trước cùng chức năng trong một giải pháp chỉnh sửa video dựa trên văn bản chưa được phát hành:

Mặc dù bất kỳ ai cũng có thể thử tính năng Xóa và Thay thế mới trên hình ảnh, nhưng phiên bản video chưa được phát hành công khai. Nguồn: https://twitter.com/runwayml/status/1568220303808991232

Mặc dù bất kỳ ai cũng có thể thử tính năng Xóa và Thay thế mới trên hình ảnh, nhưng phiên bản video chưa được phát hành công khai. Nguồn: https://twitter.com/runwayml/status/1568220303808991232

Mặc dù Runway ML chưa phát hành chi tiết về công nghệ đằng sau Xóa và Thay thế, tốc độ mà bạn có thể thay thế một cây cảnh trong nhà bằng một bức tượng Ronald Reagan khá thuyết phục cho thấy rằng một mô hình khuếch tán như Stable Diffusion (hoặc, ít có khả năng hơn, một mô hình DALL-E 2 được cấp phép) là động cơ đang tái tạo đối tượng của sự lựa chọn trong Xóa và Thay thế.

Thay thế một cây cảnh trong nhà bằng một bức tượng của The Gipper không nhanh như vậy, nhưng khá nhanh. Nguồn: https://app.runwayml.com/

Thay thế một cây cảnh trong nhà bằng một bức tượng của The Gipper không nhanh như vậy, nhưng khá nhanh. Nguồn: https://app.runwayml.com/

Hệ thống này có một số hạn chế kiểu DALL-E 2 – hình ảnh hoặc văn bản kích hoạt bộ lọc Xóa và Thay thế sẽ kích hoạt một cảnh báo về việc có thể bị đình chỉ tài khoản nếu tiếp tục vi phạm – gần như là một bản sao của chính sách của OpenAI đối với DALL-E 2.

Nhiều kết quả thiếu các cạnh thô đặc trưng của Stable Diffusion. Runway ML là nhà đầu tư và đối tác nghiên cứu trong SD, và có thể họ đã đào tạo một mô hình độc quyền vượt trội so với trọng số điểm kiểm tra 1.4 mã nguồn mở mà chúng ta đang vật lộn (giống như nhiều nhóm phát triển khác, nghiệp dư và chuyên nghiệp, đang đào tạo hoặc tinh chỉnh mô hình Stable Diffusion).

Thay thế một bàn ăn bằng một 'bàn làm bằng băng' trong Xóa và Thay thế của Runway ML.

Thay thế một bàn ăn bằng một ‘bàn làm bằng băng’ trong Xóa và Thay thế của Runway ML.

Giống như Imagic (xem dưới đây), Xóa và Thay thế là ‘hướng đối tượng’ – bạn không thể chỉ xóa một ‘phần trống’ của hình ảnh và tô lại nó với kết quả của lời nhắc văn bản; trong trường hợp đó, hệ thống sẽ đơn giản theo dõi đối tượng gần nhất dọc theo đường ngắm của mặt nạ (chẳng hạn như một bức tường hoặc một chiếc ti vi), và áp dụng biến đổi tại đó.

Như tên gọi cho thấy, bạn không thể tiêm các đối tượng vào không gian trống trong Xóa và Thay thế. Ở đây, nỗ lực triệu hồi chúa tể Sith nổi tiếng nhất kết thúc với một bức tranh tường Vader lạ trên ti vi, gần khu vực được vẽ.

Như tên gọi cho thấy, bạn không thể tiêm các đối tượng vào không gian trống trong Xóa và Thay thế. Ở đây, nỗ lực triệu hồi chúa tể Sith nổi tiếng nhất kết thúc với một bức tranh tường Vader lạ trên ti vi, gần khu vực được vẽ.

Khó xác định liệu Xóa và Thay thế có đang lảng tránh việc sử dụng hình ảnh có bản quyền (vẫn bị cản trở, mặc dù với mức độ thành công khác nhau, trong DALL-E 2), hoặc nếu mô hình được sử dụng trong động cơ kết xuất phía sau không được tối ưu hóa cho loại việc đó.

Tấm 'Tượng Nicole Kidman' hơi không an toàn cho người xem cho thấy mô hình khuếch tán được sử dụng ở đây thiếu sự từ chối có hệ thống việc kết xuất khuôn mặt thực tế hoặc nội dung khiêu dâm, trong khi kết quả cho các nỗ lực tạo ra tác phẩm có bản quyền dao động từ mơ hồ ('xenomorph') đến hài hước ('ngai vàng sắt'). Hình ảnh nguồn ở góc dưới bên phải.

Tấm ‘Tượng Nicole Kidman’ hơi không an toàn cho người xem cho thấy mô hình khuếch tán được sử dụng ở đây thiếu sự từ chối có hệ thống việc kết xuất khuôn mặt thực tế hoặc nội dung khiêu dâm, trong khi kết quả cho các nỗ lực tạo ra tác phẩm có bản quyền dao động từ mơ hồ (‘xenomorph’) đến hài hước (‘ngai vàng sắt’).

Sẽ rất thú vị khi biết phương pháp Xóa và Thay thế sử dụng để phân lập các đối tượng mà nó có thể thay thế. Có thể hình ảnh được chạy qua một số biến thể của CLIP, với các mục riêng biệt được xác định bởi nhận dạng đối tượng và phân đoạn ngữ nghĩa. Không có hoạt động nào trong số này hoạt động gần như tốt trong một cài đặt chung của Stable Diffusion.

Nhưng không có gì là hoàn hảo – đôi khi hệ thống dường như xóa và không thay thế, ngay cả khi (như chúng ta đã thấy trong hình ảnh trên), cơ chế kết xuất cơ bản chắc chắn biết ý nghĩa của lời nhắc văn bản. Trong trường hợp này, nó chứng minh là không thể biến một bàn cà phê thành một sinh vật ngoài Trái Đất – thay vào đó, bàn chỉ biến mất.

Một phiên bản đáng sợ hơn của 'Where's Waldo', khi Xóa và Thay thế không tạo ra một sinh vật ngoài Trái Đất.

Một phiên bản đáng sợ hơn của ‘Where’s Waldo’, khi Xóa và Thay thế không tạo ra một sinh vật ngoài Trái Đất.

Xóa và Thay thế dường như là một hệ thống thay thế đối tượng hiệu quả, với khả năng tô lại tuyệt vời. Tuy nhiên, nó không thể chỉnh sửa các đối tượng hiện có, mà chỉ có thể thay thế chúng. Để thực sự thay đổi nội dung hình ảnh hiện có mà không làm tổn hại đến vật liệu xung quanh là một nhiệm vụ khó khăn hơn, liên quan đến nỗ lực lâu dài của lĩnh vực nghiên cứu thị giác máy tính để đạt được phân tách trong các không gian tiềm ẩn của các khuôn khổ phổ biến.

Imagic

Đây là một nhiệm vụ mà Imagic giải quyết. Bài báo mới cung cấp nhiều ví dụ về các chỉnh sửa thành công các khía cạnh cá nhân của một bức ảnh trong khi giữ nguyên phần còn lại của hình ảnh.

Trong Imagic, các hình ảnh đã chỉnh sửa không bị giãn, biến dạng và 'đoán occlusion' đặc trưng của búp bê deepfake, sử dụng các prior hạn chế từ một hình ảnh duy nhất.

Trong Imagic, các hình ảnh đã chỉnh sửa không bị giãn, biến dạng và ‘đoán occlusion’ đặc trưng của búp bê deepfake, sử dụng các prior hạn chế từ một hình ảnh duy nhất.

Hệ thống sử dụng một quá trình ba giai đoạn – tối ưu hóa nhúng văn bản; tinh chỉnh mô hình; và cuối cùng, tạo ra hình ảnh đã chỉnh sửa.

Imagic mã hóa lời nhắc văn bản mục tiêu để lấy nhúng văn bản ban đầu, và sau đó tối ưu hóa kết quả để có được hình ảnh đầu vào. Sau đó, mô hình tạo ra được tinh chỉnh cho hình ảnh nguồn, thêm một loạt tham số, trước khi được đưa ra sự nội suy được yêu cầu.

Imagic mã hóa lời nhắc văn bản mục tiêu để lấy nhúng văn bản ban đầu, và sau đó tối ưu hóa kết quả để có được hình ảnh đầu vào. Sau đó, mô hình tạo ra được tinh chỉnh cho hình ảnh nguồn, thêm một loạt tham số, trước khi được đưa ra sự nội suy được yêu cầu.

Không ngạc nhiên, khuôn khổ này dựa trên kiến trúc văn bản-sang-video của Google’s Imagen, mặc dù các nhà nghiên cứu cho biết rằng các nguyên tắc của hệ thống này có thể áp dụng rộng rãi cho các mô hình khuếch tán tiềm ẩn.

Imagen sử dụng một kiến trúc ba tầng, thay vì mảng bảy tầng được sử dụng cho phiên bản văn bản-sang-video mới hơn của phần mềm. Ba mô-đun riêng biệt bao gồm một mô hình khuếch tán tạo ra hoạt động ở độ phân giải 64x64px; một mô hình siêu phân giải nâng cấp đầu ra này lên 256x256px; và một mô hình siêu phân giải bổ sung để đưa đầu ra lên đến độ phân giải 1024×1024.

Imagic can thiệp vào giai đoạn đầu tiên của quá trình này, tối ưu hóa nhúng văn bản được yêu cầu tại giai đoạn 64px với tốc độ học tĩnh 0,0001 trên bộ tối ưu hóa Adam.

Một lớp học chuyên về phân tách: những người dùng cuối đã cố gắng thay đổi một thứ gì đó đơn giản như màu sắc của một đối tượng được kết xuất trong một mô hình khuếch tán, GAN hoặc NeRF sẽ biết mức độ quan trọng của việc Imagic có thể thực hiện các biến đổi như vậy mà không 'phá vỡ' sự nhất quán của phần còn lại của hình ảnh.

Một lớp học chuyên về phân tách: những người dùng cuối đã cố gắng thay đổi một thứ gì đó đơn giản như màu sắc của một đối tượng được kết xuất trong một mô hình khuếch tán, GAN hoặc NeRF sẽ biết mức độ quan trọng của việc Imagic có thể thực hiện các biến đổi như vậy mà không ‘phá vỡ’ sự nhất quán của phần còn lại của hình ảnh.

Tinh chỉnh sau đó diễn ra trên mô hình cơ bản của Imagen, với 1500 bước cho mỗi hình ảnh đầu vào, có điều kiện trên nhúng đã sửa đổi. Đồng thời, lớp thứ hai 64px > 256px được tối ưu hóa song song trên hình ảnh có điều kiện. Các nhà nghiên cứu lưu ý rằng một tối ưu hóa tương tự cho lớp cuối cùng 256px > 1024px có ‘không hoặc rất ít’ ảnh hưởng đến kết quả cuối cùng, và do đó họ không thực hiện việc này.

Quá trình tối ưu hóa mất khoảng tám phút cho mỗi hình ảnh trên các chip TPUV4 đôi. Kết xuất cuối cùng diễn ra trong Imagen cốt lõi theo phương thức lấy mẫu DDIM.

Giống như các quá trình tinh chỉnh tương tự cho DreamBooth của Google, các nhúng kết quả có thể được sử dụng để cung cấp khả năng tạo kiểu cũng như các chỉnh sửa photorealistic chứa thông tin từ cơ sở dữ liệu rộng lớn hơn đang cung cấp năng lượng cho Imagen (vì, như cột đầu tiên dưới đây cho thấy, hình ảnh nguồn không có bất kỳ nội dung cần thiết nào để thực hiện các biến đổi này).

Chuyển động và chỉnh sửa photorealistic linh hoạt có thể được tạo ra thông qua Imagic, trong khi mã và mã phân tách được tạo ra trong quá trình này cũng có thể được sử dụng cho đầu ra được tạo kiểu.

Chuyển động và chỉnh sửa photorealistic linh hoạt có thể được tạo ra thông qua Imagic, trong khi mã và mã phân tách được tạo ra trong quá trình này cũng có thể được sử dụng cho đầu ra được tạo kiểu.

Các nhà nghiên cứu so sánh Imagic với các công việc trước đó SDEdit, một phương pháp dựa trên GAN từ năm 2021, một sự hợp tác giữa Đại học Stanford và Đại học Carnegie Mellon; và Text2Live, một sự hợp tác, từ tháng 4 năm 2022, giữa Viện Weizmann của Khoa học và NVIDIA.

So sánh trực quan giữa Imagic, SDEdit và Text2Live.

So sánh trực quan giữa Imagic, SDEdit và Text2Live.

Rõ ràng là các phương pháp trước đó đang gặp khó khăn, nhưng ở hàng dưới, liên quan đến việc chèn một sự thay đổi lớn về tư thế, các phương pháp hiện có hoàn toàn không thể tái tạo lại vật liệu nguồn so với thành công đáng kể từ Imagic.

Yêu cầu tài nguyên và thời gian đào tạo của Imagic trên mỗi hình ảnh, trong khi ngắn so với các tiêu chuẩn của những nỗ lực như vậy, khiến nó trở thành một ứng viên không thể thiếu trong một ứng dụng chỉnh sửa hình ảnh cục bộ trên máy tính cá nhân – và không rõ đến mức độ nào quá trình tinh chỉnh có thể được thu nhỏ đến mức tiêu dùng.

Hiện tại, Imagic là một đề xuất ấn tượng hơn phù hợp với các API – một môi trường mà Google Research, thận trọng với việc chỉ trích về việc tạo điều kiện cho deepfaking, có thể thoải mái hơn.

 

Được xuất bản lần đầu vào ngày 18 tháng 10 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai