Góc nhìn Anderson

Chỉnh sửa Đối tượng Hỗ trợ AI với Imagic của Google và ‘Xóa và Thay Thế’ của Runway

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Tuần này, hai thuật toán đồ họa dựa trên AI mới, nhưng có tính đối lập, đang cung cấp những cách mới cho người dùng cuối thực hiện các thay đổi cực kỳ chi tiết và hiệu quả đối với các đối tượng trong ảnh.

Đầu tiên là Imagic, thuộc Google Research, hợp tác với Viện Công nghệ Israel và Viện Khoa học Weizmann. Imagic cung cấp khả năng chỉnh sửa đối tượng dựa trên văn bản, với độ chi tiết cao thông qua việc tinh chỉnh các mô hình khuếch tán.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Ai đã từng cố gắng thay đổi chỉ một yếu tố trong bản tái tạo bằng Stable Diffusion đều biết rằng mỗi lần chỉnh sửa thành công, hệ thống sẽ thay đổi năm yếu tố khác mà bạn muốn giữ nguyên. Đây là một nhược điểm khiến nhiều người đam mê SD phải liên tục chuyển đổi giữa Stable Diffusion và Photoshop để khắc phục loại ‘thiệt hại phụ’ này. Chỉ từ góc nhìn này, những thành tựu của Imagic đã trở nên đáng chú ý.

Tại thời điểm viết bài, Imagic vẫn chưa có video quảng cáo nào, và với cáu kỉnh của Google trong việc công bố các công cụ tổng hợp hình ảnh không bị hạn chế, không rõ chúng ta sẽ có cơ hội thử nghiệm hệ thống này ở mức độ nào, nếu có.

Sản phẩm thứ hai là tính năng Erase and Replace dễ tiếp cận hơn của Runway ML, một tính năng mới trong mục ‘AI Magic Tools’ của bộ công cụ hiệu ứng hình ảnh dựa trên máy học chỉ có trực tuyến.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Hãy cùng xem phần trình bày của Runway trước tiên.

Xóa và Thay Thế

Giống như Imagic, Xóa và Thay Thế chỉ làm việc với hình ảnh tĩnh, mặc dù Runway đã trình diễn cùng chức năng trong một giải pháp chỉnh sửa văn bản thành video chưa được phát hành:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Mặc dù Runway ML chưa công bố chi tiết công nghệ phía sau Xóa và Thay Thế, tốc độ thay thế một cây cảnh trong nhà bằng một bức tượng Ronald Reagan tương đối thuyết phục cho thấy một mô hình khuếch tán như Stable Diffusion (hoặc ít có khả năng hơn, một phiên bản được cấp phép của DALL‑E 2) là động cơ tái tạo đối tượng bạn chọn trong Xóa và Thay Thế.

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/

Hệ thống có một số hạn chế kiểu DALL‑E 2 – các hình ảnh hoặc văn bản kích hoạt bộ lọc Xóa và Thay Thế sẽ gây ra cảnh báo về khả năng bị đình chỉ tài khoản nếu vi phạm tiếp – thực chất là một bản sao tiêu chuẩn của chính sách hiện hành của OpenAI cho DALL‑E 2.

Nhiều kết quả thiếu những khuyết điểm điển hình của Stable Diffusion. Runway ML là nhà đầu tư và đối tác nghiên cứu trong SD, và có khả năng họ đã huấn luyện một mô hình độc quyền vượt trội hơn các trọng số checkpoint 1.4 mã nguồn mở mà phần còn lại chúng ta đang phải vật lộn (khi nhiều nhóm phát triển, cả nghiệp dư và chuyên nghiệp, hiện đang huấn luyện hoặc tinh chỉnh các mô hình Stable Diffusion).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.

Giống như Imagic (xem bên dưới), Xóa và Thay Thế là ‘định hướng đối tượng’ – bạn không thể chỉ xóa một phần ‘trống’ của bức ảnh và tô màu lại bằng kết quả từ lời nhắc văn bản; trong trường hợp đó, hệ thống sẽ chỉ truy vết đối tượng gần nhất dọc theo đường nhìn của mặt nạ (như tường hoặc TV) và áp dụng biến đổi ở đó.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.

Rất khó để xác định liệu Xóa và Thay Thế có đang né tránh việc sử dụng hình ảnh có bản quyền (vẫn bị hạn chế đáng kể, dù thành công khác nhau, trong DALL‑E 2) hay mô hình được sử dụng trong engine dựng hình phía sau chỉ không được tối ưu cho loại trường hợp này.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.

Sẽ rất thú vị nếu biết Xóa và Thay Thế sử dụng phương pháp nào để tách riêng các đối tượng mà nó có thể thay thế. Có lẽ hình ảnh được đưa qua một biến thể của CLIP, với các mục riêng lẻ được xác định bằng nhận dạng đối tượng và phân đoạn ngữ nghĩa tiếp theo. Không một trong những thao tác này hoạt động hiệu quả trong một cài đặt thông thường của Stable Diffusion.

Nhưng không gì là hoàn hảo – đôi khi hệ thống dường như xóa mà không thay thế, ngay cả khi (như chúng ta đã thấy trong hình trên), cơ chế dựng hình nền chắc chắn hiểu ý nghĩa của lời nhắc văn bản. Trong trường hợp này, việc biến một bàn cà phê thành xenomorph là không thể – thay vào đó, bàn chỉ biến mất.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.

Xóa và Thay Thế dường như là một hệ thống thay thế đối tượng hiệu quả, với khả năng tô màu lại xuất sắc. Tuy nhiên, nó không thể chỉnh sửa các đối tượng đã tồn tại mà chỉ thay thế chúng. Thực sự thay đổi nội dung ảnh hiện có mà không làm ảnh hưởng đến môi trường xung quanh là một nhiệm vụ khó hơn nhiều, gắn liền với cuộc đấu tranh lâu dài của lĩnh vực nghiên cứu thị giác máy tính hướng tới tách rời trong các không gian tiềm ẩn của các khung phổ biến.

Imagic

Đó là nhiệm vụ mà Imagic giải quyết. Bài báo mới cung cấp nhiều ví dụ về các chỉnh sửa thành công thay đổi các khía cạnh riêng lẻ của một bức ảnh trong khi để lại phần còn lại của hình ảnh không thay đổi.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

Hệ thống sử dụng quy trình ba giai đoạn – tối ưu hoá nhúng văn bản; tinh chỉnh mô hình; và cuối cùng, tạo ra hình ảnh đã chỉnh sửa.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Không có gì ngạc nhiên khi khung làm việc dựa trên kiến trúc văn bản‑đến‑video Imagen của Google, mặc dù các nhà nghiên cứu cho biết các nguyên tắc của hệ thống có thể áp dụng rộng rãi cho các mô hình khuếch tán tiềm ẩn.

Imagen sử dụng kiến trúc ba tầng, thay vì mảng bảy tầng được dùng cho phiên bản văn bản‑đến‑video mới hơn của công ty. Ba mô-đun riêng biệt bao gồm một mô hình khuếch tán sinh ra hoạt động ở độ phân giải 64x64px; một mô hình siêu phân giải nâng đầu ra lên 256x256px; và một mô hình siêu phân giải bổ sung để đưa đầu ra lên đến độ phân giải 1024×1024.

Imagic can thiệp ở giai đoạn sớm nhất của quy trình này, tối ưu hoá nhúng văn bản yêu cầu ở mức 64px bằng bộ tối ưu Adam với tốc độ học tĩnh 0.0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.

Sau đó, quá trình tinh chỉnh diễn ra trên mô hình gốc của Imagen, với 1500 bước cho mỗi ảnh đầu vào, dựa trên nhúng đã chỉnh sửa. Đồng thời, lớp phụ 64px>256px được tối ưu song song trên ảnh đã điều kiện. Các nhà nghiên cứu lưu ý rằng việc tối ưu tương tự cho lớp cuối cùng 256px>1024px ‘hầu như không ảnh hưởng’ đến kết quả cuối cùng, vì vậy họ không thực hiện bước này.

Bài báo cho biết quá trình tối ưu mất khoảng tám phút cho mỗi ảnh trên hai chip TPUV4. Quá trình dựng hình cuối cùng diễn ra trong lõi Imagen theo sơ đồ lấy mẫu DDIM.

Tương tự như các quy trình tinh chỉnh cho DreamBooth của Google, các nhúng thu được còn có thể được dùng để tạo phong cách, cũng như các chỉnh sửa ảnh thực tế dựa trên thông tin từ cơ sở dữ liệu nền rộng hơn hỗ trợ Imagen (vì, như cột đầu tiên dưới đây cho thấy, các ảnh nguồn không có nội dung cần thiết để thực hiện những biến đổi này).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Các nhà nghiên cứu đã so sánh Imagic với các công trình trước đó SDEdit, một phương pháp dựa trên GAN từ năm 2021, hợp tác giữa Đại học Stanford và Đại học Carnegie Mellon; và Text2Live, một dự án hợp tác từ tháng 4/2022 giữa Viện Khoa học Weizmann và NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

A visual comparison between Imagic, SDEdit and Text2Live.

Rõ ràng các cách tiếp cận trước đây đang gặp khó khăn, nhưng ở hàng dưới, nơi cần thay đổi tư thế mạnh mẽ, các phương pháp hiện có hoàn toàn không thể tái tạo lại tài liệu nguồn, trong khi Imagic đạt được thành công đáng chú ý.

Yêu cầu tài nguyên và thời gian huấn luyện cho mỗi ảnh của Imagic, dù ngắn so với tiêu chuẩn của những nỗ lực này, khiến nó khó có khả năng được tích hợp vào ứng dụng chỉnh sửa ảnh cục bộ trên máy tính cá nhân – và chưa rõ quy trình tinh chỉnh có thể được thu nhỏ đến mức tiêu dùng như thế nào.

Hiện tại, Imagic là một sản phẩm ấn tượng, phù hợp hơn với các API – một môi trường mà Google Research, do lo ngại chỉ trích liên quan đến việc hỗ trợ deepfake, có thể cảm thấy thoải mái nhất.

 

Được xuất bản lần đầu vào ngày 18 tháng 10 năm 2022.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai