Góc nhìn Anderson

Cải thiện độ chính xác của chỉnh sửa hình ảnh AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

Mặc dù mô hình khuếch tán tiềm ẩn (LDM) Firefly của Adobe được coi là một trong những mô hình tốt nhất hiện có, nhưng người dùng Photoshop đã thử tính năng tạo ra của nó sẽ nhận thấy rằng nó không thể dễ dàng chỉnh sửa hình ảnh hiện có – thay vào đó, nó hoàn toàn thay thế khu vực được chọn của người dùng bằng hình ảnh dựa trên lời nhắc văn bản của người dùng (mặc dù Firefly rất giỏi trong việc tích hợp phần tạo ra vào ngữ cảnh của hình ảnh).

Trong phiên bản beta hiện tại, Photoshop có thể ít nhất tích hợp hình ảnh tham chiếu như một phần của lời nhắc hình ảnh, điều này giúp Adobe bắt kịp với loại chức năng mà người dùng Stable Diffusion đã tận hưởng trong hơn hai năm, nhờ vào các khung第三 bên như Controlnet:

Phiên bản beta hiện tại của Adobe Photoshop cho phép sử dụng hình ảnh tham chiếu khi tạo nội dung mới trong một lựa chọn - mặc dù nó là một việc may rủi tại thời điểm này.

Phiên bản beta hiện tại của Adobe Photoshop cho phép sử dụng hình ảnh tham chiếu khi tạo nội dung mới trong một lựa chọn – mặc dù nó là một việc may rủi tại thời điểm này.

Điều này minh họa một vấn đề mở trong nghiên cứu tổng hợp hình ảnh – khó khăn mà các mô hình khuếch tán gặp phải khi chỉnh sửa hình ảnh hiện có mà không thực hiện một sự “tái tưởng tượng” toàn diện của lựa chọn được chỉ định bởi người dùng.

Mặc dù sự khuếch tán dựa trên lời nhắc này tuân theo lời nhắc của người dùng, nhưng nó hoàn toàn tái tạo lại chủ đề của hình ảnh nguồn mà không xem xét hình ảnh gốc (ngoài việc trộn nội dung mới với môi trường).

Mặc dù sự khuếch tán dựa trên lời nhắc này tuân theo lời nhắc của người dùng, nhưng nó hoàn toàn tái tạo lại chủ đề của hình ảnh nguồn mà không xem xét hình ảnh gốc (ngoài việc trộn nội dung mới với môi trường).

Vấn đề này xảy ra vì LDM tạo ra hình ảnh thông qua làm giảm tiếng ồn lặp lại, nơi mỗi giai đoạn của quá trình được điều kiện bởi lời nhắc văn bản được cung cấp bởi người dùng. Với nội dung lời nhắc được chuyển đổi thành token nhúng, và với một mô hình siêu quy mô như Stable Diffusion hoặc Flux chứa hàng trăm nghìn (hoặc hàng triệu) token nhúng gần giống với lời nhắc, quá trình này có một phân phối có điều kiện được tính toán để nhắm tới; và mỗi bước được thực hiện là một bước tiến tới “mục tiêu phân phối có điều kiện” này.

Vậy đó là văn bản sang hình ảnh – một kịch bản mà người dùng “hy vọng vào điều tốt nhất”, vì không có cách nào biết chính xác kết quả tạo ra sẽ như thế nào.

Thay vào đó, nhiều người đã cố gắng sử dụng khả năng tạo ra mạnh mẽ của LDM để chỉnh sửa hình ảnh hiện có – nhưng điều này đòi hỏi một sự cân bằng giữa độ trung thực và tính linh hoạt.

Khi một hình ảnh được chiếu vào không gian tiềm ẩn của mô hình bằng các phương pháp như đảo ngược DDIM, mục tiêu là khôi phục hình ảnh gốc càng chính xác càng tốt trong khi vẫn cho phép thực hiện các chỉnh sửa có ý nghĩa. Vấn đề là, càng chính xác hình ảnh được tái tạo, mô hình càng tuân thủ cấu trúc gốc của nó, khiến việc thực hiện các chỉnh sửa lớn trở nên khó khăn.

Giống như nhiều khuôn khổ chỉnh sửa hình ảnh dựa trên khuếch tán được đề xuất trong những năm gần đây, kiến trúc Renoise gặp khó khăn khi thực hiện bất kỳ thay đổi thực sự nào đối với hình ảnh, với chỉ một dấu hiệu hình thức của một chiếc nơ xuất hiện ở đáy cổ của con mèo.

Giống như nhiều khuôn khổ chỉnh sửa hình ảnh dựa trên khuếch tán được đề xuất trong những năm gần đây, kiến trúc Renoise gặp khó khăn khi thực hiện bất kỳ thay đổi thực sự nào đối với hình ảnh, với chỉ một dấu hiệu hình thức của một chiếc nơ xuất hiện ở đáy cổ của con mèo.

Mặt khác, nếu quá trình này ưu tiên tính chỉnh sửa, mô hình sẽ giảm bớt sự kìm kẹp của nó đối với hình ảnh gốc, khiến việc giới thiệu các thay đổi trở nên dễ dàng hơn – nhưng với chi phí của sự nhất quán tổng thể với hình ảnh nguồn:

Nhiệm vụ thành công - nhưng đó là một sự chuyển đổi chứ không phải là một điều chỉnh, đối với hầu hết các khuôn khổ chỉnh sửa hình ảnh dựa trên AI.

Nhiệm vụ thành công – nhưng đó là một sự chuyển đổi chứ không phải là một điều chỉnh, đối với hầu hết các khuôn khổ chỉnh sửa hình ảnh dựa trên AI.

Vì nó là một vấn đề mà ngay cả tài nguyên đáng kể của Adobe cũng đang gặp khó khăn để giải quyết, thì chúng ta có thể coi đó là một thách thức đáng chú ý, và có thể không cho phép các giải pháp dễ dàng, nếu có.

Đảo ngược chặt chẽ

Do đó, các ví dụ trong một bài báo mới được phát hành trong tuần này đã thu hút sự chú ý của tôi, vì công việc này cung cấp một sự cải thiện đáng kể và đáng chú ý về trạng thái hiện tại của nghệ thuật trong lĩnh vực này, bằng cách chứng minh khả năng áp dụng các chỉnh sửa tinh tế và tinh vi cho hình ảnh được chiếu vào không gian tiềm ẩn của mô hình – mà không cần phải thay thế hoàn toàn hình ảnh gốc hoặc làm hỏng nội dung của hình ảnh nguồn:

Với Đảo ngược chặt chẽ được áp dụng cho các phương pháp đảo ngược hiện có, lựa chọn nguồn được xem xét một cách tinh tế hơn, và các biến đổi phù hợp với vật liệu gốc thay vì ghi đè lên nó.

Với Đảo ngược chặt chẽ được áp dụng cho các phương pháp đảo ngược hiện có, lựa chọn nguồn được xem xét một cách tinh tế hơn, và các biến đổi phù hợp với vật liệu gốc thay vì ghi đè lên nó.

Các nhà nghiên cứu và người đam mê LDM có thể nhận ra loại kết quả này, vì phần lớn nó có thể được tạo ra trong một quy trình phức tạp sử dụng các hệ thống bên ngoài như Controlnet và IP-Adapter.

Trên thực tế, phương pháp mới – được gọi là Đảo ngược chặt chẽ – thực sự tận dụng IP-Adapter, cùng với một mô hình dựa trên khuôn mặt chuyên dụng, cho các hình ảnh con người.

Từ bài báo gốc IP-Adapter năm 2023, các ví dụ về việc tạo ra các chỉnh sửa phù hợp cho vật liệu nguồn. Nguồn: https://arxiv.org/pdf/2308.06721

Từ bài báo gốc IP-Adapter năm 2023, các ví dụ về việc tạo ra các chỉnh sửa phù hợp cho vật liệu nguồn. Nguồn: https://arxiv.org/pdf/2308.06721

Thành tựu đáng kể của Đảo ngược chặt chẽ, thì, là đã quy trình hóa các kỹ thuật phức tạp thành một mô-đun plug-in đơn giản có thể được áp dụng cho các hệ thống hiện có, bao gồm nhiều phân phối LDM phổ biến nhất.

Tất nhiên, điều này có nghĩa là Đảo ngược chặt chẽ (TI), giống như các hệ thống phụ trợ mà nó tận dụng, sử dụng hình ảnh nguồn làm yếu tố điều kiện cho phiên bản chỉnh sửa của nó, thay vì chỉ dựa vào lời nhắc văn bản chính xác:

Các ví dụ khác về khả năng của Đảo ngược chặt chẽ trong việc áp dụng các chỉnh sửa tinh tế cho vật liệu nguồn.

Các ví dụ khác về khả năng của Đảo ngược chặt chẽ trong việc áp dụng các chỉnh sửa tinh tế cho vật liệu nguồn.

Mặc dù các tác giả thừa nhận rằng phương pháp của họ không miễn nhiễm với sự căng thẳng truyền thống và liên tục giữa độ trung thực và tính chỉnh sửa trong các kỹ thuật chỉnh sửa hình ảnh dựa trên khuếch tán, họ báo cáo kết quả đạt được trạng thái hiện tại khi tiêm TI vào các hệ thống hiện có, so với hiệu suất cơ bản.

Công việc mới này có tiêu đề Đảo ngược chặt chẽ: Đảo ngược có điều kiện hình ảnh cho chỉnh sửa hình ảnh thực, và đến từ năm nhà nghiên cứu trên khắp Đại học Tel Aviv và Snap Research.

Phương pháp

Ban đầu, một Mô hình Ngôn ngữ Lớn (LLM) được sử dụng để tạo ra một tập hợp các lời nhắc văn bản đa dạng từ đó một hình ảnh được tạo ra. Sau đó, đảo ngược DDIM được áp dụng cho mỗi hình ảnh với ba điều kiện văn bản: lời nhắc văn bản được sử dụng để tạo ra hình ảnh; một phiên bản rút gọn của cùng một lời nhắc; và một lời nhắc rỗng (trống).

Với tiếng ồn đảo ngược được trả về từ các quá trình này, hình ảnh được tạo ra lại với cùng điều kiện, và không có hướng dẫn phân loại miễn phí (CFG).

Điểm đảo ngược DDIM trên các chỉ số khác nhau với các thiết lập lời nhắc khác nhau.

Điểm đảo ngược DDIM trên các chỉ số khác nhau với các thiết lập lời nhắc khác nhau.

Như chúng ta có thể thấy từ biểu đồ trên, các điểm trên các chỉ số khác nhau được cải thiện với độ dài lời nhắc tăng. Các chỉ số được sử dụng là Tỷ lệ tín hiệu trên tiếng ồn đỉnh (PSNR); khoảng cách L2; Chỉ số tương đồng cấu trúc (SSIM); và Tương đồng hình ảnh mảng học được (LPIPS).

Ảnh-Conscious

Hiệu quả, Đảo ngược chặt chẽ thay đổi cách một mô hình khuếch tán chỉnh sửa hình ảnh thực bằng cách điều kiện quá trình đảo ngược trên hình ảnh itu, thay vì chỉ dựa vào lời nhắc văn bản.

Thông thường, việc đảo ngược một hình ảnh vào không gian tiếng ồn của mô hình khuếch tán đòi hỏi phải ước tính tiếng ồn ban đầu mà, khi làm giảm tiếng ồn, sẽ tái tạo hình ảnh đầu vào. Các phương pháp tiêu chuẩn sử dụng lời nhắc văn bản để hướng dẫn quá trình này; nhưng một lời nhắc không hoàn hảo có thể dẫn đến lỗi, mất chi tiết hoặc thay đổi cấu trúc.

Đảo ngược chặt chẽ thay vào đó sử dụng IP Adapter để cung cấp thông tin hình ảnh cho mô hình, để nó tái tạo hình ảnh với độ chính xác cao hơn, chuyển đổi hình ảnh nguồn thành token điều kiện, và chiếu chúng vào đường ống đảo ngược.

Các tham số này có thể chỉnh sửa: tăng ảnh hưởng của hình ảnh nguồn làm cho tái tạo gần như hoàn hảo, trong khi giảm nó cho phép thực hiện các thay đổi sáng tạo. Điều này làm cho Đảo ngược chặt chẽ hữu ích cho cả các chỉnh sửa tinh tế, chẳng hạn như thay đổi màu sắc của một chiếc áo, hoặc các chỉnh sửa quan trọng hơn, chẳng hạn như thay thế các đối tượng – mà không có các tác dụng phụ phổ biến của các phương pháp đảo ngược khác, chẳng hạn như mất chi tiết tinh tế hoặc các dị thường không mong muốn trong nội dung nền.

Các tác giả tuyên bố:

‘Chúng tôi lưu ý rằng Đảo ngược chặt chẽ có thể dễ dàng tích hợp với các phương pháp đảo ngược trước đó (ví dụ, DDPM thân thiện với chỉnh sửa, ReNoise) bằng cách [thay thế lõi khuếch tán gốc bằng mô hình IP Adapter đã thay đổi], [và] đảo ngược chặt chẽ liên tục cải thiện các phương pháp này về cả tái tạo và chỉnh sửa.’

Dữ liệu và Kiểm tra

Các nhà nghiên cứu đã đánh giá TI về khả năng tái tạo và chỉnh sửa hình ảnh nguồn thực. Tất cả các thí nghiệm sử dụng Stable Diffusion XL với lịch trình DDIM như được mô tả trong bài báo Stable Diffusion gốc; và tất cả các thử nghiệm sử dụng 50 bước làm giảm tiếng ồn tại mức hướng dẫn mặc định là 7,5.

Đối với điều kiện hình ảnh, IP-Adapter-plus sdxl vit-h đã được sử dụng. Đối với các thử nghiệm bước ít, các nhà nghiên cứu đã sử dụng SDXL-Turbo với lịch trình Euler, và cũng đã tiến hành các thí nghiệm với FLUX.1-dev, điều kiện mô hình trong trường hợp sau trên PuLID-Flux, sử dụng RF-Inversion tại 28 bước.

PulID được sử dụng chỉ trong các trường hợp có hình ảnh khuôn mặt, vì đây là lĩnh vực mà PulID được đào tạo để giải quyết – và mặc dù nó đáng chú ý rằng một hệ thống con chuyên dụng được sử dụng cho một loại lời nhắc này, sự quan tâm không bình thường của chúng tôi trong việc tạo ra hình ảnh khuôn mặt cho thấy rằng việc dựa vào các trọng số rộng của một mô hình cơ sở như Stable Diffusion có thể không đủ để đáp ứng các tiêu chuẩn mà chúng tôi yêu cầu cho nhiệm vụ này.

Các thử nghiệm tái tạo được thực hiện để đánh giá định lượng và định tính. Trong hình ảnh dưới đây, chúng ta thấy các ví dụ định tính cho đảo ngược DDIM:

Kết quả định tính cho đảo ngược DDIM. Mỗi hàng hiển thị một hình ảnh chi tiết cao cùng với các phiên bản tái tạo của nó, với mỗi bước sử dụng các điều kiện tiến bộ hơn trong quá trình đảo ngược và làm giảm tiếng ồn. Khi điều kiện trở nên chính xác hơn, chất lượng tái tạo được cải thiện. Cột phải nhất cho thấy kết quả tốt nhất, nơi hình ảnh gốc được sử dụng làm điều kiện, đạt được độ trung thực cao nhất. CFG không được sử dụng ở bất kỳ giai đoạn nào. Vui lòng tham khảo tài liệu nguồn để có độ phân giải và chi tiết tốt hơn.

Kết quả định tính cho đảo ngược DDIM. Mỗi hàng hiển thị một hình ảnh chi tiết cao cùng với các phiên bản tái tạo của nó, với mỗi bước sử dụng các điều kiện tiến bộ hơn trong quá trình đảo ngược và làm giảm tiếng ồn. Khi điều kiện trở nên chính xác hơn, chất lượng tái tạo được cải thiện. Cột phải nhất cho thấy kết quả tốt nhất, nơi hình ảnh gốc được sử dụng làm điều kiện, đạt được độ trung thực cao nhất. CFG không được sử dụng ở bất kỳ giai đoạn nào. Vui lòng tham khảo tài liệu nguồn để có độ phân giải và chi tiết tốt hơn.

Bài báo tuyên bố:

‘Những ví dụ này minh họa rằng việc điều kiện quá trình đảo ngược trên một hình ảnh cải thiện đáng kể tái tạo trong các khu vực chi tiết cao.

‘Đáng chú ý, trong ví dụ thứ ba của [hình ảnh dưới đây], phương pháp của chúng tôi tái tạo thành công hình xăm trên lưng của người đấu vật bên phải. Hơn nữa, tư thế chân của người đấu vật được bảo tồn chính xác hơn, và hình xăm trên chân trở nên rõ ràng.’

Kết quả định tính thêm cho đảo ngược DDIM. Các điều kiện mô tả cải thiện đảo ngược DDIM, với điều kiện hình ảnh vượt trội so với văn bản, đặc biệt là trên hình ảnh phức tạp.

Kết quả định tính thêm cho đảo ngược DDIM. Các điều kiện mô tả cải thiện đảo ngược DDIM, với điều kiện hình ảnh vượt trội so với văn bản, đặc biệt là trên hình ảnh phức tạp.

Các tác giả cũng đã kiểm tra Đảo ngược chặt chẽ như một mô-đun plug-in cho các hệ thống hiện có, so sánh các phiên bản đã sửa đổi với hiệu suất cơ bản.

Ba hệ thống được thử nghiệm là đảo ngược DDIM và RF-Inversion đã đề cập; và cũng ReNoise, mà chia sẻ một số tác giả với bài báo đang được thảo luận ở đây. Vì kết quả DDIM không gặp khó khăn trong việc đạt được tái tạo 100%, các nhà nghiên cứu chỉ tập trung vào tính chỉnh sửa.

(Các hình ảnh kết quả định tính được định dạng theo cách khó tái tạo ở đây, vì vậy chúng tôi đề nghị người đọc tham khảo tài liệu PDF nguồn để có độ phân giải và sự rõ ràng tốt hơn, mặc dù một số lựa chọn được giới thiệu dưới đây)

Trái, kết quả tái tạo định tính cho Đảo ngược chặt chẽ với SDXL. Phải, tái tạo với Flux. Bố cục của những kết quả này trong công việc được xuất bản khiến nó khó tái tạo ở đây, vì vậy vui lòng tham khảo tài liệu PDF nguồn để có ấn tượng thực sự về sự khác biệt đạt được.

Trái, kết quả tái tạo định tính cho Đảo ngược chặt chẽ với SDXL. Phải, tái tạo với Flux. Bố cục của những kết quả này trong công việc được xuất bản khiến nó khó tái tạo ở đây, vì vậy vui lòng tham khảo tài liệu PDF nguồn để có ấn tượng thực sự về sự khác biệt đạt được.

Tại đây, các tác giả nhận xét:

‘Như được minh họa, tích hợp Đảo ngược chặt chẽ với các phương pháp hiện có liên tục cải thiện tái tạo. Đối với [ví dụ,] phương pháp của chúng tôi tái tạo chính xác tay cầm ở ví dụ bên trái nhất và người đàn ông với áo sơ mi màu xanh ở ví dụ bên phải nhất [trong hình 5 của bài báo].’

Các tác giả cũng đã kiểm tra hệ thống định lượng. Theo các công việc trước, họ đã sử dụng tập hợp xác thực của MS-COCO, và lưu ý rằng kết quả (minh họa dưới đây) đã cải thiện tái tạo trên tất cả các chỉ số cho tất cả các phương pháp.

So sánh các chỉ số về hiệu suất của các hệ thống với và không có Đảo ngược chặt chẽ.

So sánh các chỉ số về hiệu suất của các hệ thống với và không có Đảo ngược chặt chẽ.

Tiếp theo, các tác giả đã kiểm tra khả năng chỉnh sửa ảnh của hệ thống, so sánh nó với các phiên bản cơ bản của các phương pháp trước đó prompt2prompt; DDPM thân thiện với chỉnh sửa; LED-ITS++; và RF-Inversion.

Hiển thị dưới đây là một số kết quả định tính của bài báo cho SDXL và Flux (và chúng tôi đề nghị người đọc tham khảo bố cục khá nén của bài báo gốc để có thêm ví dụ).

Một số kết quả định tính rải rác trong bài báo. Chúng tôi đề nghị người đọc tham khảo tài liệu PDF nguồn để có độ phân giải và sự rõ ràng tốt hơn.

Một số kết quả định tính rải rác trong bài báo. Chúng tôi đề nghị người đọc tham khảo tài liệu PDF nguồn để có độ phân giải và sự rõ ràng tốt hơn.

Các tác giả cho rằng Đảo ngược chặt chẽ liên tục vượt trội so với các kỹ thuật đảo ngược hiện có bằng cách đạt được sự cân bằng tốt hơn giữa tái tạo và chỉnh sửa. Các phương pháp tiêu chuẩn như đảo ngược DDIM và ReNoise có thể tái tạo lại hình ảnh, bài báo cho biết rằng chúng thường gặp khó khăn trong việc bảo tồn các chi tiết tinh tế khi các chỉnh sửa được áp dụng.

Ngược lại, Đảo ngược chặt chẽ tận dụng điều kiện hình ảnh để neo đầu ra của mô hình gần hơn với hình ảnh gốc, ngăn chặn các biến dạng không mong muốn. Các tác giả cho rằng ngay cả khi các phương pháp cạnh tranh tạo ra tái tạo đường như chính xác, việc giới thiệu các chỉnh sửa thường dẫn đến các tác phẩm hoặc sự không nhất quán về cấu trúc, và Đảo ngược chặt chẽ giảm thiểu những vấn đề này.

Cuối cùng, các kết quả định lượng đã được thu được bằng cách đánh giá Đảo ngược chặt chẽ so với bộ thử nghiệm MagicBrush, sử dụng đảo ngược DDIM và LEDITS++, đo bằng CLIP Sim.

So sánh định lượng của Đảo ngược chặt chẽ so với bộ thử nghiệm MagicBrush.

So sánh định lượng của Đảo ngược chặt chẽ so với bộ thử nghiệm MagicBrush.

Các tác giả kết luận:

‘Trong cả hai biểu đồ, sự đánh đổi giữa bảo tồn hình ảnh và tuân thủ chỉnh sửa được quan sát rõ ràng. Đảo ngược chặt chẽ cung cấp sự kiểm soát tốt hơn về sự đánh đổi này và bảo tồn tốt hơn hình ảnh đầu vào trong khi vẫn tuân thủ chỉnh sửa [lời nhắc]. ‘

‘Lưu ý rằng, một sự tương đồng CLIP của trên 0,3 giữa một hình ảnh và một lời nhắc văn bản cho thấy sự phù hợp giữa hình ảnh và lời nhắc.’

Kết luận

Mặc dù nó không đại diện cho một “đột phá” trong một trong những thách thức khó khăn nhất trong tổng hợp hình ảnh dựa trên LDM, Đảo ngược chặt chẽ hợp nhất một số phương pháp phụ trợ khó khăn thành một phương pháp thống nhất của chỉnh sửa hình ảnh dựa trên AI.

Mặc dù sự căng thẳng giữa tính chỉnh sửa và độ trung thực không biến mất dưới phương pháp này, nó được giảm đáng kể, theo kết quả được trình bày. Xem xét rằng thách thức trung tâm mà công việc này giải quyết có thể chứng minh là không thể nếu xử lý theo các điều khoản của nó (thay vào đó là nhìn vượt ra ngoài các kiến trúc dựa trên LDM trong các hệ thống tương lai), Đảo ngược chặt chẽ đại diện cho một cải thiện đáng hoan nghênh trong tình trạng hiện tại.

 

Được xuất bản lần đầu vào thứ Sáu, ngày 28 tháng 2 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai