Mô hình và nền tảng AI

Chỉnh sửa hình ảnh ngữ nghĩa chính xác cao với EditGAN

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Mạng đối kháng sinh (GAN) hoặc GAN đã được áp dụng trong ngành công nghiệp chỉnh sửa hình ảnh. Trong vài tháng qua, EditGAN đã trở nên phổ biến trong ngành AI/ML vì nó là một phương pháp mới cho chỉnh sửa hình ảnh ngữ nghĩa chính xác cao và chất lượng cao.

Chúng tôi sẽ thảo luận về mô hình EditGAN chi tiết và cho bạn biết tại sao nó có thể trở thành một bước tiến quan trọng trong ngành công nghiệp chỉnh sửa hình ảnh ngữ nghĩa.

Vậy hãy bắt đầu. Nhưng trước khi chúng ta tìm hiểu EditGAN là gì, điều quan trọng là chúng ta phải hiểu tầm quan trọng của EditGAN và tại sao nó là một bước tiến quan trọng.

Tại sao EditGAN?

Mặc dù kiến trúc GAN truyền thống đã giúp ngành công nghiệp chỉnh sửa hình ảnh dựa trên AI tiến bộ đáng kể, nhưng vẫn có một số thách thức lớn khi xây dựng một kiến trúc GAN từ đầu.

  1. Trong giai đoạn đào tạo, kiến trúc GAN yêu cầu một lượng lớn dữ liệu đã được gắn nhãn với chú thích phân đoạn ngữ nghĩa.
  2. Chúng chỉ có thể cung cấp kiểm soát cấp cao.
  3. Và thường, chúng chỉ có thể nội suy giữa các hình ảnh.

Có thể thấy rằng mặc dù kiến trúc GAN truyền thống có thể hoàn thành công việc, nhưng chúng không hiệu quả cho việc triển khai rộng rãi. Hiệu suất kém của kiến trúc GAN truyền thống là lý do tại sao EditGAN được giới thiệu bởi NVIDIA (NVDA ) vào năm 2022.

EditGAN được đề xuất là một phương pháp hiệu quả cho chỉnh sửa hình ảnh ngữ nghĩa chính xác cao và chất lượng cao, với khả năng cho phép người dùng chỉnh sửa hình ảnh bằng cách thay đổi các mặt nạ phân đoạn chi tiết của hình ảnh.

Mô hình EditGAN được xây dựng trên một khung GAN mô hình hóa hình ảnh và phân đoạn ngữ nghĩa chung, và chỉ yêu cầu một lượng nhỏ dữ liệu đào tạo đã được gắn nhãn hoặc chú thích.

Các nhà phát triển EditGAN đã cố gắng nhúng hình ảnh vào không gian tiềm ẩn của GAN để hiệu chỉnh hình ảnh bằng cách thực hiện tối ưu hóa mã tiềm ẩn có điều kiện theo phân đoạn chỉnh sửa.

Kiến trúc của khung EditGAN cho phép mô hình học một số vectơ chỉnh sửa tùy ý có thể được áp dụng trực tiếp cho các hình ảnh khác với tốc độ cao và hiệu quả.

Để tóm tắt lý do tại sao chúng ta cần EditGAN, nó là khung chỉnh sửa hình ảnh dựa trên GAN đầu tiên cung cấp

  1. Chỉnh sửa chính xác cao.
  2. Có thể làm việc với một lượng nhỏ dữ liệu đã được gắn nhãn.
  3. Có thể được triển khai hiệu quả trong các tình huống thời gian thực.
  4. Cho phép thành phần cho nhiều chỉnh sửa đồng thời.
  5. Làm việc trên hình ảnh được tạo bởi GAN, hình ảnh thực được nhúng và thậm chí hình ảnh ngoài lĩnh vực.

Chỉnh sửa hình ảnh ngữ nghĩa chính xác cao với EditGAN

StyleGAN2, một khung GAN hiện đại cho tổng hợp hình ảnh, là thành phần tạo hình ảnh chính của EditGAN.

StyleGAN2 là một mô hình sinh tổng hợp sâu đã được đào tạo để tổng hợp hình ảnh chất lượng cao nhất có thể cùng với việc có được hiểu biết ngữ nghĩa về hình ảnh được mô hình hóa.

Đào tạo và suy luận phân đoạn

Mô hình EditGAN nhúng hình ảnh vào không gian tiềm ẩn của GAN bằng tối ưu hóa và một bộ mã hóa để thực hiện phân đoạn trên hình ảnh mới và đào tạo nhánh phân đoạn.

Kết quả là mô hình nhúng hình ảnh được chú thích từ tập dữ liệu vào không gian tiềm ẩn và sử dụng mất mát entropy chéo để đào tạo nhánh phân đoạn của bộ tạo.

Sử dụng chỉnh sửa phân đoạn để tìm ngữ nghĩa trong không gian tiềm ẩn

Mục đích chính của EditGAN là tận dụng phân phối chung của phân đoạn ngữ nghĩa và hình ảnh cho chỉnh sửa hình ảnh chính xác cao.

Giả sử chúng ta có một hình ảnh cần được chỉnh sửa, mô hình nhúng hình ảnh vào không gian tiềm ẩn của EditGAN hoặc sử dụng mẫu hình ảnh từ mô hình.

Sau đó, các nhà phát triển có thể sử dụng bất kỳ công cụ gắn nhãn hoặc sơn kỹ thuật số nào để sửa đổi phân đoạn và chỉnh sửa chúng theo yêu cầu của họ một cách thủ công.

Các cách chỉnh sửa khác nhau trong quá trình suy luận

Vectơ chỉnh sửa trong không gian tiềm ẩn thu được bằng tối ưu hóa có thể được mô tả là có ý nghĩa về mặt ngữ nghĩa và thường được tách ra với các thuộc tính khác nhau.

Vì vậy, để chỉnh sửa hình ảnh mới, mô hình có thể trực tiếp nhúng hình ảnh vào không gian tiềm ẩn và thực hiện các hoạt động chỉnh sửa giống như mô hình đã học trước đó, mà không cần thực hiện tối ưu hóa từ đầu.

Triển khai

Khung EditGAN được đánh giá trên hình ảnh thuộc bốn danh mục khác nhau: Xe hơi, Chim, Mèo và Mặt.

Kết quả

Kết quả định tính

Kết quả trong lĩnh vực

Hình ảnh trên cho thấy hiệu suất của khung EditGAN khi áp dụng vectơ chỉnh sửa đã học trước đó trên hình ảnh mới và tinh chỉnh hình ảnh bằng 30 bước tối ưu hóa.

Kết quả định lượng

Để đo lường khả năng chỉnh sửa hình ảnh của EditGAN một cách định lượng, mô hình sử dụng một điểm chuẩn chỉnh sửa nụ cười được giới thiệu lần đầu tiên bởi MaskGAN.

Giới hạn

Vì EditGAN dựa trên khung GAN, nó có cùng giới hạn như bất kỳ mô hình GAN nào khác: nó chỉ có thể làm việc với hình ảnh có thể được mô hình hóa bởi GAN.

Kết luận

Một trong những lý do chính tại sao GAN không phải là tiêu chuẩn công nghiệp trong lĩnh vực chỉnh sửa hình ảnh là do tính thực tế hạn chế của nó.

EditGAN nhằm giải quyết các vấn đề được trình bày bởi các khung GAN truyền thống và nó cố gắng trở thành một phương pháp hiệu quả cho chỉnh sửa hình ảnh ngữ nghĩa chất lượng cao và chính xác cao.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.