Mô hình và nền tảng AI
BrushNet: Tích hợp và Chơi Image Inpainting với Khả năng Khử nhiễu Kép
Image inpainting là một trong những vấn đề kinh điển trong tầm nhìn máy tính, và nó nhằm mục đích khôi phục các vùng bị che khuất trong một hình ảnh với nội dung tự nhiên và hợp lý. Các công việc hiện có sử dụng các kỹ thuật inpainting hình ảnh truyền thống như Mạng đối kháng tạo sinh (GAN) và Mã hóa tự động biến đổi (VAE) thường yêu cầu các tính năng được thiết kế bằng tay nhưng đồng thời không mang lại kết quả thỏa mãn. Trong những năm qua, các phương pháp dựa trên sự khuếch tán đã trở nên phổ biến trong cộng đồng tầm nhìn máy tính nhờ khả năng tạo ra hình ảnh chất lượng cao, đa dạng và kiểm soát tinh tế. Các nỗ lực ban đầu trong việc sử dụng mô hình khuếch tán cho inpainting hình ảnh hướng dẫn bằng văn bản đã sửa đổi chiến lược làm sạch bằng cách lấy mẫu các vùng bị che khuất từ một mô hình khuếch tán được đào tạo trước và các vùng không bị che khuất từ hình ảnh đã cho.
Mặc dù những tiến bộ, nghiên cứu và phát triển của những mô hình này trong những năm qua, inpainting hình ảnh vẫn là một chướng ngại vật lớn cho các nhà phát triển tầm nhìn máy tính. Các thích nghi hiện tại của mô hình khuếch tán cho các nhiệm vụ inpainting hình ảnh liên quan đến việc sửa đổi chiến lược lấy mẫu hoặc phát triển mô hình inpainting chuyên dụng thường bị giảm chất lượng hình ảnh và không nhất quán về ngữ nghĩa. Để giải quyết những thách thức này và mở đường cho các mô hình inpainting hình ảnh, trong bài viết này, chúng tôi sẽ thảo luận về BrushNet, một khuôn khổ mới được thiết kế để tích hợp và chơi với khả năng khử nhiễu kép, giúp đảm bảo sự nhất quán và kết quả được cải thiện trên các nhiệm vụ inpainting hình ảnh.

Bài viết này nhằm mục đích giới thiệu khuôn khổ BrushNet một cách chi tiết, và chúng tôi sẽ khám phá cơ chế, phương pháp, kiến trúc của khuôn khổ cùng với so sánh với các khuôn khổ hiện đại. Vậy hãy bắt đầu.
BrushNet: Inpainting Hình ảnh với Khả năng Khử nhiễu Kép
Inpainting hình ảnh, một phương pháp nhằm khôi phục các vùng bị che khuất của một hình ảnh trong khi duy trì sự nhất quán tổng thể, đã là một vấn đề lâu dài trong lĩnh vực tầm nhìn máy tính và đã gây khó khăn cho các nhà phát triển và nhà nghiên cứu trong một vài năm nay. Inpainting hình ảnh tìm thấy ứng dụng của nó trong nhiều nhiệm vụ tầm nhìn máy tính khác nhau, bao gồm chỉnh sửa hình ảnh và thử nghiệm ảo.
Các phương pháp được sử dụng bởi các khuôn khổ inpainting hình ảnh truyền thống dựa trên sự khuếch tán có thể được chia thành hai loại, Sửa đổi Chiến lược Lấy mẫu và Mô hình Inpainting Chuyên dụng. Phương pháp sửa đổi chiến lược lấy mẫu sửa đổi quá trình làm sạch bằng cách lấy mẫu các vùng bị che khuất từ một mô hình khuếch tán được đào tạo trước và sao chép các vùng không bị che khuất từ hình ảnh đã cho trong mỗi bước làm sạch. Mặc dù các phương pháp sửa đổi chiến lược lấy mẫu có thể được thực hiện trong các mô hình khuếch tán tùy ý, chúng thường dẫn đến kết quả inpainting không nhất quán vì chúng có kiến thức nhận thức hạn chế về ranh giới mặt nạ và ngữ cảnh vùng hình ảnh không bị che khuất.
Như được minh họa trong hình ảnh sau, các mô hình inpainting chuyên dụng kết hợp tiềm ẩn hình ảnh bị che khuất, tiềm ẩn nhiễu, văn bản và mặt nạ tại một giai đoạn sớm. Thiết kế kiến trúc của các mô hình inpainting chuyên dụng như vậy dễ bị ảnh hưởng bởi các tính năng hình ảnh bị che khuất và ngăn cản các lớp tiếp theo trong kiến trúc UNet nhận được các tính năng hình ảnh bị che khuất thuần túy do ảnh hưởng của văn bản.

Có thể nghĩ rằng việc thêm một nhánh chuyên dụng để trích xuất các tính năng hình ảnh bị che khuất có thể là một giải pháp phù hợp cho các vấn đề trên, tuy nhiên, các khuôn khổ hiện có thường dẫn đến trích xuất và chèn thông tin không đầy đủ khi áp dụng trực tiếp cho inpainting. Kết quả là, các khuôn khổ như ControlNet cho ra kết quả không thỏa mãn khi so sánh với các mô hình inpainting chuyên dụng.
- Thay vì khởi tạo các lớp convolution một cách ngẫu nhiên, khuôn khổ BrushNet thực hiện một bộ mã hóa VAE để xử lý hình ảnh bị che khuất. Kết quả là, BrushNet có thể trích xuất các tính năng hình ảnh cho việc thích nghi với phân phối UNet một cách hiệu quả hơn.
- Khuôn khổ BrushNet dần dần kết hợp toàn bộ lớp tính năng UNet vào kiến trúc UNet được đào tạo trước, một cách tiếp cận phân cấp cho phép kiểm soát pixel dày đặc.
- Khuôn khổ BrushNet loại bỏ sự chú ý chéo văn bản khỏi thành phần UNet để đảm bảo rằng chỉ có thông tin hình ảnh thuần túy được xem xét trong nhánh bổ sung. Hơn nữa, mô hình BrushNet cũng đề xuất việc thực hiện một chiến lược trộn mờ để đạt được sự nhất quán tốt hơn cùng với khả năng kiểm soát cao hơn trong các vùng hình ảnh không bị che khuất.
BrushNet : Phương pháp và Kiến trúc
Hình ảnh sau đây cho chúng ta một cái nhìn tổng quan về khuôn khổ BrushNet.

Như có thể quan sát được, khuôn khổ sử dụng một chiến lược phân nhánh kép cho việc chèn hướng dẫn hình ảnh bị che khuất và sử dụng các hoạt động trộn với một mặt nạ mờ để đảm bảo sự bảo tồn tốt hơn của các vùng không bị che khuất. Điều đáng chú ý là khuôn khổ BrushNet có khả năng điều chỉnh tỷ lệ bổ sung để đạt được kiểm soát linh hoạt.
Hướng dẫn Hình ảnh Bị che khuất
Khuôn khổ BrushNet chèn tính năng hình ảnh bị che khuất vào mạng khuếch tán được đào tạo trước bằng cách sử dụng một nhánh bổ sung, tách biệt quá trình trích xuất tính năng hình ảnh bị che khuất khỏi quá trình tạo hình ảnh.
Hoạt động Trộn
Như đã đề cập trước đó, việc thực hiện hoạt động trộn trong không gian tiềm ẩn thường dẫn đến việc thay đổi kích thước mặt nạ, điều này có thể dẫn đến một số sai sót.
Kiểm soát Linh hoạt
Thiết kế kiến trúc của khuôn khổ BrushNet làm cho nó trở thành một lựa chọn phù hợp cho các tích hợp và chơi với các mô hình khuếch tán được đào tạo trước, và cho phép kiểm soát linh hoạt tỷ lệ bảo tồn.
BrushNet : Triển khai và Kết quả
Để phân tích kết quả của nó, khuôn khổ BrushNet đề xuất BrushBench, một tập dữ liệu inpainting hình ảnh dựa trên phân đoạn với hơn 600 hình ảnh, mỗi hình ảnh đi kèm với một mặt nạ và chú thích được chú thích bởi con người.
So sánh Định lượng
Bảng sau đây so sánh khuôn khổ BrushNet với các mô hình inpainting hình ảnh dựa trên sự khuếch tán hiện có trên tập dữ liệu BrushBench với mô hình Stable Diffusion làm mô hình cơ sở.

Như có thể quan sát được, khuôn khổ BrushNet cho thấy hiệu suất đáng kể trên các nhiệm vụ bảo tồn vùng bị che khuất, căn chỉnh văn bản và chất lượng hình ảnh.
So sánh Chất lượng
Hình ảnh sau đây so sánh khuôn khổ BrushNet với các phương pháp inpainting hình ảnh hiện có, với kết quả bao gồm trí tuệ nhân tạo và hình ảnh tự nhiên trên các nhiệm vụ inpainting khác nhau.

Như có thể quan sát được, khuôn khổ BrushNet mang lại kết quả đáng kể về sự nhất quán của vùng không bị che khuất và vùng bị che khuất, và thành công trong việc nhận thức thông tin nền.
Lời Kết
Trong bài viết này, chúng tôi đã thảo luận về BrushNet, một khuôn khổ mới được thiết kế để tích hợp và chơi với khả năng khử nhiễu kép, giúp đảm bảo sự nhất quán và kết quả được cải thiện trên các nhiệm vụ inpainting hình ảnh. Khuôn khổ BrushNet giới thiệu một mô hình mới trong đó khuôn khổ chia tính năng hình ảnh và tiềm ẩn nhiễu thành các nhánh riêng biệt.












